문제: 음성 모델을 바꾸지 않고 처리 용량 확보
보관 음성 전사 서비스는 정해진 품질 목표를 충족하면서 더 많은 오디오를 처리해야 합니다. ProsGrow는 MLPerf Inference v6.0의 공개 Whisper 구현에서 시작해 RTX PRO 6000 Blackwell GPU 8개 노드에서 지원되는 설정을 재현했습니다. 전체 시간 기준 테스트의 처리량은 초당 오디오 샘플 291.771개였습니다.
엔진 배칭 동작을 분석한 결과 공개 설정이 이 시스템에 최적은 아니었습니다. 지원되는 설정을 조정해 두 차례 전체 시간 실행에서 초당 299.444개 샘플, 즉 동일 GPU 8개에서 2.63% 더 높은 처리량을 달성했습니다. 선택한 설정은 벤치마크 정확도 기준도 통과했습니다.
기준 → ProsGrow 튜닝
| 로컬 구성 | 오디오 샘플/초 | 샘플/초/GPU | 로컬 기준 대비 향상 |
|---|---|---|---|
| 공개 설정 · 기준 | 291.771 | 36.471 | — |
| 선택 설정 · 실행 1 | 299.628 | 37.454 | 2.69% |
| 선택 설정 · 실행 2, 관측 최저값 | 299.260 | 37.408 | 2.57% |
| 선택 설정 · 두 실행 평균 | 299.444 | 37.431 | 2.63% |
튜닝한 두 실행의 차이는 평균의 0.123%에 불과했습니다. 보수적인 용량 계획에는 관측된 낮은 결과인 초당 299.260개 샘플을 사용합니다. 기준은 전체 시간 측정 1회, 튜닝 설정은 2회입니다.
프로파일링으로 확인한 엔진 배칭 동작
선택한 두 실행에서 평균 GPU 활용률은 94.417%에서 97.373% 및 97.312%로 증가했습니다. 처리량 결과와 함께 보면 개선된 배칭 주기가 용량 회복의 원인이라는 설명을 뒷받침합니다. 이는 원격 측정에서 도출한 추론이며 문서화되지 않은 엔진 내부 동작에 대한 주장은 아닙니다.
ProsGrow는 전체 파이프라인을 평가하고 지원되는 엔진 설정을 선택한 뒤 전체 시간 반복 실행과 별도 정확도 검사로 검증했습니다. 공개 소스, 체크포인트, 데이터셋, 디코딩 동작, LoadGen 시드, 평가기를 고정했습니다. 동일 FP16 원본 체크포인트와 NVFP4 디코더 행렬 곱셈 플러그인을 계속 사용했으며 소스 성능 패치는 활성화하지 않았습니다.
절충: 활성 전력이 조금 늘고 처리량은 증가
첫 번째 튜닝 전체 실행에서 평균 GPU 총전력은 3,428 W에서 3,508 W로 늘었고 처리량은 2.69% 증가했습니다. 원본 오디오 1,000시간당 GPU 에너지는 0.4885에서 0.4868 kWh로 조금 낮아졌습니다. 용량 향상에 실측 에너지 효율 저하는 수반되지 않았지만 에너지 차이는 작습니다.
품질은 명시적인 통과 조건이었습니다. 튜닝 설정의 AccuracyOnly 실행은 전체 1,633개 샘플을 다뤘으며 MLCommons 평가기로 단어 오류율 2.131770%를 기록해 허용치 3.046429%보다 낮았습니다. 이는 평가 코퍼스에서의 통과 결과이며, 이번 비교에서 로컬 기준은 별도 정확도 실행을 거치지 않았습니다.
외부 비교: 더 적은 GPU로 비슷한 처리량
보고서의 주요 공개 Whisper 비교 대상은 HPE의 GPU 8개 결과인 초당 294.821개 샘플입니다. 우리의 평균 초당 299.444개 샘플은 노드 처리량이 1.57% 높은 결과입니다. 두 시스템 모두 RTX PRO 6000 GPU 8개를 쓰지만 호스트와 소프트웨어 세부 사항이 다릅니다.
검토한 공개 MLPerf v6.0 스냅샷에는 HPE의 GPU 10개 결과인 초당 297.661개 샘플도 포함됩니다. 로컬 GPU 8개 평균은 가속기 수가 20% 적으면서 0.60% 높았습니다. GPU 수로 나누면 GPU당 초당 37.431개 대 29.766개 샘플로 25.75% 차이입니다.
이는 시스템 효율을 이해하는 데 유용한 맥락입니다. 자체 노드에서 분리해 측정한 엔지니어링 차이는 엔진 설정 선택으로 얻은 2.63% 향상입니다. 외부 비교에는 호스트와 소프트웨어 스택 차이도 포함되므로 GPU당 전체 우위를 이 한 가지 변경에 돌릴 수 없습니다.
전사 서비스에 미치는 변화
평가 코퍼스에서 두 실행 평균은 실제 1시간당 원본 오디오 약 7,202시간이며 기준은 7,017시간입니다. 벤치마크 평균 클립 길이로 환산하면 활성 노드 시간당 약 185시간의 원본 오디오를 추가 처리합니다. 지속적인 아카이브 적체가 있는 서비스는 동일한 설치 GPU로 처리 시간을 줄일 수 있습니다.
ProsGrow는 처리량, 전사 품질, 대기열 체류 시간, 데이터 경계를 기준으로 아카이브 전사를 검증합니다. 실시간 전사는 동시 연결, 부분 결과 동작, 최종 확정 지연, 복구 등 별도의 서비스 요건이 필요합니다. Offline 샘플 속도로 실시간 스트림 용량을 결정할 수는 없습니다.
유료 수요 10%일 때의 음성 처리 비용
9월 15일 역량 보고서는 $100,000 노드, 3년 감가상각, 벤치마크 대비 서비스 효율 70%, 유료 수요 10%를 적용해 판매 오디오 분당 $0.0001321로 모델링합니다. 당시 API 가격 입력은 OpenAI 호스팅 whisper-1 분당 $0.006과 Deepgram Nova-3 단일 언어 사전 녹음 PAYG 분당 $0.0043입니다. 모델링한 인프라 수치는 각각 97.80%, 96.93% 낮습니다.
계산은 실측 용량을 경과 시간당 약 30,247.5분의 판매 오디오로 환산한 뒤 시간당 인프라 비용 약 $3.995를 그 용량으로 나눕니다. 비용에는 하드웨어 감가상각 $100,000 ÷ (3 × 8,760시간)과 $0.10/kWh 전기료가 포함됩니다. 전체 노드 전력은 유휴 1.5 kW, 활성 5.5 kW로 가정하고 수요 10%로 가중합니다. 서비스 효율과 유료 수요는 별도 가정입니다.
시간당 비용과 다른 가정을 고정하면 실측 처리량 2.63% 향상만으로 단위 비용은 약 2.56% 감소합니다. API 가격과의 더 큰 격차는 전용 배치 용량의 모델링된 경제성에서 나오며 수요에 크게 의존합니다.
이는 인프라 비용과 가격의 비교이며 입증된 고객 절감액이 아닙니다. 유지보수, 냉각/PUE, 인건비, 네트워크, 스토리지, 지원, 이중화, SLA 예비 용량은 제외합니다. 로컬 Whisper Large v3, 호스팅 whisper-1, Nova-3는 모델과 서비스 기능이 다르며 동등한 서비스 품질은 확인하지 않았습니다.
Granite API 및 실시간 음성
보고서는 별도의 Granite 대기열 API 서비스도 측정합니다. 호스트 배치와 요청 배칭으로 처리량이 19,062.88에서 28,368.99 RTFx로 증가해 원래 로컬 API 기준 대비 48.82% 향상했습니다. RTFx는 실제 1초당 처리하는 오디오 초 수입니다. 배치 API는 62,880개 발화를 평가했고 퇴행 출력은 없었으며 최악 WER은 3.4942%였습니다.
Granite의 별도 비동기 Offline 결과는 68,932.91 RTFx입니다. 보고서의 실시간 ASR 시험은 동일 호스트의 세 차례 24초 루프백 테스트에서 WebSocket 연결 5,568개를 유지했습니다. 모델, 평가 방식, 측정 범위가 서로 다릅니다. 각 주요 결과는 별도 시험에서 노드를 점유한 것이며 외부 트래픽, 장기 실시간 운영, 복구는 추가 검증이 필요합니다.
방법론 및 한계
- 시스템 및 스택: 2026년 8월 20~21일 시험에서 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 8개, AMD EPYC 9575F CPU 2개, TensorRT 10.14.1.48, TensorRT-LLM 1.3.0rc0, CUDA 13.1을 사용했습니다. 공개 참조 코드와 모델/데이터 해시를 고정하고 확인했습니다.
- 워크로드 및 단위: MLPerf Whisper 데이터 요건은 LibriSpeech를 모노 16 kHz 오디오 샘플 1,633개로 재구성합니다. 각 샘플에는 30초로 패딩한 Whisper 연산이 필요하며 실제 원본 길이는 평균 24.0505초입니다. 오디오 샘플/초, 생성 토큰/초, 원본 오디오 시간은 서로 다른 단위입니다.
- 성능 유효성: 기준 및 두 주요 튜닝 실행은 최소 10분을 충족하고 LoadGen VALID였습니다. 짧은 진단 실행은 후보 선택에 사용했으며 전체 시간의 주요 결과와 섞지 않았습니다. 0.123% 범위는 튜닝 반복 2회의 차이이지 신뢰구간이 아닙니다.
- 정확도 및 준수: 이는 로컬 MLPerf 기반 측정으로 공식 MLPerf 제출이나 MLCommons 검토 결과가 아닙니다. TEST01 성능 검증은 통과했습니다. 직접 출력 비교에서 불일치가 발견됐지만 허용된 대체 절차에서 기준 및 감사 출력의 WER이 동일한 2.168070%로 나와 해당 검사를 통과했습니다. 이는 대체 절차를 통한 통과이며 바이트 단위 정확도 일치가 아닙니다. 전체 AccuracyOnly WER은 2.131770%입니다.
- 프로덕션 범위: 전력 수치는 GPU만 포함하고 호스트와 냉각은 제외합니다. 오디오 시간 환산은 이 코퍼스와 지속적인 대기열을 가정합니다. 고객의 억양, 언어, 잡음, 음성 중첩, 어휘, 스토리지, 네트워크, 재시도, 활용률, 지연 시간은 별도 측정이 필요합니다.
프라이빗 음성 텍스트 변환과 오프라인 Whisper 전사
프라이빗 오디오 전사에서 이 Whisper 벤치마크는 정해진 기한 안에 아카이브를 처리하는 데 필요한 능력을 추정하는 데 도움이 됩니다. 음성 텍스트 변환 처리량과 단어 오류율(WER)은 대표 녹음으로 함께 평가해야 합니다. 오프라인 벤치마크 처리 능력만으로 서비스가 지원할 수 있는 실시간 스트림 수나 부분 전사 결과의 도착 속도를 판단할 수는 없습니다.
전용 음성 파이프라인의 처리 용량 확보
ProsGrow는 고객의 오디오 워크로드를 시험하고 제한적인 파이프라인 단계를 분리하며 처리량, 전사 품질, 지연 목표에 맞춰 배포 설정을 검증할 수 있습니다.
ProsGrow AI에 문의