課題:音声モデルを変えずに処理能力を引き出す
アーカイブ文字起こしサービスには、定めた品質を満たしながら音声処理量を増やす必要があります。ProsGrow は MLPerf Inference v6.0 で使われる公開 Whisper 実装から始め、RTX PRO 6000 Blackwell GPU 8 基のノードで対応する設定を再現しました。規定時間を満たすベースラインは毎秒 291.771 音声サンプルでした。
エンジンのバッチ処理を分析すると、公開設定はこの構成に最適ではありませんでした。対応範囲内の設定変更により、規定時間の 2 回の実行で毎秒 299.444 サンプル、つまり同じ GPU 8 基で 2.63% の向上を達成しました。選定設定はベンチマークの精度基準にも合格しました。
ベースライン → ProsGrow 調整後
| ローカル構成 | 音声サンプル/秒 | サンプル/秒/GPU | ローカルベースライン比の向上 |
|---|---|---|---|
| 公開設定 · ベースライン | 291.771 | 36.471 | — |
| 選定設定 · 実行 1 | 299.628 | 37.454 | 2.69% |
| 選定設定 · 実行 2、観測最小値 | 299.260 | 37.408 | 2.57% |
| 選定設定 · 2 回の平均 | 299.444 | 37.431 | 2.63% |
調整後の 2 回の差は平均のわずか 0.123%でした。保守的な能力計画では、観測した低い値の毎秒 299.260 サンプルを使います。ベースラインの規定時間測定は 1 回、調整後は 2 回です。
プロファイリングで分かったエンジンのバッチ処理
平均 GPU 使用率は、選定した 2 回の実行で 94.417% から 97.373% と 97.312% に上昇しました。スループットの結果と合わせると、バッチ実行のリズム改善が能力回復につながったという説明を支持します。これはテレメトリからの推論であり、未公開のエンジン内部仕様についての主張ではありません。
ProsGrow はパイプライン全体を評価し、対応するエンジン設定を選び、規定時間の反復と別個の精度検査で検証しました。公開ソース、チェックポイント、データセット、デコード動作、LoadGen のシード、評価器は固定しました。同じ FP16 元チェックポイントと NVFP4 デコーダー行列積プラグインを使用し、性能向上用のソースパッチは有効にしていません。
トレードオフ:稼働電力の微増と引き換えに処理量向上
最初の調整後フル実行では、平均 GPU 総電力が 3,428 W から 3,508 W に増え、処理量は 2.69% 向上しました。元音声 1,000 時間当たりの GPU のみの電力量は、0.4885 から 0.4868 kWh へわずかに減りました。能力向上に実測エネルギー効率の低下は伴いませんでしたが、電力量の差は小さいものです。
品質は明示的な合格条件でした。調整設定の AccuracyOnly 実行は全 1,633 サンプルを対象とし、MLCommons 評価器で単語誤り率 2.131770%となり、許容値 3.046429% を下回りました。対象コーパスでの合格を示しますが、この比較ではローカルベースラインの精度試験を別途行っていません。
外部との比較:少ない GPU で同等の処理量
主な公開 Whisper 比較対象は、HPE の GPU 8 基で毎秒 294.821 サンプルという結果です。当社の平均 299.444 サンプル/秒は、ノード処理量が 1.57% 高い値です。どちらも RTX PRO 6000 GPU 8 基を使いますが、ホストとソフトウェアの詳細は異なります。
監査済みの公開 MLPerf v6.0 スナップショットには、HPE の GPU 10 基で毎秒 297.661 サンプルという結果もあります。当社のローカル GPU 8 基平均は、アクセラレータ数が 20% 少なく、速度は 0.60% 高い値でした。GPU 数で割ると毎秒・GPU 当たり 37.431 対 29.766 サンプルで、差は 25.75% です。
これはシステム効率の参考になります。当社ノード上で切り分けて測った改善は、エンジン設定の選択による 2.63% の向上です。外部比較にはホストとソフトウェアスタックの差も含まれるため、GPU 当たりの優位性すべてをこの 1 変更に帰属させることはできません。
文字起こしサービスにとっての変化
対象コーパスでは 2 回の平均は実時間 1 時間当たり約 7,202 時間分の元音声に相当し、ベースラインは 7,017 時間です。ベンチマークの平均クリップ長から換算すると、ノード稼働 1 時間当たり約 185 時間分の追加処理です。継続的な未処理アーカイブがあるサービスなら、同じ導入済み GPU で処理期間を短縮できます。
ProsGrow はアーカイブ文字起こしを、処理量、文字起こし品質、キュー滞留時間、データ境界に照らして評価します。リアルタイム文字起こしには、同時接続、途中結果の挙動、確定遅延、復旧という独自要件が必要です。Offline のサンプル速度からライブストリームの能力は決められません。
課金需要 10% での音声処理コスト
9月15日の能力レポートは、$100,000 のノード、3 年償却、ベンチマークからサービスへの効率 70%、課金需要 10% を用い、販売音声 1 分当たり $0.0001321 と試算しています。その時点の API 価格入力は、OpenAI ホスト型 whisper-1 が $0.006/分、Deepgram Nova-3 単一言語・録音済み PAYG が $0.0043/分です。モデル上のインフラ費用は、それぞれ 97.80%、96.93% 低い値です。
計算では実測能力を暦時間 1 時間当たり約 30,247.5 分の販売音声へ換算し、時間当たり約 $3.995 のインフラ費用をその能力で割ります。費用は $100,000 ÷(3 × 8,760 時間)のハードウェア償却と、$0.10/kWh の電力を含みます。ノード全体の待機電力 1.5 kW、稼働電力 5.5 kW を仮定し、需要 10% で加重します。サービス効率と課金需要は別の仮定です。
時間当たり費用と他の仮定を固定すると、実測の処理量 2.63% 向上だけで単価は約 2.56% 下がります。API 価格との差の大部分は、プライベートなバッチ処理能力の経済モデルによるもので、需要に強く依存します。
これはインフラ費用と販売価格の比較であり、実証済みの顧客節約額ではありません。保守、冷却/PUE、人件費、ネットワーク、保存、サポート、冗長化、SLA 予備容量を除外します。ローカル Whisper Large v3、ホスト型 whisper-1、Nova-3 はモデルと機能が異なり、同等サービスの品質は確立していません。
Granite API とリアルタイム音声
レポートは別の Granite キュー型 API サービスも測定しています。ホスト配置とリクエストのバッチ化で処理量は 19,062.88 から 28,368.99 RTFx となり、元のローカル API ベースライン比で48.82% 向上しました。RTFx は実時間 1 秒で処理する音声秒数です。バッチ API は 62,880 発話を評価し、退化出力はゼロ、最悪 WER は 3.4942% でした。
Granite の別の非同期 Offline 結果は 68,932.91 RTFx です。リアルタイム ASR 試験では、同一ホスト内の 24 秒間のループバック試験を 3 回行い、5,568 WebSocket 接続を維持しました。モデル、採点、計時範囲はそれぞれ異なります。各主要数値は別個の試験でノードを占有した結果です。外部トラフィック、長時間のリアルタイム運用、復旧は今後の検証が必要です。
測定方法と制約
- システムとスタック:2026年8月20〜21日の試験は NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 8 基、AMD EPYC 9575F CPU 2 基、TensorRT 10.14.1.48、TensorRT-LLM 1.3.0rc0、CUDA 13.1 を使用しました。公開参照コードとモデル/データのハッシュを固定し、照合しました。
- ワークロードと単位:MLPerf Whisper データ仕様は LibriSpeech をモノラル 16 kHz の 1,633 音声サンプルに再構成します。各サンプルは 30 秒にパディングした Whisper 計算を行い、実際の元音声は平均 24.0505 秒です。音声サンプル/秒、生成トークン/秒、元音声時間は異なる単位です。
- 性能測定の有効性:ベースラインと調整後の主要 2 実行は最低 10 分を満たし、LoadGen VALID でした。短い診断実行は候補選定に使い、規定時間の主要結果とは混ぜていません。0.123% の幅は調整後 2 回の範囲で、信頼区間ではありません。
- 精度と適合性:これは MLPerf に基づくローカル測定であり、公式 MLPerf 提出や MLCommons 審査済み結果ではありません。TEST01 性能検証は合格しました。出力の直接比較では不一致があり、許可された代替手順でベースラインと監査出力を採点すると同じ 2.168070% WER となり、その検査を満たしました。これは代替手順による合格で、バイト単位の一致ではありません。完全な AccuracyOnly WER は 2.131770% のままです。
- 本番適用範囲:電力値は GPU のみで、ホストと冷却を除きます。音声時間への換算はこのコーパスを使い、継続的なキューを仮定します。顧客のアクセント、言語、雑音、発話の重なり、語彙、保存、ネットワーク、再試行、利用率、遅延はそれぞれ測定が必要です。
プライベート音声認識と Whisper のオフライン文字起こし
プライベートな音声文字起こしでは、この Whisper ベンチマークが、期限内にアーカイブを処理するために必要な能力の推定に役立ちます。音声からテキストへの変換スループットと単語誤り率(WER)は、代表的な録音で併せて評価する必要があります。オフラインのベンチマーク能力から、サービスが対応できるライブストリーム数や、途中の文字起こし結果が届く速さを判断することはできません。
プライベート音声パイプラインの能力を引き出す
ProsGrow はお客様の音声ワークロードを試験し、制約となる段階を切り分け、処理量、文字起こし品質、遅延目標に照らして導入設定を検証します。
ProsGrow AI に相談