課題:質問数が同じでも処理量は同じとは限らない
プライベート文書サービスには、滞留した処理を正確かつ期限内に終えることが求められます。すべての GPU に同じ数の質問を配るのは合理的に見えますが、あるワーカーに高解像度ページや長いマルチモーダルプロンプトが多く渡ると、最も遅いワーカーがバッチ全体の終了時刻を決めてしまいます。
ProsGrow はこの隠れた偏りを特定し、同じノード上でプロファイルに基づく割り当てを評価しました。処理量は毎時 44,608 件から 45,978 件へ、3.07% 増加しました。リクエスト数が均等に見えても、マルチモーダル推論では能力が使い切れていない場合があることを示しています。
ベースライン → ProsGrow 最適化
両実行とも同じ 8 基の GPU 上で Qwen3.6-27B BF16 と vLLM 0.25.1 を使用しました。各リクエストはページ画像と質問を渡し、短い回答を求めます。検証用の全ワークロードは 1,285 枚のページ画像に対する 5,349 件の質問です。
ベースラインは質問数を均等化していました。ProsGrow は負荷のプロファイリングを用い、同じページへの反復質問を同じレプリカに置く局所性を保ちながら、各レプリカに割り当てる処理量の差を減らしました。
1 時間に回答した文書質問数
| 指標 | 質問数均等化のベースライン | ProsGrow のプロファイルに基づく割り当て |
|---|---|---|
| ノード全体の完了時間枠 | 431.676 s | 418.821 s · 2.98% 短縮 |
| 文書質問数/時 | 44,608 | 45,978 · 3.07% 増加 |
| レプリカごとのプロンプトトークン数の最大値/最小値 | 1.0759× | 1.00017× |
| 平均 ANLS | 0.96402 | 0.96531 |
すべての質問が正常に完了し、完全一致率は 91.92%でした。実測の 1 ページ当たり 4.16265 件で換算すると、毎時 11,045 枚のページ画像に相当します。この換算は質問密度に依存します。
プロファイリングで分かったこと
質問数が等しくても、最大と最小のプロンプト負荷には 7.59% の差が隠れていました。プロファイリングで可視化し、選定した割り当てで差を 0.017% 以内に抑えました。共通時間枠での最終処理量は、独立した単一 GPU の処理速度を 8 倍した値の 98.61% に達しました。
複数の質問が同じページを参照する場合、負荷を均等化しても再利用を維持する必要があります。両方式とも局所性を保ち、最適化実行ではウォームアップを含めたマルチモーダルプロセッサキャッシュのヒット率が 76.06% でした。測定された改善は、この推論基盤上で処理をより均等に配分した結果です。
プロンプト量だけですべての遅延は説明できません。ページの形状、バッチ化、末尾に残るリクエストも完了時間に影響します。有用だったのは普遍的なスケジューリング規則ではなく、見かけ上均等なリクエストと実際の処理量の差でした。
トレードオフ:メモリの余裕と精度
大きなページ画像を扱うと、メモリの余裕は性能制約であると同時に、正常な処理の条件にもなります。選定した推論設定は検証セット全体を受け入れ、プリフィルの稼働率、レイテンシ、最大ページに必要な余裕を両立させました。
同じ文書タスク条件で、より小さな混合 NVFP4 チェックポイントも試しました。ディスク使用量は BF16 の 51.75 GiB に対して 20.43 GiB でしたが、処理量は毎時 44,970 件で BF16 より 2.19% 低下しました。平均 ANLS は 0.96531 から 0.96314、完全一致率は 91.92% から 91.14% に下がりました。このウォーム状態の文書推論設定には BF16 を採用しました。
量子化経路でも、画像前処理、視覚エンコーダ、長いマルチモーダルプリフィルには大きなコストが残りました。試した実行時ポリシーでは、重みが小さくなってもピークメモリの余裕は改善しませんでした。NVFP4 は質問当たりのサーバー全体のエネルギーを 2.33% 減らしましたが、この負荷では処理量と品質の低下を補うには至りませんでした。
プライベート文書サービスへの意味
測定速度では、このスケジューリング変更によりノード 1 台・1 時間当たり約 1,369 件多く質問を完了できます。同じページへの反復質問がある処理待ちキューで、同じ 8 基の GPU からより多くの有効な処理を得られます。本番導入には代表的な負荷のプロファイリング、または新しいページに対する検証済みコスト推定器が必要です。このベンチマークは同じ固定コーパスから得たコストを使用しました。
最適化実行のリクエストレイテンシ中央値は 4.521 秒、p95 は 9.411 秒でした。自由記述の質問は ANLS が 0.93498 と全体平均を下回りました。試験導入には、顧客のページ構成に応じた品質目標と、誤答の損失に見合うレビュー方針が必要です。
実測質問数からコストモデルへ
コストモデルは、時間当たりのインフラ費用を、実測の毎時 11,045 ページ相当の能力のうち販売した部分で割ります。これはローカルでの処理量 3.07% 改善の比較とは別の分析です。
| ノード購入費 | 全能力を有料利用 | 有料需要 10% |
|---|---|---|
| $100,000 | $0.49 | $4.21 |
| $150,000 | $0.69 | $6.22 |
モデルの前提は、3 年償却、年間保守費 5%、720 時間/月、電力単価 $0.10/kWh、冷却・施設負荷を含む電力使用係数 1.30、稼働時サーバー電力 7.476590 kW、アイドル時 1.016 kW です。有料需要が 10% の場合、販売量はベンチマーク能力の 10% ですが、償却、保守、アイドル電力の費用は引き続き発生します。人件費、アプリケーション運用、ネットワーク、ストレージ、サービス予備能力は含みません。
価格の参考として、AWS Textract の Queries 料金例 5は、米国西部(オレゴン)で 1,000 ページ当たり $15 としています。確認日は 2026 年 9 月 15 日です。レポートの例示サービス価格、1,000 ページ当たり $10 は、この参考より 33.33% 低い値です。これは価格シナリオであり、実測負荷は 1 ページ約 4.16 件の質問を含みます。抽出品質、機能範囲、提供サービスの同等性は検証していません。
方法と制約
- モデルと実行環境:Qwen/Qwen3.6-27B、リビジョン
6a9e13bd6fc8f0983b9b99948120bc37f49c13e9、BF16。vLLM 0.25.1 と FlashAttention 2。公称メモリ 96 GB の RTX PRO 6000 Blackwell Server Edition GPU 8 基に独立したレプリカを配置しました。推論設定は固定し、思考とプレフィックスキャッシュを無効、マルチモーダルプロセッサキャッシュを有効にしました。 - データと採点:
lmms-lab-encoder/DocVQAのリビジョン539088ef8a8ada01ac8e2e6d4e372586748a265eの検証セット全体、5,349 件の質問と 1,285 枚の固有画像を使用しました。決定論的サンプリングで短い回答を求めました。品質と能力は同じ全セット最適化実行から得ています。 - 指標の定義:平均正規化レーベンシュタイン類似度(ANLS)は参照回答との類似性を測ります。完全一致では大文字・小文字と空白を正規化します。これらの DocVQA 指標は、項目単位の業務上の誤りを直接測るものではありません。
- 計測範囲:ウォーム状態の API 文書質問リクエストから回答完了までを、ノード共通の同期時間枠で測定しました。毎時の値は約 7 分間の実行から換算しています。PDF 取り込み、企業向けコネクタ、スキーマ検証、人によるレビュー、コールドスタート、可用性設計は計測範囲外です。
- 比較の制約:温度がゼロでも、バッチ形状の変更により正規化後の予測 35 件が変化しました。ANLS の小さな上昇は観測された数値変動であり、スケジューリングがモデル精度を改善する証拠ではありません。条件を合わせた比較はローカルベンチマークであり、反復された本番試験やベンダー認定結果ではありません。ページ数への換算はこの質問密度にのみ適用できます。
プライベート文書質問応答とマルチモーダル推論
プライベートな文書質問応答では、このベンチマークがマルチモーダル推論能力を未処理文書と処理期限に結び付ける助けになります。単位は回答済みの質問であり、取り込んだ PDF や検証済みの業務項目ではありません。顧客環境への導入では、GPU 配信性能と併せて、代表的なページ画像、回答品質、レビュー工程を評価する必要があります。