結果:待ち時間を 30% 以上短縮
文書の処理やコーディングの依頼に対応するアシスタントでは、生成が始まるまでの待ち時間もユーザー体験の一部です。実際の配信テストで、ProsGrow は約 8,000 トークンのプロンプトに対する待ち時間を 0.564 秒から 0.384 秒に短縮しました。これは初回トークンまでの時間(TTFT)の 32.0% 削減に相当します。
比較には同一の 8 × AMD MI325X ホスト上の DeepSeek V4.1 Flash を使用し、モデルのリビジョンとランタイムのバージョンが同じローカルベースラインと比較しました。コールドリクエストにはプレフィックスキャッシュのヒットがありません。テストした 3 種類のプロンプト長すべてで改善が見られました。
| 入力長 | ローカルベースライン | ProsGrow 最適化後 | 遅延削減率 |
|---|---|---|---|
| 約 8K トークン | 0.564 秒 | 0.384 秒 | 32.0% |
| 約 60K トークン | 3.931 秒 | 2.813 秒 | 28.4% |
| 約 300K トークン | 27.532 秒 | 21.872 秒 | 20.6% |
最長のテストプロンプトでは、最初のコンテンツが届くまでの待ち時間が約 5.66 秒短縮されます。見出しは初回トークン遅延について述べたもので、リクエスト全体のスループットは以下で別に測定しています。
改善を生んだポイント
私たちは、配信スタックが AMD ハードウェア上でモデルをどのように実行するか、特に生成を始める前に入力プロンプトを処理するための作業に注目しました。プロファイリングと対象を絞ったランタイム最適化により、既存の環境から追加の性能を引き出しました。
この結果は、DeepSeek のモデルと、上流の vLLM および AMD AITER ランタイムの機能に基づいています。元のチェックポイント精度を保ち、投機的生成では実際のターゲットモデルによる検証を維持しました。追加の非可逆量子化は導入していません。
プライベート AI インフラを運用するチームにとって、これはハードウェアを増やす前に配信のボトルネックを測定する機会を示しています。適切な最適化は、モデル、プロンプト長、アプリケーションの応答時間要件によって異なります。
スループットと品質の確認
デプロイ後に、繰り返し使用するキャッシュ済みプロンプトで別途確認したところ、3 種類のプロンプト長でリクエスト全体の出力スループットが 7.7–10.2% 向上しました。この指標には、最初のトークンまでの待ち時間と、応答全体を受け取る時間が含まれます。キャッシュ利用時の初回トークン遅延は 2.4–3.2% わずかに増加したため、利点はワークロードが重視する指標によって変わります。
採用前に、同じ 128 問の数学問題を短いプロンプトと長いプロンプトの両条件で比較しました。どちらの条件でもベースラインで正解だった回答が不正解に変わることはなく、デプロイ後の 6 項目の機能確認もすべて通過しました。限定的な確認はこの変更を支持しますが、より広範なコーディング、多言語、顧客タスクの品質には個別の評価が必要です。
InferenceX の参照結果と ProsGrow の比較
別途行った 1 時間の AgentX ベンチマークでは、最適化後の環境のインタラクティビティ中央値が 261.780 トークン/秒/ユーザーとなり、保存された InferenceX MI325X の参照値 239.808に対して 9.16% 向上しました。GPU あたりの出力スループットは 15.83257 から 16.55379 トークン/秒へ、4.56% 向上しました。
これらの実行では、ベンチマークの合成された投機的受理長 3.51を使用しています。これは性能テストの設定であり、配信および品質テストで使う実際の検証とは別です。グラフの改善率も、コールド時の初回トークン遅延を 32% 削減した結果とは別の測定です。
インタラクティビティ中央値はトークン間遅延中央値の逆数で、ダッシュボードの丸め規則を使用しています。スループットにはトレース内のアイドル時間も含まれます。過去の参照結果ではチェックポイントとランタイムイメージが完全には特定されておらず、これは部分的な再現による参照比較です。公開実行と最適化実行では、プロファイリング対象のリクエストがそれぞれ 244 件と 252 件完了したため、完了リクエストの構成が異なります。各設定の実行は 1 回で、信頼区間はありません。ここに示す ProsGrow の測定値はローカルでの結果です。
測定の範囲
テストは 2026 年 9 月 24 日に行い、モデルを 8 基すべての GPU に分散しました。実際の配信リクエストは毎回、正確に 1,024 個の出力トークンを生成しました。TTFT はリクエスト開始から、最初の空でないストリーミングコンテンツが届くまでの時間です。対応するプロンプトと出力長を統制し、コールドリクエストのプレフィックスキャッシュヒットがゼロであることを確認しました。
各コールド設定で、プロンプト長ごとに 1 回のウォームアップと 4 回の測定リクエストを実行しました。各実行は順番に行い、コンパイルとキャッシュの履歴は異なります。これらは再現したベースラインに対するローカル測定であり、結果はトラフィック、同時実行数、プロンプトの構成によって変わります。32% はテストした 3 種類の長さで観測された最大削減率で、信頼区間や本番 SLA を示すものではありません。
プライベート DeepSeek ホスティングと AMD GPU 計算資源
プライベート DeepSeek ホスティングや専用 AMD GPU サーバーを検討するチームにとって、このベンチマークは導入計画をモデル精度、プロンプト長、応答時間と結び付けます。初回トークンまでの時間(TTFT)は回答が始まる時点を測り、リクエスト全体のスループットは体験の別の側面を測ります。ProsGrow はお客様のプライベート推論ワークロードでこれらのトレードオフを評価できます。
お客様の環境の改善余地を探る
DeepSeek を運用中、またはプライベート AI の導入を計画していますか。結果、最適化のアプローチ、お客様のモデルとワークロードを使った評価について、私たちにご相談ください。インフラのどこに改善余地があるかを見つけるお手伝いをします。
AMD GPU 計算リソース、専用 GPU サーバー、プライベート推論インフラをご希望の場合は、要件についてお問い合わせください。
私たちとの相談を予約メールをご希望ですか。contact@prosgrow.ai