इंजीनियरिंग नोट्स · AMD पर DeepSeek

ProsGrow ने DeepSeek v4 Flash के पहले टोकन की विलंबता को 32% तक कैसे घटाया

पहला उत्तर मिलने से पहले कम इंतज़ार। ProsGrow ने उन्हीं आठ AMD MI325X GPU पर DeepSeek V4.1 Flash के कोल्ड अनुरोधों में पहले टोकन तक का समय 32.0% तक घटाया, जबकि मॉडल के मूल चेकपॉइंट की परिशुद्धता बनाए रखी।

· ProsGrow AI इंजीनियरिंग · पढ़ने में 4 मिनट

DeepSeek के कोल्ड अनुरोधों में पहले टोकन की विलंबता: लगभग 8K इनपुट टोकन पर 0.564 से 0.384 सेकंड, उन्हीं आठ AMD MI325X GPU पर 32% कमी।

परिणाम: इंतज़ार में 30% से अधिक कमी

दस्तावेज़ या कोडिंग अनुरोध पर काम करने वाले सहायक के लिए जनरेशन शुरू होने से पहले का इंतज़ार भी उपयोगकर्ता अनुभव का हिस्सा है। हमारे वास्तविक सर्विंग परीक्षणों में, लगभग 8,000-टोकन वाले प्रॉम्प्ट के लिए ProsGrow ने इस इंतज़ार को 0.564 से 0.384 सेकंड किया: यानी पहले टोकन तक के समय (TTFT) में 32.0% कमी।

यह तुलना उसी 8 × AMD MI325X होस्ट पर DeepSeek V4.1 Flash के साथ की गई, और मॉडल रिविज़न तथा रनटाइम संस्करण समान रखते हुए हमारे स्थानीय बेसलाइन से तुलना हुई। कोल्ड अनुरोधों में प्रीफ़िक्स कैश हिट नहीं थे। परीक्षण की गई तीनों प्रॉम्प्ट लंबाइयों में सुधार मिला।

कोल्ड अनुरोधों में पहले टोकन तक के समय की माध्यिका · वास्तविक सर्विंग · कम होना बेहतर
इनपुट लंबाईस्थानीय बेसलाइनProsGrow द्वारा अनुकूलितविलंबता में कमी
लगभग 8K टोकन0.564 सेकंड0.384 सेकंड32.0%
लगभग 60K टोकन3.931 सेकंड2.813 सेकंड28.4%
लगभग 300K टोकन27.532 सेकंड21.872 सेकंड20.6%

सबसे लंबे परीक्षण प्रॉम्प्ट पर, पहला कंटेंट मिलने से पहले लगभग 5.66 सेकंड कम इंतज़ार करना पड़ा। शीर्षक पहले टोकन की विलंबता बताता है; पूरे अनुरोध का थ्रूपुट नीचे अलग से मापा गया है।

सुधार कहाँ से आया

हमने इस पर ध्यान दिया कि सर्विंग स्टैक AMD हार्डवेयर पर मॉडल कैसे चलाता है, विशेष रूप से जनरेशन शुरू होने से पहले आने वाले प्रॉम्प्ट को संसाधित करने के लिए ज़रूरी काम पर। प्रोफ़ाइलिंग और लक्षित रनटाइम अनुकूलन से मौजूदा डिप्लॉयमेंट की अतिरिक्त क्षमता हासिल हुई।

यह परिणाम DeepSeek के मॉडल और मूल vLLM तथा AMD AITER रनटाइम की क्षमताओं पर आधारित है। हमने मूल चेकपॉइंट परिशुद्धता और स्पेक्युलेटिव जनरेशन के लिए वास्तविक लक्ष्य मॉडल द्वारा सत्यापन बनाए रखा। कोई अतिरिक्त हानिपूर्ण क्वांटाइज़ेशन नहीं जोड़ा गया।

निजी AI इंफ्रास्ट्रक्चर चलाने वाली टीमों के लिए यह एक अवसर दिखाता है: हार्डवेयर बढ़ाने से पहले सर्विंग की बाधा मापें। सही अनुकूलन मॉडल, प्रॉम्प्ट लंबाई और एप्लिकेशन की प्रतिक्रिया-समय आवश्यकताओं पर निर्भर करता है।

थ्रूपुट और गुणवत्ता की जाँच

डिप्लॉयमेंट के बाद दोहराए गए, कैश किए हुए प्रॉम्प्ट के साथ अलग जाँच में तीनों लंबाइयों पर पूरे अनुरोध का आउटपुट थ्रूपुट 7.7–10.2% अधिक मिला। इस माप में पहले टोकन का इंतज़ार और पूरी प्रतिक्रिया प्राप्त करने का समय शामिल है। कैश के साथ पहले टोकन की विलंबता थोड़ी, 2.4–3.2%, बढ़ी; इसलिए लाभ इस पर निर्भर करता है कि वर्कलोड के लिए कौन-सा मेट्रिक महत्वपूर्ण है।

अनुकूलन अपनाने से पहले हमने वही 128 गणित प्रश्न छोटे और लंबे प्रॉम्प्ट की स्थितियों में तुलना के लिए चलाए। दोनों स्थितियों में बेसलाइन में सही कोई भी उत्तर गलत नहीं हुआ, और डिप्लॉयमेंट के बाद की सभी छह कार्यात्मक जाँच सफल रहीं। सीमित दायरे की ये जाँच बदलाव का समर्थन करती हैं; व्यापक कोडिंग, बहुभाषी और ग्राहक कार्यों की गुणवत्ता का अलग मूल्यांकन अभी भी ज़रूरी है।

InferenceX संदर्भ बनाम ProsGrow

अलग, एक घंटे के AgentX बेंचमार्क में हमारे अनुकूलित डिप्लॉयमेंट ने 261.780 टोकन/सेकंड/उपयोगकर्ता की माध्यिका इंटरैक्टिविटी हासिल की, जबकि सहेजे गए InferenceX MI325X संदर्भ में यह 239.808 थी: यानी 9.16% बढ़ोतरी। प्रति GPU आउटपुट थ्रूपुट 15.83257 से 16.55379 टोकन/सेकंड हुआ, यानी 4.56% बढ़ोतरी।

आठ AMD MI325X GPU पर InferenceX संदर्भ बनाम ProsGrow: माध्यिका इंटरैक्टिविटी 239.808 बनाम 261.780 टोकन/सेकंड/उपयोगकर्ता, 9.16% बढ़ोतरी; आउटपुट थ्रूपुट 15.83257 बनाम 16.55379 टोकन/सेकंड/GPU, 4.56% बढ़ोतरी। दोनों बार चार्ट शून्य से शुरू होते हैं।
DeepSeek V4.1 Flash · एक घंटे का AgentX · आठ MI325X GPU · टेंसर समानांतरता 8 · समवर्ती अनुरोध 1। संदर्भ: InferenceX, 22 सितंबर 2026 की पंक्ति 442872 (प्रकाशित रन)। ProsGrow: 24 सितंबर 2026 का स्थानीय माप। पूरे आकार में देखने के लिए चित्र चुनें।

इन रन में बेंचमार्क की 3.51 की सिंथेटिक स्पेक्युलेटिव स्वीकृति लंबाई इस्तेमाल होती है। यह प्रदर्शन परीक्षण की सेटिंग है और हमारी सर्विंग तथा गुणवत्ता जाँच में इस्तेमाल वास्तविक सत्यापन से अलग है। चार्ट की बढ़त भी कोल्ड पहले-टोकन विलंबता में 32% कमी से अलग माप है।

माध्यिका इंटरैक्टिविटी, टोकनों के बीच विलंबता की माध्यिका का व्युत्क्रम है और डैशबोर्ड के राउंडिंग नियम का उपयोग करती है। थ्रूपुट में ट्रेस का निष्क्रिय समय शामिल है। ऐतिहासिक संदर्भ अपने चेकपॉइंट और रनटाइम इमेज की पूरी पहचान नहीं देता; इसलिए यह आंशिक पुनरुत्पादन वाली संदर्भ तुलना है। प्रकाशित और अनुकूलित रन ने क्रमशः 244 और 252 प्रोफ़ाइल किए गए अनुरोध पूरे किए, इसलिए उनके पूर्ण अनुरोधों का मिश्रण अलग है। प्रत्येक कॉन्फ़िगरेशन का एक रन है और कोई विश्वास अंतराल नहीं है। यहाँ दिखाए गए ProsGrow माप स्थानीय परिणाम हैं।

हमने क्या मापा

परीक्षण 24 सितंबर 2026 को हुए, और मॉडल सभी आठ GPU पर वितरित था। हर वास्तविक सर्विंग अनुरोध ने ठीक 1,024 आउटपुट टोकन बनाए। TTFT अनुरोध की शुरुआत से लेकर पहले गैर-रिक्त स्ट्रीम किए गए कंटेंट तक का समय मापता है। संबंधित प्रॉम्प्ट और आउटपुट लंबाइयाँ नियंत्रित रखी गईं, और कोल्ड अनुरोधों में शून्य प्रीफ़िक्स कैश हिट सत्यापित किए गए।

हर कोल्ड कॉन्फ़िगरेशन में प्रत्येक प्रॉम्प्ट लंबाई पर एक वॉर्मअप और चार मापे गए अनुरोध इस्तेमाल हुए। रन क्रमिक थे और उनकी कंपाइलेशन तथा कैश हिस्ट्री अलग थी। ये हमारे पुनरुत्पादित बेसलाइन के सापेक्ष स्थानीय माप हैं; परिणाम ट्रैफ़िक, समवर्ती अनुरोधों और प्रॉम्प्ट मिश्रण के साथ बदलेंगे। 32% तीन परीक्षण लंबाइयों में देखा गया सर्वश्रेष्ठ कमी का परिणाम है; इससे विश्वास अंतराल या प्रोडक्शन SLA का संकेत नहीं मिलता।

निजी DeepSeek होस्टिंग और AMD GPU कंप्यूट

निजी DeepSeek होस्टिंग या समर्पित AMD GPU सर्वर का मूल्यांकन करने वाली टीमों के लिए यह बेंचमार्क डिप्लॉयमेंट योजना को मॉडल की परिशुद्धता, प्रॉम्प्ट लंबाई और प्रतिक्रिया समय से जोड़ता है। पहले टोकन तक का समय (TTFT) मापता है कि उत्तर कब शुरू होता है; पूरे अनुरोध का थ्रूपुट अनुभव का अलग पहलू मापता है। ProsGrow आपके निजी इन्फ़रेंस वर्कलोड के लिए इन समझौतों का मूल्यांकन कर सकता है।

अपने डिप्लॉयमेंट की संभावनाएँ जानें

क्या आप DeepSeek चला रहे हैं या निजी AI डिप्लॉयमेंट की योजना बना रहे हैं? परिणामों, हमारे अनुकूलन दृष्टिकोण और आपके मॉडल तथा वर्कलोड के साथ मूल्यांकन पर चर्चा के लिए हमसे संपर्क करें। हम आपके इन्फ़्रास्ट्रक्चर में सुधार की गुंजाइश पहचानने में मदद कर सकते हैं।

AMD GPU कंप्यूट, समर्पित GPU सर्वर या निजी इन्फ़रेंस इंफ्रास्ट्रक्चर की पहुँच के लिए अपनी आवश्यकताओं पर चर्चा करने हेतु हमसे संपर्क करें।

हमारे साथ कॉल बुक करें

ईमेल पसंद है? contact@prosgrow.ai