इंजीनियरिंग · वीडियो इन्फ़रेंस

ProsGrow MiniMax-H3 वीडियो इन्फ़रेंस की लेटेंसी 54% कैसे सुधारता है

उन्हीं आठ GPU पर समान BF16 Turbo अनुरोध के लिए MiniMax-H3 सर्वर इन्फ़रेंस 19.392 से 8.913 सेकंड हुआ। अलग अध्ययनों में Wan की वार्म लेटेंसी 59.1% घटी और Animate का थ्रूपुट 17.62% बढ़ा।

· अपडेट · ProsGrow AI इंजीनियरिंग · पढ़ने का समय 8 मिनट

MiniMax-H3 सर्वर इन्फ़रेंस: उन्हीं आठ GPU पर समान BF16 Turbo अनुरोध के लिए 19.392 से 8.913 सेकंड, यानी 54% कम लेटेंसी।

अलग कामों के लिए अलग सेवा श्रेणियाँ चाहिए

रचनात्मक प्रीव्यू में कम प्रतीक्षा चाहिए। मोशन ट्रांसफ़र को लंबे आउटपुट में मूल प्रदर्शन सुरक्षित रखना होता है। उच्च-रिज़ॉल्यूशन ऑडियो-वीडियो अनुरोध एक साथ कई GPU घेर सकता है। इन सेवाओं का अनुकूलन परिशुद्धता, अटेंशन, मेमोरी में बने रहने, समानांतरण, कंपाइलेशन और गुणवत्ता पर निर्णय माँगता है।

ProsGrow ने आठ GPU वाले RTX PRO 6000 Blackwell नोड पर इन सेवा श्रेणियों का मूल्यांकन किया। MiniMax-H3 तुलना में उन्हीं आठ GPU और उसी BF16 Turbo अनुरोध के लिए सर्वर इन्फ़रेंस 19.392 से 8.913 सेकंड हुआ: 54.0% कम लेटेंसी। अलग Wan और Animate अध्ययन दिखाते हैं कि डिलीवरी समय-सीमा, कुल माँग और गुणवत्ता आवश्यकताएँ उपयोगी कॉन्फ़िगरेशन कैसे बदलती हैं।

हमने कार्यभार की शर्तें तय कीं, बाधाओं की प्रोफ़ाइलिंग की, संभावित संचालन बिंदु तुलना किए और चुना परिणाम सत्यापित किया। अध्ययन हर मापे सुधार को उसकी संसाधन और गुणवत्ता सीमाओं से जोड़ते हैं।

MiniMax-H3: लेटेंसी, मेमोरी और गुणवत्ता

MiniMax-H3 ने PCIe नोड पर बड़ा ऑडियो-वीडियो कार्यभार बाँटने की लागत उजागर की। समानांतर काम के बँटवारे को बदलकर उन्हीं आठ GPU पर सर्वर इन्फ़रेंस 19.392 से 8.913 सेकंड किया: समान BF16 Turbo अनुरोध के लिए 54.0% कम लेटेंसी।

टेंसर और सीक्वेंस समानांतरण की संचार तथा मेमोरी ज़रूरतें अलग हैं। नियंत्रित मापन ने इस कार्यभार में संचार ओवरहेड घटाने के पक्ष में परिणाम दिए, लेकिन कर्नेल-स्तरीय कारण तय करने वाला उपयोगी कर्नेल ट्रेस नहीं मिला। चुने लेटेंसी प्रोफ़ाइल ने लगभग 84.2 GB प्रति GPU लिया; अधिक मेमोरी गुंजाइश वाले कॉन्फ़िगरेशन की लेटेंसी अधिक थी।

मूल परियोजना का SGLang MiniMax-H3 स्टैक मॉडल-सर्विंग और समानांतरण के घटक देता है। ProsGrow का योगदान इस हार्डवेयर पर उनका व्यवहार परखकर सेवा लक्ष्य के अनुसार चयन करना था।

अलग सन्निकटन प्रयोग ने बीच की गणनाएँ दोबारा इस्तेमाल कर सर्वर इन्फ़रेंस 8.913 से 7.092 सेकंड किया, यानी अतिरिक्त 20.44% कमी। API पूरा होने का समय 10.045 से 8.040 सेकंड हुआ, जबकि आठों GPU अब भी एक अनुरोध को आवंटित थे। डिकोड समय लगभग समान रहा।

इस अतिरिक्त लाभ की स्वीकृति शर्त अलग है: अनुमानित गणना के लिए गुणवत्ता जाँच चाहिए। चुने उम्मीदवार ने एक दृश्य पर सीमित संख्यात्मक-संगति जाँच पास की। यह संभावित संचालन बिंदु का प्रमाण है, व्यापक अनुभूति-आधारित समानता या हर ग्राहक कार्यभार की मंज़ूरी नहीं।

Wan2.2: नियंत्रित चार-चरण तुलना

बेसलाइन · डिस्टिल्ड BF16, डेंस अटेंशन, CPU ऑफ़लोड22.164 सेकंड
ProsGrow कॉन्फ़िगरेशन · कम परिशुद्धता, स्पार्स अटेंशन, GPU में स्थायी स्थान9.062 सेकंड · 59.1% कम
एक RTX PRO 6000 Blackwell GPU; समान प्रॉम्प्ट, सीड, चार-चरण क्रम और 81-फ़्रेम का 832×480 आउटपुट। दोनों रास्ते वार्म हैं। परिशुद्धता, अटेंशन और मेमोरी स्थान साथ बदलते हैं। बनी हुई दृश्य-रचनाएँ अलग हैं; अनुभूति-आधारित समानता स्थापित नहीं हुई।
समान GPU, प्रॉम्प्ट, सीड, चार-चरण क्रम और आउटपुट आकार
मेट्रिकडिस्टिल्ड BF16 बेसलाइनचुना LightX2V कॉन्फ़िगरेशन
वार्म पाइपलाइन22.164 s9.062 s · 59.1% कम
नॉइज़ हटाना19.164 s6.076 s
VAE डिकोडिंगलगभग 2.37 sलगभग 2.36 s

चुना रास्ता कम परिशुद्धता, स्पार्स अटेंशन और GPU में स्थायी स्थान जोड़ता है। क्वांटाइज़ेशन-सचेत चरण डिस्टिलेशन सहित ये क्षमताएँ मूल LightWan2.2 मॉडल और LightX2V रनटाइम से आती हैं। ProsGrow ने निष्पादन रास्ता जोड़ा और सत्यापित किया, स्थानीय नियंत्रण बनाए और सेवा के समझौते मापे।

मानक 40-चरण BF16 रन में 357.640 सेकंड लगे। उस संदर्भ से अधिकांश अंतर मूल परियोजना के चरण डिस्टिलेशन से आता है। चार-चरण BF16 नियंत्रण डिस्टिलेशन के लाभ से अलग, अतिरिक्त संयुक्त रनटाइम लाभ 2.45× मापता है।

परिशुद्धता, अटेंशन और स्थायी स्थान एक-दूसरे को प्रभावित करते हैं

निष्पादन रास्ते की कई परतों में अवसर थे:

  • परिशुद्धता और अटेंशन: छोटे संख्यात्मक निरूपण और स्पार्स अटेंशन ने नॉइज़ हटाने का काम घटाया। उनका संयुक्त लाभ मॉडल और समर्थित निष्पादन रास्ते पर निर्भर है; केवल फ़ॉर्मैट बदलने से तेज़ सर्विंग की गारंटी नहीं।
  • GPU में स्थायी स्थान: छोटे एक्सपर्ट वेट्स GPU मेमोरी में रह सके, जिससे मुख्य रास्ते से होस्ट-से-डिवाइस ट्रांसफ़र हटे। मेमोरी बचत ने केवल गणित की मात्रा नहीं, गणना का स्थान भी बदला।
  • पाइपलाइन संतुलन: डिकोडिंग लगभग 2.36 सेकंड रही। नॉइज़ हटाना तेज़ होने पर यह लगभग अपरिवर्तित चरण अनुरोध का बड़ा हिस्सा बना, जिससे डीनॉइज़र में आगे सुधार का लाभ सीमित हुआ।
  • वार्म बनाम कोल्ड सेवा: अनुकूलित अलग प्रक्रिया में मॉडल लोड, वार्मअप और बंद होना मिलाकर 72.12 सेकंड लगे। इसलिए छोटा वार्म इन्फ़रेंस समय ऐसी सेवा पर निर्भर है जो स्टार्टअप काम और मेमोरी में बने रहने को संभाले।

नियंत्रित परिणाम इन बदलावों को साथ मापता है। यह हर परत को स्वतंत्र कारणात्मक गति-वृद्धि नहीं देता। इसलिए अनुकूलन को चरणवार समय और शुरू-से-अंत डिलीवरी सीमा दोनों चाहिए।

समकालिक नोड राउंड में GPU की वार्म लेटेंसी लगभग समान थी। सबसे धीमे समापन से इस प्रीव्यू शर्त के लिए लगभग 3,138 क्लिप/घंटा का अनुमान बनता है। यह एक मापे राउंड से क्षमता रूपांतरण है, लगातार एक घंटे का API परीक्षण नहीं। गुणवत्ता भी सीमा लगाती है: बनी दृश्य-रचनाएँ अलग थीं और अनुभूति-आधारित समानता स्थापित नहीं हुई।

Animate-2: असिंक्रोनस सेवा के लिए थ्रूपुट

Animate-2 संदर्भ छवि और स्रोत वीडियो से 11.21 सेकंड का मोशन-ट्रांसफ़र वीडियो बनाता है। लंबे काम असिंक्रोनस कतार के अनुकूल हैं, जहाँ पूरे आउटपुट और प्रति काम ऊर्जा, इंटरैक्टिव प्रीव्यू की समय-सीमा से अधिक महत्वपूर्ण होते हैं।

ProsGrow ने सत्यापित FP8 रास्ता और स्थायी कंपाइलेशन कैश जोड़े। कंपाइल कोड दोबारा उपयोग करने से बार-बार का स्टार्टअप काम घटा, जबकि परिशुद्धता ने स्थिर निष्पादन लागत बदली। दोनों इस सेवा की पूरी लॉन्च सीमा के भीतर मापे गए।

समान नोड कार्यभार; चुने परिणाम के लिए कंपाइलेशन कैश पहले से भरा
मेट्रिकBF16 बेसलाइनFP8 + कंपाइल कैश
नोड आउटपुट दर24.382 आउटपुट/घंटा28.678 आउटपुट/घंटा · +17.62%
पूरे नोड की औसत शक्ति6.581 kW6.575 kW
प्रति आउटपुट ऊर्जा0.270 kWh0.229 kWh

लगभग समान सर्वर शक्ति और अधिक थ्रूपुट ने प्रति आउटपुट ऊर्जा करीब 15.1% घटाई। चुने कॉन्फ़िगरेशन में केवल लगभग 4 GiB GPU मेमोरी गुंजाइश बची, जिससे आउटपुट आकार और समवर्ती काम महत्वपूर्ण तैनाती सीमाएँ बने।

कंपाइलेशन कैश संचालन की एक वस्तु भी है: हार्डवेयर, रनटाइम, मॉडल आकार या कंपाइल सेटिंग बदलने पर उसका संस्करण रखना या उसे फिर बनाना चाहिए। उपयोगी परिणाम में थ्रूपुट और दृश्य रिग्रेशन जाँच के साथ यह जीवनचक्र निर्णय भी शामिल है।

ग्राहक के लिए संचालन बिंदु चुनें

पूरा नोड इस्तेमाल करने से एक अनुरोध छोटा हो सकता है। क्षमता को छोटे रेप्लिका में बाँटने से कुल अधिक स्वतंत्र काम पूरे हो सकते हैं। मूल मॉडल प्रूनिंग और Turbo अडैप्टर वाला अलग MiniMax अध्ययन एक समकालिक राउंड से 478.14 क्लिप/घंटा की दर तक पहुँचा, जबकि हर अनुरोध लगभग 30.1 सेकंड लेता था। बदले मॉडल और सेवा संरचना को अलग गुणवत्ता मूल्यांकन चाहिए।

हर सेवा श्रेणी में क्या अनुकूलित करें
सेवा श्रेणीमुख्य उद्देश्यसाथ रखी जाने वाली सीमा
इंटरैक्टिव प्रीव्यूकम अनुरोध-समापन समयवार्म स्थिति, कतार और स्वीकार्य दृश्य बदलाव
कुल जनरेशनप्रति नोड स्वीकृत क्लिपरेप्लिका मेमोरी, प्रति अनुरोध प्रतीक्षा और गुणवत्ता
असिंक्रोनस मोशन ट्रांसफ़रपूरे काम और प्रति आउटपुट ऊर्जाकंपाइलेशन जीवनचक्र, मेमोरी गुंजाइश और स्रोत के प्रति निष्ठा

इन सभी उद्देश्यों के लिए एक ही सर्वश्रेष्ठ सेटिंग नहीं है। उपयोगी नतीजा लेटेंसी, थ्रूपुट, मेमोरी, ऊर्जा और गुणवत्ता के बीच मापे विकल्पों का समूह है। ये अध्ययन सेवा श्रेणी चुनने का प्रमाण देते हैं; फिर ग्राहक पायलट को प्रतिनिधि मीडिया पर स्वीकृत आउटपुट, कतार और डिलीवरी समय-सीमा सत्यापित करनी चाहिए।

पद्धति और सीमाएँ

तीनों अध्ययनों की अनुरोध शर्तें
अध्ययनआउटपुट शर्तमापन सीमा
Wan2.2 / LightWan2.281 फ़्रेम, 832×480, 16 FPS, 5.0625 s; नियंत्रित प्रॉम्प्ट और सीडLightX2V; वार्म समकालिक पाइपलाइन से एनकोड/सेव तक; मॉडल लोड और वार्मअप शामिल नहीं
Wan2.2 Animate-2 14B269 फ़्रेम, 713×1264, 24 FPS, 11.2083 s, स्रोत ऑडियो; समान संदर्भ मीडिया और चार सेगमेंट × दस चरणLightX2V; पूरे लॉन्च का वास्तविक बीता समय, चुने परिणाम के लिए भरा कंपाइल कैश
MiniMax-H3 FL2VA Turbo1344×768, 124 फ़्रेम, 24 FPS, 5.175 s फ़ाइल, जनरेट किया ऑडियो; समान प्रॉम्प्ट और सीड, डीनॉइज़र के चार देखे गए मूल्यांकनSGLang; सर्वर इन्फ़रेंस और पूरा API समापन अलग मापे गए
  • हार्डवेयर और दोहराव: आठ GPU वाला एक RTX PRO 6000 Blackwell नोड, प्रति GPU नाममात्र 96 GB मेमोरी। Wan हर वर्कर पर एक मापा वार्म जनरेशन रिकॉर्ड करता है। Animate की चुनी दर दो नोड रन में धीमी वाली है। हर H3 लेटेंसी उम्मीदवार में एक वार्मअप और एक मापा अनुरोध है; रेप्लिका दरें एक साथ हुए राउंड से हैं। ये छोटे अध्ययन निरंतर लोड SLA या लेटेंसी पर्सेंटाइल स्थापित नहीं करते।
  • Wan गुणवत्ता: कॉन्टैक्ट-शीट समीक्षा में सुसंगत क्लिप मिले, लेकिन एकमात्र जाँचे दृश्य में मानक 40-चरण संदर्भ ने प्रॉम्प्ट का शाब्दिक पालन अधिक स्पष्ट किया। डिस्टिलेशन, स्पार्सिटी और परिशुद्धता बदलाव अनुभूति-आधारित समानता स्थापित नहीं करते।
  • Animate गुणवत्ता: सभी 269 फ़्रेम BF16 से तुलना किए गए, जिनमें SSIM 0.9534 और PSNR 31.74 dB मिले। ये एक इनपुट पर दृश्य रिग्रेशन जाँच हैं।
  • H3 गुणवत्ता: चुने सन्निकटन का संदर्भ के विरुद्ध SSIM 0.8128 रहा, जो स्थानीय समानांतरण कॉन्फ़िगरेशन में देखी गई 0.8102 न्यूनतम सीमा से थोड़ा ऊपर था। यह संख्यात्मक जाँच गति, प्रॉम्प्ट पालन, ऑडियो सिंक या मानवीय पसंद की अनेक प्रॉम्प्ट वाली समीक्षा का विकल्प नहीं है। अलग प्रून किए मॉडल के थ्रूपुट अध्ययन में मूल मॉडल संदर्भ के विरुद्ध SSIM 0.8815 रहा।
  • योगदान और समय: मूल मॉडल और रनटाइम अनुकूलन के घटक देते हैं। संयुक्त बदलाव हर घटक का प्रभाव अलग नहीं करते। H3 सर्वर इन्फ़रेंस में क्लाइंट पोलिंग और डाउनलोड नहीं आते; तुलना में उसका 8.913 सेकंड सर्वर परिणाम और 10.045 सेकंड API परिणाम अलग रखने चाहिए।

Wan मापन 12–18 अगस्त और MiniMax के आगे के परीक्षण 1–2 सितंबर 2026 को हुए। परिणाम बताई गई मीडिया और आउटपुट शर्तों पर लागू हैं।

निजी MiniMax-H3 और Wan वीडियो जनरेशन

MiniMax-H3 या Wan2.2 के साथ निजी वीडियो जनरेशन में डिप्लॉयमेंट का पहला प्रश्न है कि सेवा तेज़ प्रीव्यू को प्राथमिकता देती है या समय के साथ पूरे हुए जॉब को। सर्वर इन्फ़रेंस विलंबता, पूर्ण API अनुरोध का पूरा होना और जनरेशन थ्रूपुट अलग मापन सीमाएँ बताते हैं। ग्राहक मूल्यांकन में हर परिणाम के साथ आउटपुट आयाम, स्रोत मीडिया और स्वीकार्य दृश्य बदलाव जुड़े रहने चाहिए।

अपने कार्यभार की ज़रूरत वाली वीडियो सेवा तय करें

स्रोत मीडिया, आउटपुट आकार, गुणवत्ता आवश्यकताएँ और डिलीवरी लक्ष्य लाएँ। हम बेसलाइन बनाएँगे और उस सेवा की क्षमता या लेटेंसी बदलने वाले संचालन बिंदुओं की तुलना करेंगे।

पायलट पर चर्चा करें