अलग कामों के लिए अलग सेवा श्रेणियाँ चाहिए
रचनात्मक प्रीव्यू में कम प्रतीक्षा चाहिए। मोशन ट्रांसफ़र को लंबे आउटपुट में मूल प्रदर्शन सुरक्षित रखना होता है। उच्च-रिज़ॉल्यूशन ऑडियो-वीडियो अनुरोध एक साथ कई GPU घेर सकता है। इन सेवाओं का अनुकूलन परिशुद्धता, अटेंशन, मेमोरी में बने रहने, समानांतरण, कंपाइलेशन और गुणवत्ता पर निर्णय माँगता है।
ProsGrow ने आठ GPU वाले RTX PRO 6000 Blackwell नोड पर इन सेवा श्रेणियों का मूल्यांकन किया। MiniMax-H3 तुलना में उन्हीं आठ GPU और उसी BF16 Turbo अनुरोध के लिए सर्वर इन्फ़रेंस 19.392 से 8.913 सेकंड हुआ: 54.0% कम लेटेंसी। अलग Wan और Animate अध्ययन दिखाते हैं कि डिलीवरी समय-सीमा, कुल माँग और गुणवत्ता आवश्यकताएँ उपयोगी कॉन्फ़िगरेशन कैसे बदलती हैं।
हमने कार्यभार की शर्तें तय कीं, बाधाओं की प्रोफ़ाइलिंग की, संभावित संचालन बिंदु तुलना किए और चुना परिणाम सत्यापित किया। अध्ययन हर मापे सुधार को उसकी संसाधन और गुणवत्ता सीमाओं से जोड़ते हैं।
MiniMax-H3: लेटेंसी, मेमोरी और गुणवत्ता
MiniMax-H3 ने PCIe नोड पर बड़ा ऑडियो-वीडियो कार्यभार बाँटने की लागत उजागर की। समानांतर काम के बँटवारे को बदलकर उन्हीं आठ GPU पर सर्वर इन्फ़रेंस 19.392 से 8.913 सेकंड किया: समान BF16 Turbo अनुरोध के लिए 54.0% कम लेटेंसी।
टेंसर और सीक्वेंस समानांतरण की संचार तथा मेमोरी ज़रूरतें अलग हैं। नियंत्रित मापन ने इस कार्यभार में संचार ओवरहेड घटाने के पक्ष में परिणाम दिए, लेकिन कर्नेल-स्तरीय कारण तय करने वाला उपयोगी कर्नेल ट्रेस नहीं मिला। चुने लेटेंसी प्रोफ़ाइल ने लगभग 84.2 GB प्रति GPU लिया; अधिक मेमोरी गुंजाइश वाले कॉन्फ़िगरेशन की लेटेंसी अधिक थी।
मूल परियोजना का SGLang MiniMax-H3 स्टैक मॉडल-सर्विंग और समानांतरण के घटक देता है। ProsGrow का योगदान इस हार्डवेयर पर उनका व्यवहार परखकर सेवा लक्ष्य के अनुसार चयन करना था।
अलग सन्निकटन प्रयोग ने बीच की गणनाएँ दोबारा इस्तेमाल कर सर्वर इन्फ़रेंस 8.913 से 7.092 सेकंड किया, यानी अतिरिक्त 20.44% कमी। API पूरा होने का समय 10.045 से 8.040 सेकंड हुआ, जबकि आठों GPU अब भी एक अनुरोध को आवंटित थे। डिकोड समय लगभग समान रहा।
इस अतिरिक्त लाभ की स्वीकृति शर्त अलग है: अनुमानित गणना के लिए गुणवत्ता जाँच चाहिए। चुने उम्मीदवार ने एक दृश्य पर सीमित संख्यात्मक-संगति जाँच पास की। यह संभावित संचालन बिंदु का प्रमाण है, व्यापक अनुभूति-आधारित समानता या हर ग्राहक कार्यभार की मंज़ूरी नहीं।
Wan2.2: नियंत्रित चार-चरण तुलना
| मेट्रिक | डिस्टिल्ड BF16 बेसलाइन | चुना LightX2V कॉन्फ़िगरेशन |
|---|---|---|
| वार्म पाइपलाइन | 22.164 s | 9.062 s · 59.1% कम |
| नॉइज़ हटाना | 19.164 s | 6.076 s |
| VAE डिकोडिंग | लगभग 2.37 s | लगभग 2.36 s |
चुना रास्ता कम परिशुद्धता, स्पार्स अटेंशन और GPU में स्थायी स्थान जोड़ता है। क्वांटाइज़ेशन-सचेत चरण डिस्टिलेशन सहित ये क्षमताएँ मूल LightWan2.2 मॉडल और LightX2V रनटाइम से आती हैं। ProsGrow ने निष्पादन रास्ता जोड़ा और सत्यापित किया, स्थानीय नियंत्रण बनाए और सेवा के समझौते मापे।
मानक 40-चरण BF16 रन में 357.640 सेकंड लगे। उस संदर्भ से अधिकांश अंतर मूल परियोजना के चरण डिस्टिलेशन से आता है। चार-चरण BF16 नियंत्रण डिस्टिलेशन के लाभ से अलग, अतिरिक्त संयुक्त रनटाइम लाभ 2.45× मापता है।
परिशुद्धता, अटेंशन और स्थायी स्थान एक-दूसरे को प्रभावित करते हैं
निष्पादन रास्ते की कई परतों में अवसर थे:
- परिशुद्धता और अटेंशन: छोटे संख्यात्मक निरूपण और स्पार्स अटेंशन ने नॉइज़ हटाने का काम घटाया। उनका संयुक्त लाभ मॉडल और समर्थित निष्पादन रास्ते पर निर्भर है; केवल फ़ॉर्मैट बदलने से तेज़ सर्विंग की गारंटी नहीं।
- GPU में स्थायी स्थान: छोटे एक्सपर्ट वेट्स GPU मेमोरी में रह सके, जिससे मुख्य रास्ते से होस्ट-से-डिवाइस ट्रांसफ़र हटे। मेमोरी बचत ने केवल गणित की मात्रा नहीं, गणना का स्थान भी बदला।
- पाइपलाइन संतुलन: डिकोडिंग लगभग 2.36 सेकंड रही। नॉइज़ हटाना तेज़ होने पर यह लगभग अपरिवर्तित चरण अनुरोध का बड़ा हिस्सा बना, जिससे डीनॉइज़र में आगे सुधार का लाभ सीमित हुआ।
- वार्म बनाम कोल्ड सेवा: अनुकूलित अलग प्रक्रिया में मॉडल लोड, वार्मअप और बंद होना मिलाकर 72.12 सेकंड लगे। इसलिए छोटा वार्म इन्फ़रेंस समय ऐसी सेवा पर निर्भर है जो स्टार्टअप काम और मेमोरी में बने रहने को संभाले।
नियंत्रित परिणाम इन बदलावों को साथ मापता है। यह हर परत को स्वतंत्र कारणात्मक गति-वृद्धि नहीं देता। इसलिए अनुकूलन को चरणवार समय और शुरू-से-अंत डिलीवरी सीमा दोनों चाहिए।
समकालिक नोड राउंड में GPU की वार्म लेटेंसी लगभग समान थी। सबसे धीमे समापन से इस प्रीव्यू शर्त के लिए लगभग 3,138 क्लिप/घंटा का अनुमान बनता है। यह एक मापे राउंड से क्षमता रूपांतरण है, लगातार एक घंटे का API परीक्षण नहीं। गुणवत्ता भी सीमा लगाती है: बनी दृश्य-रचनाएँ अलग थीं और अनुभूति-आधारित समानता स्थापित नहीं हुई।
Animate-2: असिंक्रोनस सेवा के लिए थ्रूपुट
Animate-2 संदर्भ छवि और स्रोत वीडियो से 11.21 सेकंड का मोशन-ट्रांसफ़र वीडियो बनाता है। लंबे काम असिंक्रोनस कतार के अनुकूल हैं, जहाँ पूरे आउटपुट और प्रति काम ऊर्जा, इंटरैक्टिव प्रीव्यू की समय-सीमा से अधिक महत्वपूर्ण होते हैं।
ProsGrow ने सत्यापित FP8 रास्ता और स्थायी कंपाइलेशन कैश जोड़े। कंपाइल कोड दोबारा उपयोग करने से बार-बार का स्टार्टअप काम घटा, जबकि परिशुद्धता ने स्थिर निष्पादन लागत बदली। दोनों इस सेवा की पूरी लॉन्च सीमा के भीतर मापे गए।
| मेट्रिक | BF16 बेसलाइन | FP8 + कंपाइल कैश |
|---|---|---|
| नोड आउटपुट दर | 24.382 आउटपुट/घंटा | 28.678 आउटपुट/घंटा · +17.62% |
| पूरे नोड की औसत शक्ति | 6.581 kW | 6.575 kW |
| प्रति आउटपुट ऊर्जा | 0.270 kWh | 0.229 kWh |
लगभग समान सर्वर शक्ति और अधिक थ्रूपुट ने प्रति आउटपुट ऊर्जा करीब 15.1% घटाई। चुने कॉन्फ़िगरेशन में केवल लगभग 4 GiB GPU मेमोरी गुंजाइश बची, जिससे आउटपुट आकार और समवर्ती काम महत्वपूर्ण तैनाती सीमाएँ बने।
कंपाइलेशन कैश संचालन की एक वस्तु भी है: हार्डवेयर, रनटाइम, मॉडल आकार या कंपाइल सेटिंग बदलने पर उसका संस्करण रखना या उसे फिर बनाना चाहिए। उपयोगी परिणाम में थ्रूपुट और दृश्य रिग्रेशन जाँच के साथ यह जीवनचक्र निर्णय भी शामिल है।
ग्राहक के लिए संचालन बिंदु चुनें
पूरा नोड इस्तेमाल करने से एक अनुरोध छोटा हो सकता है। क्षमता को छोटे रेप्लिका में बाँटने से कुल अधिक स्वतंत्र काम पूरे हो सकते हैं। मूल मॉडल प्रूनिंग और Turbo अडैप्टर वाला अलग MiniMax अध्ययन एक समकालिक राउंड से 478.14 क्लिप/घंटा की दर तक पहुँचा, जबकि हर अनुरोध लगभग 30.1 सेकंड लेता था। बदले मॉडल और सेवा संरचना को अलग गुणवत्ता मूल्यांकन चाहिए।
| सेवा श्रेणी | मुख्य उद्देश्य | साथ रखी जाने वाली सीमा |
|---|---|---|
| इंटरैक्टिव प्रीव्यू | कम अनुरोध-समापन समय | वार्म स्थिति, कतार और स्वीकार्य दृश्य बदलाव |
| कुल जनरेशन | प्रति नोड स्वीकृत क्लिप | रेप्लिका मेमोरी, प्रति अनुरोध प्रतीक्षा और गुणवत्ता |
| असिंक्रोनस मोशन ट्रांसफ़र | पूरे काम और प्रति आउटपुट ऊर्जा | कंपाइलेशन जीवनचक्र, मेमोरी गुंजाइश और स्रोत के प्रति निष्ठा |
इन सभी उद्देश्यों के लिए एक ही सर्वश्रेष्ठ सेटिंग नहीं है। उपयोगी नतीजा लेटेंसी, थ्रूपुट, मेमोरी, ऊर्जा और गुणवत्ता के बीच मापे विकल्पों का समूह है। ये अध्ययन सेवा श्रेणी चुनने का प्रमाण देते हैं; फिर ग्राहक पायलट को प्रतिनिधि मीडिया पर स्वीकृत आउटपुट, कतार और डिलीवरी समय-सीमा सत्यापित करनी चाहिए।
पद्धति और सीमाएँ
| अध्ययन | आउटपुट शर्त | मापन सीमा |
|---|---|---|
| Wan2.2 / LightWan2.2 | 81 फ़्रेम, 832×480, 16 FPS, 5.0625 s; नियंत्रित प्रॉम्प्ट और सीड | LightX2V; वार्म समकालिक पाइपलाइन से एनकोड/सेव तक; मॉडल लोड और वार्मअप शामिल नहीं |
| Wan2.2 Animate-2 14B | 269 फ़्रेम, 713×1264, 24 FPS, 11.2083 s, स्रोत ऑडियो; समान संदर्भ मीडिया और चार सेगमेंट × दस चरण | LightX2V; पूरे लॉन्च का वास्तविक बीता समय, चुने परिणाम के लिए भरा कंपाइल कैश |
| MiniMax-H3 FL2VA Turbo | 1344×768, 124 फ़्रेम, 24 FPS, 5.175 s फ़ाइल, जनरेट किया ऑडियो; समान प्रॉम्प्ट और सीड, डीनॉइज़र के चार देखे गए मूल्यांकन | SGLang; सर्वर इन्फ़रेंस और पूरा API समापन अलग मापे गए |
- हार्डवेयर और दोहराव: आठ GPU वाला एक RTX PRO 6000 Blackwell नोड, प्रति GPU नाममात्र 96 GB मेमोरी। Wan हर वर्कर पर एक मापा वार्म जनरेशन रिकॉर्ड करता है। Animate की चुनी दर दो नोड रन में धीमी वाली है। हर H3 लेटेंसी उम्मीदवार में एक वार्मअप और एक मापा अनुरोध है; रेप्लिका दरें एक साथ हुए राउंड से हैं। ये छोटे अध्ययन निरंतर लोड SLA या लेटेंसी पर्सेंटाइल स्थापित नहीं करते।
- Wan गुणवत्ता: कॉन्टैक्ट-शीट समीक्षा में सुसंगत क्लिप मिले, लेकिन एकमात्र जाँचे दृश्य में मानक 40-चरण संदर्भ ने प्रॉम्प्ट का शाब्दिक पालन अधिक स्पष्ट किया। डिस्टिलेशन, स्पार्सिटी और परिशुद्धता बदलाव अनुभूति-आधारित समानता स्थापित नहीं करते।
- Animate गुणवत्ता: सभी 269 फ़्रेम BF16 से तुलना किए गए, जिनमें SSIM 0.9534 और PSNR 31.74 dB मिले। ये एक इनपुट पर दृश्य रिग्रेशन जाँच हैं।
- H3 गुणवत्ता: चुने सन्निकटन का संदर्भ के विरुद्ध SSIM 0.8128 रहा, जो स्थानीय समानांतरण कॉन्फ़िगरेशन में देखी गई 0.8102 न्यूनतम सीमा से थोड़ा ऊपर था। यह संख्यात्मक जाँच गति, प्रॉम्प्ट पालन, ऑडियो सिंक या मानवीय पसंद की अनेक प्रॉम्प्ट वाली समीक्षा का विकल्प नहीं है। अलग प्रून किए मॉडल के थ्रूपुट अध्ययन में मूल मॉडल संदर्भ के विरुद्ध SSIM 0.8815 रहा।
- योगदान और समय: मूल मॉडल और रनटाइम अनुकूलन के घटक देते हैं। संयुक्त बदलाव हर घटक का प्रभाव अलग नहीं करते। H3 सर्वर इन्फ़रेंस में क्लाइंट पोलिंग और डाउनलोड नहीं आते; तुलना में उसका 8.913 सेकंड सर्वर परिणाम और 10.045 सेकंड API परिणाम अलग रखने चाहिए।
Wan मापन 12–18 अगस्त और MiniMax के आगे के परीक्षण 1–2 सितंबर 2026 को हुए। परिणाम बताई गई मीडिया और आउटपुट शर्तों पर लागू हैं।
निजी MiniMax-H3 और Wan वीडियो जनरेशन
MiniMax-H3 या Wan2.2 के साथ निजी वीडियो जनरेशन में डिप्लॉयमेंट का पहला प्रश्न है कि सेवा तेज़ प्रीव्यू को प्राथमिकता देती है या समय के साथ पूरे हुए जॉब को। सर्वर इन्फ़रेंस विलंबता, पूर्ण API अनुरोध का पूरा होना और जनरेशन थ्रूपुट अलग मापन सीमाएँ बताते हैं। ग्राहक मूल्यांकन में हर परिणाम के साथ आउटपुट आयाम, स्रोत मीडिया और स्वीकार्य दृश्य बदलाव जुड़े रहने चाहिए।
अपने कार्यभार की ज़रूरत वाली वीडियो सेवा तय करें
स्रोत मीडिया, आउटपुट आकार, गुणवत्ता आवश्यकताएँ और डिलीवरी लक्ष्य लाएँ। हम बेसलाइन बनाएँगे और उस सेवा की क्षमता या लेटेंसी बदलने वाले संचालन बिंदुओं की तुलना करेंगे।
पायलट पर चर्चा करें