समस्या: वाक् मॉडल बदले बिना क्षमता वापस पाना
आर्काइव ट्रांसक्रिप्शन सेवा को तय गुणवत्ता लक्ष्य पूरा करते हुए अधिक ऑडियो प्रोसेस करना होता है। ProsGrow ने MLPerf Inference v6.0 के सार्वजनिक Whisper कार्यान्वयन से शुरुआत की और आठ-GPU RTX PRO 6000 Blackwell नोड पर उसकी समर्थित प्रोफ़ाइल दोहराई। पूरी अवधि वाली बेसलाइन ने 291.771 ऑडियो सैंपल/सेकंड दिए।
हमने इंजन के बैचिंग व्यवहार की प्रोफ़ाइलिंग की और पाया कि सार्वजनिक प्रोफ़ाइल इस सेटअप के लिए सर्वोत्तम नहीं थी। समर्थित प्रोफ़ाइल समायोजन ने दो पूरी-अवधि रन में 299.444 सैंपल/सेकंड दिए: उन्हीं आठ GPU पर 2.63% अधिक थ्रूपुट। चुनी प्रोफ़ाइल ने बेंचमार्क की सटीकता सीमा भी पार की।
बेसलाइन → ProsGrow ट्यूनिंग
| स्थानीय कॉन्फ़िगरेशन | ऑडियो सैंपल/सेकंड | सैंपल/सेकंड/GPU | स्थानीय बेसलाइन से बढ़त |
|---|---|---|---|
| सार्वजनिक प्रोफ़ाइल · बेसलाइन | 291.771 | 36.471 | — |
| चुनी प्रोफ़ाइल · रन 1 | 299.628 | 37.454 | 2.69% |
| चुनी प्रोफ़ाइल · रन 2, देखा गया न्यूनतम | 299.260 | 37.408 | 2.57% |
| चुनी प्रोफ़ाइल · दो रन का औसत | 299.444 | 37.431 | 2.63% |
दो ट्यून किए रन का अंतर उनके औसत का केवल 0.123% था। सावधानीपूर्ण क्षमता योजना के लिए हम कम देखा गया परिणाम, 299.260 सैंपल/सेकंड, लेते हैं। बेसलाइन का एक और ट्यून की प्रोफ़ाइल के दो पूरी-अवधि माप हैं।
प्रोफ़ाइलिंग ने इंजन बैचिंग के बारे में क्या बताया
दो चुने रन में औसत GPU उपयोग 94.417% से 97.373% और 97.312% हो गया। थ्रूपुट परिणामों के साथ यह क्षमता वापस मिलने की वजह बेहतर बैचिंग लय होने का समर्थन करता है। यह टेलीमेट्री से निकला निष्कर्ष है, अनलिखे इंजन आंतरिक व्यवहार का दावा नहीं।
ProsGrow ने पूरी पाइपलाइन का मूल्यांकन किया, समर्थित इंजन प्रोफ़ाइल चुनी और पूरी-अवधि पुनरावृत्तियों तथा अलग सटीकता जाँच से सत्यापन किया। सार्वजनिक स्रोत, चेकपॉइंट, डेटासेट, डिकोडिंग व्यवहार, LoadGen सीड और मूल्यांकनकर्ता स्थिर रहे। वही FP16 स्रोत चेकपॉइंट और NVFP4 डिकोडर मैट्रिक्स-मल्टिप्लिकेशन प्लगइन इस्तेमाल हुआ; स्रोत का कोई परफ़ॉर्मेंस पैच सक्रिय नहीं था।
समझौता: थोड़ी अधिक सक्रिय पावर पर अधिक थ्रूपुट
पहले पूरे ट्यून रन ने औसत कुल GPU पावर 3,428 W से 3,508 W की, जबकि थ्रूपुट 2.69% बढ़ा। प्रति 1,000 स्रोत-ऑडियो घंटे की केवल-GPU ऊर्जा 0.4885 से 0.4868 kWh तक थोड़ी घटी। क्षमता बढ़त के लिए मापी गई ऊर्जा दक्षता कम नहीं करनी पड़ी, लेकिन ऊर्जा का अंतर छोटा है।
गुणवत्ता स्पष्ट स्वीकृति शर्त रही। ट्यून प्रोफ़ाइल के AccuracyOnly रन ने सभी 1,633 सैंपल जाँचे और MLCommons मूल्यांकनकर्ता से 2.131770% शब्द त्रुटि दर मिली, जो अनुमत 3.046429% से कम है। यह जाँचे गए कॉर्पस पर पास परिणाम स्थापित करता है; इस तुलना में स्थानीय बेसलाइन का अलग सटीकता रन नहीं हुआ।
बाहरी संदर्भ: कम GPU पर तुलनीय थ्रूपुट
रिपोर्ट की मुख्य सार्वजनिक Whisper तुलना HPE का आठ-GPU परिणाम, 294.821 सैंपल/सेकंड है। हमारा 299.444 सैंपल/सेकंड औसत 1.57% अधिक नोड थ्रूपुट है। दोनों आठ RTX PRO 6000 GPU इस्तेमाल करते हैं, पर होस्ट और सॉफ़्टवेयर विवरण अलग हैं।
ऑडिट किए सार्वजनिक MLPerf v6.0 स्नैपशॉट में HPE का दस-GPU परिणाम, 297.661 सैंपल/सेकंड भी है। हमारा स्थानीय आठ-GPU औसत 20% कम एक्सेलेरेटर के साथ 0.60% अधिक था। GPU संख्या से भाग देने पर 37.431 बनाम 29.766 सैंपल/सेकंड/GPU मिलते हैं, यानी 25.75% अंतर।
यह सिस्टम दक्षता का उपयोगी संदर्भ है। अपने नोड पर अलग करके मापी गई इंजीनियरिंग बढ़त इंजन प्रोफ़ाइल चयन से 2.63% सुधार है। बाहरी तुलना में होस्ट और सॉफ़्टवेयर स्टैक का अंतर भी है, इसलिए पूरा प्रति-GPU लाभ उस एक बदलाव से नहीं जोड़ा जा सकता।
ट्रांसक्रिप्शन सेवा के लिए इससे क्या बदलता है
जाँचे कॉर्पस पर दो रन का औसत लगभग प्रति वास्तविक घंटे 7,202 घंटे स्रोत ऑडियो है, बेसलाइन पर 7,017 के मुकाबले। बेंचमार्क की औसत क्लिप अवधि से निकालने पर यह प्रति सक्रिय नोड-घंटे लगभग 185 अतिरिक्त स्रोत-ऑडियो घंटे हैं। लगातार आर्काइव बैकलॉग वाली सेवा उसी लगे हुए GPU पर प्रोसेसिंग अवधि घटा सकती है।
ProsGrow आर्काइव ट्रांसक्रिप्शन को थ्रूपुट, ट्रांसक्रिप्शन गुणवत्ता, कतार की आयु और डेटा सीमाओं के आधार पर योग्य ठहराएगा। लाइव ट्रांसक्रिप्शन का अपना सेवा अनुबंध चाहिए: समवर्ती कनेक्शन, आंशिक परिणाम व्यवहार, अंतिम परिणाम लेटेंसी और रिकवरी। Offline सैंपल दर लाइव-स्ट्रीम क्षमता तय नहीं कर सकती।
10% सशुल्क माँग पर वाक् प्रसंस्करण लागत
15 सितंबर की क्षमता रिपोर्ट $100,000 नोड, तीन साल के मूल्यह्रास, 70% बेंचमार्क-से-सेवा दक्षता और 10% सशुल्क माँग पर प्रति बेचे ऑडियो मिनट $0.0001321 मॉडल करती है। उसके उस समय के API मूल्य इनपुट OpenAI होस्टेड whisper-1, $0.006/मिनट और Deepgram Nova-3 एकभाषी पूर्व-रिकॉर्डेड PAYG, $0.0043/मिनट हैं। मॉडल किया इन्फ्रास्ट्रक्चर आँकड़ा क्रमशः 97.80% और 96.93% कम है।
गणना मापी क्षमता को प्रति कैलेंडर घंटे लगभग 30,247.5 बेचे ऑडियो मिनट में बदलती है, फिर लगभग $3.995 प्रति घंटे इन्फ्रास्ट्रक्चर लागत को उससे भाग देती है। लागत में $100,000 ÷ (3 × 8,760 घंटे) हार्डवेयर मूल्यह्रास और $0.10/kWh बिजली शामिल है; पूरे नोड की अनुमानित पावर 1.5 kW निष्क्रिय और 5.5 kW सक्रिय है, जिसे 10% माँग से भारित किया गया है। सेवा दक्षता और सशुल्क माँग अलग धारणाएँ हैं।
घंटे की लागत और बाकी धारणाएँ स्थिर रखें तो मापी गई 2.63% थ्रूपुट बढ़त अकेले इकाई लागत लगभग 2.56% घटाती है। API कीमत से बड़ा अंतर निजी बैच क्षमता के मॉडल किए अर्थशास्त्र से आता है और माँग पर बहुत निर्भर है।
यह इन्फ्रास्ट्रक्चर-लागत बनाम मूल्य तुलना है, सिद्ध ग्राहक बचत नहीं। इसमें रखरखाव, कूलिंग/PUE, श्रम, नेटवर्किंग, स्टोरेज, सहायता, रिडंडेंसी और SLA रिज़र्व शामिल नहीं हैं। स्थानीय Whisper Large v3, होस्टेड whisper-1 और Nova-3 मॉडल और सेवा सुविधाओं में अलग हैं; समान सेवा गुणवत्ता स्थापित नहीं की गई।
Granite API और लाइव वाक् प्रसंस्करण
रिपोर्ट एक अलग Granite कतारबद्ध API सेवा भी मापती है। होस्ट प्लेसमेंट और अनुरोध बैचिंग से थ्रूपुट 19,062.88 से 28,368.99 RTFx हुआ, अपनी मूल स्थानीय API बेसलाइन पर 48.82% बढ़त। RTFx का अर्थ प्रति वास्तविक सेकंड प्रोसेस किए ऑडियो सेकंड हैं। बैच API ने 62,880 उच्चारण जाँचे, कोई विकृत आउटपुट नहीं मिला और सबसे खराब WER 3.4942% था।
Granite का अलग async Offline परिणाम 68,932.91 RTFx है। रिपोर्ट के लाइव-ASR परीक्षण ने एक ही होस्ट पर तीन 24-सेकंड लूपबैक परीक्षणों में 5,568 WebSocket कनेक्शन बनाए रखे। इनके मॉडल, स्कोरिंग और टाइमिंग सीमाएँ अलग हैं। हर मुख्य परिणाम अलग परीक्षण में पूरा नोड इस्तेमाल करता है; बाहरी ट्रैफ़िक, लंबे लाइव संचालन और रिकवरी का सत्यापन बाकी है।
पद्धति और सीमाएँ
- सिस्टम और स्टैक: 20–21 अगस्त 2026 के परीक्षणों में आठ NVIDIA RTX PRO 6000 Blackwell Server Edition GPU, दो AMD EPYC 9575F CPU, TensorRT 10.14.1.48, TensorRT-LLM 1.3.0rc0 और CUDA 13.1 इस्तेमाल हुए। सार्वजनिक संदर्भ कोड और मॉडल/डेटा हैश निश्चित रखकर जाँचे गए।
- वर्कलोड और इकाइयाँ: MLPerf Whisper डेटा अनुबंध LibriSpeech को 1,633 मोनो, 16 kHz ऑडियो सैंपल में पुनः पैक करता है। हर सैंपल पर 30 सेकंड का पैड किया Whisper कंप्यूट लगता है; वास्तविक स्रोत अवधि औसतन 24.0505 सेकंड है। ऑडियो सैंपल/सेकंड, जेनरेट किए टोकन/सेकंड और स्रोत-ऑडियो घंटे अलग इकाइयाँ हैं।
- प्रदर्शन वैधता: बेसलाइन और दोनों मुख्य ट्यून रन ने न्यूनतम 10 मिनट पूरे किए और LoadGen VALID रहे। छोटे डायग्नोस्टिक रन से उम्मीदवार चुने गए; उन्हें पूरी-अवधि मुख्य परिणामों में नहीं मिलाया गया। 0.123% सीमा दो ट्यून पुनरावृत्तियों की है, विश्वास अंतराल नहीं।
- सटीकता और अनुपालन: ये स्थानीय MLPerf-आधारित माप हैं, आधिकारिक MLPerf सबमिशन या MLCommons-समीक्षित परिणाम नहीं। TEST01 प्रदर्शन सत्यापन पास हुआ। सीधे आउटपुट तुलना में अंतर मिले; अनुमत फ़ॉलबैक ने बेसलाइन और ऑडिट आउटपुट पर समान 2.168070% WER दिया और उस जाँच को पूरा किया। यह फ़ॉलबैक से स्वीकृति थी, बाइट-दर-बाइट सटीकता पास नहीं। पूर्ण AccuracyOnly WER 2.131770% ही है।
- प्रोडक्शन दायरा: पावर आँकड़े केवल GPU के हैं, होस्ट और कूलिंग नहीं। ऑडियो-घंटा रूपांतरण इसी कॉर्पस पर आधारित हैं और लगातार कतार मानते हैं। ग्राहक लहजे, भाषाएँ, शोर, ओवरलैप, शब्दावली, स्टोरेज, नेटवर्किंग, रीट्राई, उपयोग और लेटेंसी के अलग माप चाहिए।
निजी स्पीच-टू-टेक्स्ट और ऑफ़लाइन Whisper ट्रांसक्रिप्शन
निजी ऑडियो ट्रांसक्रिप्शन के लिए यह Whisper बेंचमार्क तय समयसीमा में आर्काइव संसाधित करने हेतु आवश्यक क्षमता का अनुमान लगाने में मदद करता है। स्पीच-टू-टेक्स्ट थ्रूपुट और शब्द त्रुटि दर (WER) को प्रतिनिधि रिकॉर्डिंग पर साथ जाँचना चाहिए। ऑफ़लाइन बेंचमार्क क्षमता यह स्थापित नहीं करती कि सेवा कितनी लाइव स्ट्रीम संभाल सकती है या आंशिक ट्रांसक्रिप्ट कितनी जल्दी मिलते हैं।
अपनी निजी वाक् पाइपलाइन की क्षमता वापस पाएँ
ProsGrow आपके ऑडियो वर्कलोड को जाँच सकता है, सीमित करने वाला पाइपलाइन चरण अलग कर सकता है और थ्रूपुट, ट्रांसक्रिप्शन गुणवत्ता तथा लेटेंसी लक्ष्यों के अनुसार तैनाती प्रोफ़ाइल सत्यापित कर सकता है।
ProsGrow AI से बात करें