समस्या: बराबर प्रश्नों का अर्थ बराबर काम नहीं होता
निजी दस्तावेज़ सेवा को लंबित काम सही और समय पर पूरा करना होता है। हर GPU को बराबर प्रश्न देना उचित लगता है, लेकिन किसी वर्कर को अधिक उच्च-रिज़ॉल्यूशन पृष्ठ या लंबे मल्टीमोडल प्रॉम्प्ट मिलने पर सबसे धीमा वर्कर तय करता है कि पूरा बैच कब समाप्त होगा।
ProsGrow ने इस छिपे असंतुलन को पहचाना और उसी नोड पर प्रोफ़ाइल-आधारित आवंटन परखा। थ्रूपुट 44,608 से 45,978 दस्तावेज़ प्रश्न प्रति घंटा हुआ: 3.07% की वृद्धि। परिणाम दिखाता है कि अनुरोध संख्या संतुलित दिखने पर भी मल्टीमोडल सर्विंग में क्षमता खाली रह सकती है।
बेसलाइन → ProsGrow अनुकूलन
दोनों रन में उन्हीं आठ GPU पर Qwen3.6-27B BF16 और vLLM 0.25.1 इस्तेमाल हुए। हर अनुरोध ने संक्षिप्त उत्तर के लिए पृष्ठ की छवि और प्रश्न दिया। पूरे सत्यापन कार्यभार में 1,285 पृष्ठ छवियों पर 5,349 प्रश्न थे।
बेसलाइन प्रश्नों की संख्या संतुलित करती थी। ProsGrow ने कार्यभार प्रोफ़ाइल से हर रेप्लिका को मिलने वाले काम का अंतर घटाया, जबकि एक ही पृष्ठ के दोहराए गए प्रश्न उसी रेप्लिका पर रखे।
प्रति घंटे उत्तर दिए गए दस्तावेज़ प्रश्न
| मेट्रिक | संख्या-संतुलित बेसलाइन | ProsGrow का प्रोफ़ाइल-आधारित आवंटन |
|---|---|---|
| पूरे नोड का कार्य-समापन समय | 431.676 s | 418.821 s · 2.98% कम |
| दस्तावेज़ प्रश्न/घंटा | 44,608 | 45,978 · 3.07% अधिक |
| प्रति रेप्लिका अधिकतम / न्यूनतम प्रॉम्प्ट टोकन | 1.0759× | 1.00017× |
| औसत ANLS | 0.96402 | 0.96531 |
सभी प्रश्न सफलतापूर्वक पूरे हुए, और सटीक मिलान 91.92% रहा। मापे गए 4.16265 प्रश्न प्रति पृष्ठ के आधार पर थ्रूपुट 11,045 पृष्ठ छवियाँ/घंटा बनता है। यह रूपांतरण प्रश्न घनत्व पर निर्भर है।
प्रोफ़ाइलिंग ने क्या दिखाया
बराबर प्रश्न संख्या ने सबसे भारी और हल्के प्रॉम्प्ट कार्यभार का 7.59% अंतर छिपा रखा था। प्रोफ़ाइलिंग ने यह असंतुलन दिखाया; चुने गए आवंटन ने अंतर 0.017% के भीतर किया। अंतिम साझा समय-सीमा थ्रूपुट, अलग से मापी गई एक GPU की दर के आठ गुने का 98.61% पहुँचा।
जब कई प्रश्न उसी पृष्ठ के हों, तब काम संतुलित करते हुए पुनः उपयोग बनाए रखना भी ज़रूरी था। दोनों आवंटन ने यह स्थानीयता रखी, और अनुकूलित रन में वार्मअप सहित मल्टीमोडल प्रोसेसर-कैश हिट दर 76.06% रही। मापा गया लाभ इसी सर्विंग आधार पर काम को अधिक समान बाँटने से मिला।
प्रॉम्प्ट की मात्रा हर धीमे कार्य को नहीं समझाती: पृष्ठ का आकार, बैचिंग और अंत में बचे अनुरोध भी समापन को प्रभावित करते हैं। उपयोगी संकेत कोई सार्वभौमिक शेड्यूलिंग नियम नहीं, बल्कि नाममात्र संतुलित अनुरोधों और उनसे पैदा काम का अंतर था।
समझौते: मेमोरी की गुंजाइश और परिशुद्धता
बड़े पृष्ठ चित्रों ने मेमोरी की गुंजाइश को प्रदर्शन सीमा के साथ सही निष्पादन का विषय भी बनाया। चुना सर्विंग प्रोफ़ाइल पूरे सत्यापन सेट को संभाल सका और प्रीफ़िल उपयोग, लेटेंसी तथा सबसे बड़े पृष्ठों के लिए ज़रूरी गुंजाइश में संतुलन रखा।
उसी दस्तावेज़ कार्य-शर्त पर हमने छोटा मिश्रित-NVFP4 चेकपॉइंट भी जाँचा। उसका डिस्क आकार 20.43 GiB था, जबकि BF16 का 51.75 GiB, लेकिन उसने 44,970 प्रश्न/घंटा दिए—BF16 से 2.19% कम। औसत ANLS 0.96531 से 0.96314 और सटीक मिलान 91.92% से 91.14% हुआ। हमने इस वार्म दस्तावेज़-सर्विंग कॉन्फ़िगरेशन के लिए BF16 बनाए रखा।
क्वांटाइज़्ड रास्ते में भी छवि प्रीप्रोसेसिंग, विज़न एनकोडर और लंबा मल्टीमोडल प्रीफ़िल बड़े खर्च बने रहे। जाँची गई रनटाइम नीति में छोटे वेट्स ने पीक मेमोरी की गुंजाइश नहीं बढ़ाई। NVFP4 ने प्रति प्रश्न पूरे सर्वर की ऊर्जा 2.33% घटाई, लेकिन इस कार्यभार में यह लाभ थ्रूपुट और गुणवत्ता के नुकसान की भरपाई नहीं कर सका।
निजी दस्तावेज़ सेवा के लिए इसका अर्थ
मापी गई दर पर शेड्यूलिंग बदलाव से लगभग 1,369 अतिरिक्त प्रश्न प्रति नोड-घंटा पूरे होते हैं। दोहराए गए पृष्ठ प्रश्नों वाली कतार में उन्हीं आठ GPU से अधिक उपयोगी काम मिलता है। उत्पादन में अपनाने के लिए प्रतिनिधि प्रोफ़ाइलिंग या नए पृष्ठों हेतु सत्यापित लागत अनुमानक चाहिए; इस बेंचमार्क ने उसी निश्चित कॉर्पस से सीखी लागत इस्तेमाल की।
अनुकूलित रन की मध्यिका अनुरोध लेटेंसी 4.521 सेकंड और p95 9.411 सेकंड थी। मुक्त-पाठ प्रश्नों का ANLS 0.93498 था, जो कुल औसत से कम है। पायलट के लिए ग्राहक के पृष्ठ मिश्रण के अनुसार गुणवत्ता लक्ष्य और गलत उत्तर की लागत के अनुरूप समीक्षा नीति चाहिए।
मापे गए प्रश्नों से लागत मॉडल तक
लागत मॉडल प्रति घंटे की इंफ्रास्ट्रक्चर लागत को मापी गई 11,045 पृष्ठ-समतुल्य/घंटा क्षमता के बिके हिस्से से भाग देता है। यह स्थानीय 3.07% थ्रूपुट तुलना से अलग है।
| नोड खरीद लागत | पूरी क्षमता का सशुल्क उपयोग | 10% सशुल्क माँग |
|---|---|---|
| $100,000 | $0.49 | $4.21 |
| $150,000 | $0.69 | $6.22 |
मॉडल तीन वर्ष का मूल्यह्रास, 5% वार्षिक रखरखाव, 720 घंटे/माह, $0.10/kWh बिजली, कूलिंग और सुविधा खर्च के लिए 1.30 बिजली-उपयोग गुणक, सक्रिय सर्वर शक्ति 7.476590 kW तथा निष्क्रिय शक्ति 1.016 kW मानता है। 10% सशुल्क माँग पर बिक्री बेंचमार्क क्षमता की 10% होती है, लेकिन मूल्यह्रास, रखरखाव और निष्क्रिय बिजली का खर्च रहता है। श्रम, एप्लिकेशन संचालन, नेटवर्क, स्टोरेज और सेवा रिज़र्व शामिल नहीं हैं।
कीमत के संदर्भ में, AWS Textract Queries का मूल्य उदाहरण 5 अमेरिका पश्चिम (ओरेगन) में $15 प्रति 1,000 पृष्ठ बताता है, जिसकी जाँच 15 सितंबर 2026 को हुई। रिपोर्ट का उदाहरणात्मक $10 प्रति 1,000 पृष्ठ सेवा मूल्य उससे 33.33% कम है। यह मूल्य परिदृश्य है; हमारे मापे कार्यभार में प्रति पृष्ठ लगभग 4.16 प्रश्न हैं, और निष्कर्षण गुणवत्ता, फ़ीचर कवरेज तथा दी गई सेवा की समानता नहीं जाँची गई।
पद्धति और सीमाएँ
- मॉडल और रनटाइम: Qwen/Qwen3.6-27B, संशोधन
6a9e13bd6fc8f0983b9b99948120bc37f49c13e9, BF16; FlashAttention 2 के साथ vLLM 0.25.1। RTX PRO 6000 Blackwell Server Edition GPU पर आठ स्वतंत्र रेप्लिका, प्रत्येक में नाममात्र 96 GB मेमोरी। सर्विंग सेटिंग्स समान रहीं; थिंकिंग और प्रीफ़िक्स कैश बंद तथा मल्टीमोडल प्रोसेसर कैश चालू था। - डेटा और मूल्यांकन:
lmms-lab-encoder/DocVQAका पूरा सत्यापन विभाजन, संशोधन539088ef8a8ada01ac8e2e6d4e372586748a265e: 5,349 प्रश्न और 1,285 अलग चित्र। अनुरोधों ने निर्धारित सैंपलिंग के साथ छोटे उत्तर माँगे। गुणवत्ता और क्षमता उसी पूरे-सेट अनुकूलित रन से हैं। - मेट्रिक की परिभाषा: औसत सामान्यीकृत लेवेनश्टाइन समानता (ANLS) संदर्भ उत्तरों से समानता मापती है; सटीक मिलान अक्षरों के केस और खाली स्थानों को सामान्यीकृत करता है। ये DocVQA माप फ़ील्ड-स्तरीय कारोबारी त्रुटियाँ सीधे नहीं मापते।
- समय-सीमा: वार्म API दस्तावेज़-प्रश्न अनुरोध से पूरे उत्तर तक, नोड की समकालिक साझा समय-सीमा में मापन। प्रति घंटे की दरें लगभग सात मिनट के रन से निकाली गई हैं। PDF इनजेशन, उद्यम कनेक्टर, स्कीमा सत्यापन, मानवीय समीक्षा, कोल्ड स्टार्ट और उपलब्धता इंजीनियरिंग इस मापन से बाहर हैं।
- तुलना की सीमाएँ: तापमान शून्य होने पर भी बैच आकार-रूप बदलने से 35 सामान्यीकृत अनुमान बदले। ANLS की छोटी वृद्धि देखा गया संख्यात्मक अंतर है, यह प्रमाण नहीं कि शेड्यूलिंग मॉडल की सटीकता बढ़ाती है। समान शर्तों वाली यह शेड्यूलिंग तुलना स्थानीय बेंचमार्क है, बार-बार किया उत्पादन परीक्षण या विक्रेता-प्रमाणित परिणाम नहीं। पृष्ठ-दर रूपांतरण केवल इसी प्रश्न घनत्व पर लागू है।
निजी दस्तावेज़ प्रश्नोत्तर और मल्टीमॉडल इन्फ़रेंस
निजी दस्तावेज़ प्रश्नोत्तर के लिए यह बेंचमार्क मल्टीमॉडल इन्फ़रेंस क्षमता को लंबित दस्तावेज़ों और प्रसंस्करण समयसीमा से जोड़ने में मदद करता है। इसकी इकाई उत्तर दिया गया प्रश्न है, न कि इन्जेस्ट किया गया PDF या सत्यापित व्यावसायिक फ़ील्ड। ग्राहक डिप्लॉयमेंट में GPU सर्विंग प्रदर्शन के साथ प्रतिनिधि पृष्ठ चित्र, उत्तर गुणवत्ता और समीक्षा प्रक्रिया भी जाँचनी चाहिए।
अपने दस्तावेज़ कार्यभार को बेंचमार्क बनाएँ
ProsGrow आपके पृष्ठ मिश्रण, निष्कर्षण गुणवत्ता, प्रसंस्करण समय-सीमा और गवर्नेंस आवश्यकताओं के आधार पर निजी दस्तावेज़ पायलट तय कर सकता है।
दस्तावेज़ पायलट पर चर्चा करें