इंजीनियरिंग · इमेज इन्फ़रेंस

ProsGrow ने प्रति घंटे 59,881 FLUX.2 इमेज वेरिएंट कैसे हासिल किए

ProsGrow ने आठ GPU पर 59,881 FLUX.2 इमेज वेरिएंट/घंटा की मापी गई दर हासिल की, जिसमें तीन छोटे बेंचमार्क रन का सबसे कम परिणाम लिया गया। एक GPU पर संख्यात्मक सटीकता बदलने से मिली 32.5% बढ़त और नोड-स्तरीय प्रोफ़ाइलिंग ने चुने गए दो-वेरिएंट वर्कफ़्लो को आकार दिया।

· अपडेट · ProsGrow AI इंजीनियरिंग · 6 मिनट का पठन

FLUX.2 Klein: एक GPU पर BF16 के 1.333 से NVFP4 के 1.766 इमेज/सेकंड तक, 32.5% बढ़त।

पूरी इमेज सेवा क्षमता तय करती है

कैटलॉग टीम को अपने वर्कफ़्लो में स्वीकृत इमेज वेरिएंट चाहिए। सेवा में प्रॉम्प्ट एन्कोडिंग, डीनॉइज़िंग, डिकोडिंग, API हैंडलिंग, PNG एन्कोडिंग और आउटपुट सेव करना शामिल है। मॉडल का तेज़ निष्पादन बदल देता है कि डिलीवरी को कौन-सा चरण सीमित करता है।

ProsGrow ने FLUX.2 Klein 4B के साथ इस पूरे पथ को मापा। समान परिस्थितियों वाली एक-GPU तुलना में नेटिव NVFP4 ने थ्रूपुट 32.5% बढ़ाया। अगली चुनौती साझा इन्फ्रास्ट्रक्चर थी: एक GPU को सबसे तेज़ बनाने वाली प्रोफ़ाइल पूरे नोड पर तैनात करने पर धीमी हो गई। इस उलटाव की प्रोफ़ाइलिंग से ऐसी सेवा कॉन्फ़िगरेशन मिली जिसने 59,881 इमेज वेरिएंट/घंटा की मापी गई दर दी।

नियंत्रित संख्यात्मक सटीकता तुलना

बेसलाइन · ComfyUI BF161.333 इमेज/सेकंड
ProsGrow कॉन्फ़िगरेशन · नेटिव NVFP41.766 इमेज/सेकंड · +32.5%
एक RTX PRO 6000 Blackwell GPU। वही ComfyUI वर्कफ़्लो, 1024×1024 आउटपुट, चार चरण, हर अनुरोध पर एक इमेज और PNG सेव होने तक क्लाइंट टाइमिंग।
वही GPU, ComfyUI वर्कफ़्लो और डिलीवर किए गए आउटपुट की मापन सीमा
मेट्रिकBF16 बेसलाइननेटिव NVFP4
औसत अनुरोध समय0.750 s0.566 s
थ्रूपुट1.333 इमेज/सेकंड1.766 इमेज/सेकंड · +32.5%
देखा गया डिवाइस मेमोरी उपयोगलगभग 18 GiBलगभग 11.6 GiB

आधिकारिक NVFP4 चेकपॉइंट Black Forest Labs से आता है और ComfyUI नेटिव क्वांटाइज़्ड निष्पादन पथ देता है। ProsGrow ने जाँचा कि अपेक्षित प्रिसिशन पथ सक्रिय था, वर्कफ़्लो समान रखा और PNG सेव होने तक मापा। थ्रूपुट सुधार के साथ अनुरोध लेटेंसी 24.5% कम हुई।

कम मेमोरी उपयोग ने काम ओवरलैप करने की जगह बनाई, लेकिन सिर्फ़ प्रिसिशन से नोड पूरी तरह व्यस्त नहीं हुआ। पहली NVFP4 तैनाती में GPU कंप्यूट यूनिट गतिविधि सिर्फ़ 52.5% मापी गई। इससे शेड्यूलिंग और GPU ऑपरेशनों के बीच होस्ट चरणों की गहरी जाँच की ज़रूरत सामने आई।

स्थानीय सर्वोत्तम सेटिंग नोड स्तर पर पिछड़ गई

ComfyUI वर्कफ़्लो कतार को क्रमिक रूप से चलाता है। स्वतंत्र रेज़िडेंट वर्करों को ओवरलैप करने से GPU काम जारी रख सका, जबकि दूसरे अनुरोध API ट्रैफ़िक, PNG एन्कोडिंग या फ़ाइलसिस्टम आउटपुट संभाल रहे थे। अलग GPU पर अधिक ओवरलैप ने उपयोग और थ्रूपुट बढ़ाया।

नोड स्तर पर यही रुझान नहीं रहा। जब हर GPU समान होस्ट संसाधनों के लिए प्रतिस्पर्धा करने लगा, तो सबसे तेज़ एकल-GPU प्रोफ़ाइल सिर्फ़ 46,759 इमेज/घंटा दे सकी। कम भीड़ वाली सेवा टोपोलॉजी ने अपने सावधानीपूर्ण पुनरावृत्ति परिणाम में 57,540 इमेज/घंटा दीं। कम पावर के स्थिर अंतराल होस्ट, API, PNG या फ़ाइलसिस्टम चरणों में रुकावटों के अनुरूप थे; ट्रेस ने किसी एक घटक को अकेला कारण नहीं ठहराया।

सिस्टम की मुख्य सीख यह है: स्थानीय सर्वोत्तम सेटिंग नोड-स्तरीय सर्वोत्तम नहीं होती। एकल GPU का अधिक उपयोग कहीं और प्रतिस्पर्धा बढ़ा सकता है। ProsGrow ने समकालिक नोड मापों से सेवा टोपोलॉजी चुनी और पूरे हुए आउटपुट, मेमोरी उपयोग तथा रन के बीच अंतर को साथ देखा।

एक परिभाषित रचनात्मक वर्कफ़्लो की क्षमता

रचनात्मक वर्कफ़्लो में अक्सर एक एसेट के कई संस्करण चाहिए। इस सेवा अनुबंध के लिए ProsGrow ने प्रति अनुरोध एक प्रॉम्प्ट के दो वेरिएंट बनाने का मूल्यांकन किया। चुनी गई प्रोफ़ाइल ने तीन समकालिक नोड रन में न्यूनतम परिणाम के आधार पर 59,881 वेरिएंट/घंटा हासिल किए। यह पिछले सावधानीपूर्ण नोड दर से 4.07% अधिक था, और रन के बीच फैलाव 1.61% था।

क्षमता की इकाई महत्वपूर्ण है: बने हुए वेरिएंट अलग-अलग प्रॉम्प्ट नहीं हैं। क्लाइंट ने एक नियंत्रित प्रॉम्प्ट दोहराया, नॉइज़ सीड बदले और ComfyUI कैशिंग उपलब्ध रही। यह परिणाम विविध नए प्रॉम्प्ट के प्रवाह या हर अनुरोध में नई प्रॉम्प्ट एन्कोडिंग को नहीं मापता।

सभी 2,880 मापे गए आउटपुट का हिसाब मिला और चुने गए एरर मार्कर का कोई संकेत नहीं मिला। हर रन लगभग 57 सेकंड चला। इससे ग्राहक पायलट के लिए मापा हुआ शुरुआती बिंदु मिलता है; लगातार आने वाले अनुरोध, कतार और ग्राहक स्वीकृति अभी भी उपयोगी क्षमता तय करते हैं।

क्षमता का लागत के लिए क्या अर्थ है

माँग और सेवा आवश्यकताएँ स्पष्ट होने पर क्षमता लागत अध्ययन में मदद कर सकती है। मौजूदा $100,000 नोड और 10% सशुल्क माँग वाले परिदृश्य में मापी गई दर सालाना 52.46 मिलियन बेचे गए वेरिएंट के बराबर है। लगभग $40,058 की मॉडल की गई वार्षिक इन्फ्रास्ट्रक्चर लागत से प्रति बेचा गया वेरिएंट $0.000764 मिलता है।

इस परिदृश्य में तीन साल का मूल्यह्रास, 5% वार्षिक रखरखाव, 8,760 घंटे का वर्ष, $0.10/kWh बिजली, 1.30 बिजली-उपयोग गुणक और सर्वर पावर 1.016 kW निष्क्रिय तथा 6 kW सक्रिय मानी गई है। श्रम, व्यवसाय संचालन, नेटवर्किंग, स्टोरेज और सेवा रिज़र्व शामिल नहीं हैं। खरीद निर्णय में उपयोग करने से पहले माँग और स्वीकृत आउटपुट दर सत्यापित करनी होगी।

चुनी गई प्रोफ़ाइल में प्रति इमेज GPU बोर्ड ऊर्जा 0.0571 Wh भी मापी गई, जिसमें होस्ट और कूलिंग शामिल नहीं हैं। दोनों आँकड़े दोहराए गए प्रॉम्प्ट और दो-वेरिएंट अनुबंध से जुड़े हैं। वे होस्टेड सेवा की गुणवत्ता या लागत की बराबरी स्थापित नहीं करते।

प्रोडक्शन के लिए संचालन सेटिंग चुनना

बैच क्रिएटिव वर्कफ़्लो के लिए प्रति घंटे स्वीकृत वेरिएंट उपयोगी लक्ष्य हो सकते हैं। इंटरैक्टिव टूल को कम अनुरोध लेटेंसी और अचानक बढ़ी माँग के लिए जगह भी चाहिए। वर्कर ओवरलैप मेमोरी और साझा होस्ट क्षमता खर्च करता है, इसलिए चुनी कॉन्फ़िगरेशन में इनपुट प्रोसेसिंग, स्टोरेज, रीट्राई और अपेक्षित आगमन दर के लिए गुंजाइश होनी चाहिए।

मापी गई प्रक्रिया प्रिसिशन सत्यापन को सेवा प्रोफ़ाइलिंग और नोड-स्तरीय जाँच से जोड़ती है। इससे ग्राहक का अगला निर्णय स्पष्ट होता है: क्या प्रतिनिधि प्रॉम्प्ट मिश्रण आवश्यक गुणवत्ता और डिलीवरी समय सीमा पर क्षमता बढ़त बनाए रखता है? यही निजी एंडपॉइंट का आकार तय करने का आधार है।

पद्धति और सीमाएँ

  • हार्डवेयर और सॉफ़्टवेयर: आठ GPU वाला एक RTX PRO 6000 Blackwell नोड, प्रति GPU 96 GB नाममात्र मेमोरी; ComfyUI 0.32.0, comfy-kitchen 0.2.30, PyTorch 2.11.0, CUDA 13.0। NVFP4 चेकपॉइंट रिविज़न 1db2b2f7 था।
  • वर्कलोड: FLUX.2 Klein 4B, 1024×1024 आउटपुट, चार Euler चरण और नियंत्रित स्टूडियो प्रोडक्ट-फ़ोटो प्रॉम्प्ट। समान प्रिसिशन तुलना में प्रति अनुरोध एक इमेज बनी; चुने नोड प्रोफ़ाइल में दो वेरिएंट बने। दोहराए प्रॉम्प्ट और उपलब्ध कैशिंग विविध ग्राहक ट्रैफ़िक पर निष्कर्ष सीमित करते हैं।
  • टाइमिंग: माप से पहले मॉडल लोड और वार्म किए गए। समान ComfyUI तुलना में API कतार/पोलिंग ओवरहेड, प्रॉम्प्ट एन्कोडिंग, डीनॉइज़िंग, VAE डिकोड, PNG एन्कोडिंग और सेव शामिल हैं, हर प्रिसिशन पर 30 मापे अनुरोधों के साथ। पहले का Diffusers परिणाम PNG एन्कोडिंग नहीं गिनता और प्रिसिशन बेसलाइन नहीं है।
  • नोड समेकन और पुनरावृत्ति: चुनी दरें कुल आउटपुट को पहले मापे क्लाइंट के शुरू होने से अंतिम पूरा होने तक की साझा अवधि से भाग देती हैं। चुनी दर 960 आउटपुट वाले तीन छोटे रन का न्यूनतम है, और अपनी एकल-GPU दर के आठ गुने के सापेक्ष 92.49% स्केलिंग दक्षता देती है। पहले की वर्कर दरों का योग समान नोड बेसलाइन नहीं है। ये माप निरंतर प्रोडक्शन SLA स्थापित नहीं करते।
  • गुणवत्ता: आठ चुने आउटपुट की दृश्य जाँच की गई। सभी सुसंगत प्रोडक्ट फ़ोटो थे और माँगा गया लेबल पढ़ा जा सकता था; छह में साफ़, सही लेबल था, एक में छोटा अतिरिक्त टेक्स्ट और एक में विरामचिह्न की अतिरिक्त आकृति थी। यह शुरुआती जाँच व्यापक क्वांटाइज़ेशन गुणवत्ता, प्रॉम्प्ट पालन, टाइपोग्राफ़ी, मॉडरेशन या ग्राहक स्वीकृति स्थापित नहीं करती।

माप 12–21 अगस्त 2026 में लिए गए। होस्टेड API गुणवत्ता, परिचालन विश्वसनीयता और कुल लागत की बराबरी जाँची नहीं गई।

ComfyUI के साथ निजी FLUX.2 इमेज जनरेशन

FLUX.2 Klein और ComfyUI के साथ निजी इमेज जनरेशन की योजना बनाने वाली टीमों के लिए यह बेंचमार्क क्रिएटिव वर्कफ़्लो की वैरिएंट संख्या और डिलीवरी समयसीमा के अनुसार क्षमता समझने में मदद करता है। प्रति घंटे इमेज वैरिएंट और अनुरोध विलंबता अलग योजना-संबंधी प्रश्नों के उत्तर देते हैं। डिप्लॉयमेंट में प्रतिनिधि प्रॉम्प्ट से प्रदर्शन की पुष्टि करनी चाहिए और गुणवत्ता आवश्यकताएँ पूरी करने वाले आउटपुट गिनने चाहिए।

अपनी टीम के वास्तविक इमेज वर्कफ़्लो को बेहतर बनाएँ

प्रतिनिधि प्रॉम्प्ट सेट, वेरिएंट संख्या, गुणवत्ता सीमा और डिलीवरी लक्ष्य लेकर आएँ। हम समान आउटपुट अनुबंध के तहत बेसलाइन और ऑप्टिमाइज़ की गई निजी सेवा की तुलना करेंगे।

पायलट पर चर्चा करें