इंजीनियरिंग नोट्स · निजी RAG

ProsGrow ने RAG के कच्चे वेक्टर स्टोरेज को 75% कैसे घटाया

ProsGrow ने SciFact पर बेसलाइन nDCG@10 का 99.58% बनाए रखते हुए कच्चे वेक्टर स्टोरेज को 75% घटाया। एक अलग FP8 अध्ययन ने एम्बेडिंग थ्रूपुट 69.10% बढ़ाया, जिसकी अपनी गुणवत्ता जाँच थी। ये परिणाम स्टोरेज और एन्कोडिंग क्षमता के लिए अलग-अलग विकल्प दिखाते हैं।

· अद्यतन · ProsGrow AI इंजीनियरिंग · पढ़ने का समय 6 मिनट

कच्चे वेक्टर 4,096 से घटकर 1,024 आयाम के हो जाते हैं, जबकि FP16 आयाम अध्ययन में SciFact पर बेसलाइन nDCG@10 का 99.58% बना रहता है।

समस्या: रिट्रीवल में संसाधनों की दो अलग लागतें हैं

निजी RAG सिस्टम में दस्तावेज़ों को एन्कोड करने, उनके वेक्टर सहेजने और खोज परिणामों को रैंक करने की लागत होती है। उपयोगी परिचालन बिंदु इस पर निर्भर करता है कि गुणवत्ता में कौन से बदलाव स्वीकार्य हैं और क्षमता कहाँ सीमित है। ProsGrow ने Qwen के समर्थित निरूपणों और vLLM के प्रिसीजन पथों का उपयोग करके इन निर्णयों का व्यवस्थित मूल्यांकन किया।

हमने 1,024-आयामी वेक्टर चुने, जिनमें कच्चे वेक्टर बाइट 75% कम थे और एक अलग प्रयोग में डायनेमिक FP8 चुना, जिसने एम्बेडिंग थ्रूपुट 69.10% बढ़ाया। दोनों के अपने गुणवत्ता संबंधी समझौते हैं।

निर्णय 1: वे आयाम रखें जिनका लाभ उनकी स्टोरेज लागत को उचित ठहराता है

हमने Qwen3-Embedding-8B के मूल 4,096-आयामी आउटपुट से शुरुआत की। पूरे SciFact टेस्ट स्प्लिट पर इस FP16 बेसलाइन का nDCG@10 स्कोर 0.79279 था। यह प्रासंगिकता का माप है, जो उपयोगी दस्तावेज़ों को परिणामों में ऊपर रखने पर अधिक स्कोर देता है। आउटपुट को 1,024 आयाम तक घटाने पर स्कोर 0.78944 रहा: बेसलाइन nDCG@10 का 99.58%।

एक ही स्टोरेज प्रिसीजन पर कच्चे वेक्टर का आकार

बेसलाइन: 4,096 आयाम16 KiB/वेक्टर · nDCG@10 0.79279
ProsGrow का चयन: 1,024 आयाम4 KiB/वेक्टर · nDCG@10 0.78944
SciFact पर मूल FP16 आयाम अध्ययन। Float32 वेक्टर पेलोड 75% छोटे हैं; nDCG@10 में 0.00335, यानी सापेक्ष रूप से 0.42% की कमी आती है। इंडेक्स संरचनाएँ, मेटाडेटा और रेप्लिका इन वेक्टर बाइट के अलावा अतिरिक्त स्टोरेज लेते हैं।

अधिक संपीड़न से रैंकिंग गुणवत्ता में बड़ी गिरावट आई। हमने इस कॉर्पस के लिए 1,024 आयाम चुने; Recall@100 0.98000 से घटकर 0.97333 हुआ। 99.58% गुणवत्ता बनाए रखने का आँकड़ा विशेष रूप से इस FP16 आयाम प्रयोग के nDCG@10 से संबंधित है।

छोटे वेक्टर कहाँ मदद करते हैं—और कहाँ नहीं

Qwen3-Embedding-8B Matryoshka निरूपण प्रदान करता है, जिन्हें vLLM का एम्बेडिंग रनटाइम समर्थन देता है। यह मूल परियोजनाओं की क्षमता छोटे, उपयोगी वेक्टर सक्षम करती है। ProsGrow का योगदान इस वर्कलोड के लिए मिलने वाले स्टोरेज और गुणवत्ता के समझौते का मूल्यांकन करना था।

100 मिलियन float32 वेक्टर के लिए गणना के अनुसार कच्चा स्टोरेज 1.64 TB से घटकर 0.41 TB हो जाता है। डेटाबेस का कुल आकार और खोज विलंबता अभी भी वास्तविक इंडेक्स के साथ मापनी होंगी।

एन्कोडर अब भी अपनी मूल हिडन चौड़ाई की गणना करता था, और परीक्षण किए गए आयामों में थ्रूपुट अधिकतम 1.2% बदला। बाद की 69.10% थ्रूपुट वृद्धि अलग प्रिसीजन प्रयोग से आती है।

निर्णय 2: एन्कोडिंग क्षमता में मापी गई वृद्धि के लिए FP8 का उपयोग करें

आउटपुट आयाम और छोटे इनपुट वाला वर्कलोड स्थिर रखने पर डायनेमिक FP8 ने आठ रेप्लिका में 319,951 इनपुट टोकन/सेकंड दिए, जबकि FP16 में यह 189,213 था। दो FP8 नोड रन में से कम परिणाम 69.10% सुधार देता है।

उन्हीं आठ GPU पर एम्बेडिंग थ्रूपुट

FP16 बेसलाइन · 1,024 आयाम189,213 इनपुट टोकन/सेकंड
ProsGrow डायनेमिक FP8 · 1,024 आयाम319,951 इनपुट टोकन/सेकंड · +69.10%
वही छोटे इनपुट वाला API कॉन्ट्रैक्ट और vLLM 0.25.1, प्रीफ़िक्स कैशिंग बंद। FP8 का मान पूरे नोड के दो रन में से कम परिणाम है। यह प्रिसीजन प्रयोग ऊपर दिए गए आयाम तुलना से अलग है।

तेज़ निष्पादन पथ vLLM के डायनेमिक FP8 समर्थन से आता है। ProsGrow ने सत्यापित किया कि इच्छित FP8 कर्नेल हर GPU पर चले, और प्रिसीजन, समवर्तिता तथा रेप्लिका प्लेसमेंट का साथ में मूल्यांकन किया। चुनी गई प्रोफ़ाइल से अधिक समवर्तिता बढ़ाने पर क्षमता बहुत कम बढ़ी, जबकि औसत विलंबता लगभग दोगुनी हो गई।

अंतिम तुलनाओं में प्रीफ़िक्स कैशिंग बंद रही, ताकि बार-बार दोहराए गए बेंचमार्क इनपुट ट्रांसफ़ॉर्मर की गणना की जगह कैश पुनः उपयोग का लाभ न ले सकें।

इस अनुकूलित नोड ने प्रति मिलियन इनपुट टोकन GPU बोर्ड ऊर्जा भी 44.19% कम इस्तेमाल की: 7.025 Wh के मुकाबले 3.921 Wh। यह GPU ऊर्जा में मापा गया सुधार है; होस्ट और सुविधा की बिजली इस माप में शामिल नहीं है।

FP8 की गुणवत्ता लागत एक अलग निर्णय है

हमने एक मेल खाते FP16 कंट्रोल और दो FP8 लॉन्च के साथ पूरा SciFact गुणवत्ता मूल्यांकन दोहराया। 1,024 आयाम पर सावधानीपूर्ण FP8 परिणाम का nDCG@10 0.786211 था, जबकि मेल खाते FP16 कंट्रोल का 0.789717: 0.003506 कम। Recall@100 0.97333 पर बना रहा।

दूसरे FP8 लॉन्च का nDCG@10 0.790021 था। स्वीकार्यता का निर्णय सावधानी से लेने के लिए हम कम स्कोर देते हैं। पहले का 99.58% गुणवत्ता बनाए रखने वाला आँकड़ा केवल मूल आयाम प्रयोग का है; यह आयाम घटाने और FP8 को एक साथ लागू करने की गुणवत्ता गारंटी नहीं है।

रीरैंकिंग: गणना उन उम्मीदवार दस्तावेज़ों पर खर्च करें जो उत्तर बदल सकते हैं

Qwen3-Reranker-8B के लिए हमने प्रति क्वेरी 20 पूरे दस्तावेज़ चुने। नीति अध्ययन में उम्मीदवारों की संख्या और दस्तावेज़ काटने की सीमा दोनों बदली गईं, इसलिए उसके प्रभाव को केवल उम्मीदवारों की संख्या का परिणाम नहीं माना जा सकता। चुनी गई नीति का nDCG@10 0.80482 था; छोटा उम्मीदवार सेट गणना बचत और रिट्रीवल रिकॉल के बीच समझौता करता है।

उस निश्चित 20-दस्तावेज़ कॉन्ट्रैक्ट पर डायनेमिक FP8 ने अलग से मापा गया थ्रूपुट 2.7444 से 4.6958 खोज/सेकंड किया, यानी 71.10% अधिक। आठ रेप्लिका का सावधानीपूर्ण परिणाम 21.6248 से बढ़कर 44.4738 खोज/सेकंड हुआ: 77,849 से 160,106 टॉप-20 खोज/घंटा, यानी +105.66%। nDCG@10 0.804821 से 0.803368 हुआ और Recall@20 0.94000 पर बना रहा।

दो लॉन्च में नोड का परिणाम अलग से मापी गई FP8 दर के आठ गुने से भी अधिक था; ऑडिट के बाद भी कारण स्पष्ट नहीं है। इसकी क्षमता इसी सटीक कॉन्फ़िगरेशन पर लागू होती है। प्रति GPU प्रिसीजन लाभ को समझने के लिए अलग से मापी गई 71.10% तुलना अधिक स्पष्ट आधार है।

ग्राहक के लिए इससे क्या बदलता है

जो कॉर्पस 1,024-आयामी गुणवत्ता जाँच पास करता है, उसका वेक्टर पेलोड तीन चौथाई घट जाता है। जो छोटे इनपुट वाला इंडेक्सिंग काम FP8 की जाँच भी पास करता है, उसके लिए मापा गया थ्रूपुट लगभग प्रति बिलियन इनपुट टोकन 52 मिनट के बराबर है, जबकि FP16 बेसलाइन में 88 मिनट लगते हैं। ये बेंचमार्क दर से गणना किए गए प्रोसेसिंग समय के अनुमान हैं।

इससे इंडेक्स अधिक बार अपडेट करने की गुंजाइश बनती है। ऑनलाइन खोज को संयुक्त क्षमता योजना चाहिए: पूरे नोड की एम्बेडिंग और रीरैंकिंग दरें अलग-अलग मापी गई थीं।

ProsGrow का योगदान वर्कलोड की आवश्यकताओं के अनुसार परिचालन बिंदु चुनना और सत्यापित करना है। ग्राहक पायलट को अपनी प्रासंगिकता जाँच और पूरे रिट्रीवल पथ का मूल्यांकन चाहिए, जिसमें उत्तर गुणवत्ता और p95 विलंबता शामिल हों। बेंचमार्क अलग-अलग घटकों के समझौते दिखाता है; उत्पादन सेवा को संयुक्त सत्यापन चाहिए।

दो अलग घटकों के लिए मॉडल की गई लागत

पूरी क्षमता के सशुल्क उपयोग पर सितंबर का इंफ्रास्ट्रक्चर मॉडल, $100,000–$150,000 की नोड खरीद लागत के लिए, एम्बेडिंग की लागत प्रति मिलियन इनपुट टोकन $0.00453–$0.00646 और टॉप-20 रीरैंकिंग की लागत प्रति 1,000 खोज $0.03258–$0.04644 रखता है। गणना हर घटक की अपनी मापी गई पूरे नोड की दर लेती है: 319,951 इनपुट टोकन/सेकंड या 44.4738 खोज/सेकंड।

इन परिदृश्यों में तीन वर्ष का लागत परिशोधन, सालाना 5% रखरखाव, 720 घंटे/माह, $0.10/kWh बिजली, 1.30 बिजली उपयोग गुणक और सक्रिय सर्वर की 6 kW बिजली खपत मानी गई है। इससे प्रति सक्रिय नोड-घंटा मॉडल की गई इंफ्रास्ट्रक्चर लागत $5.22–$7.44 आती है। 6 kW पोर्टफ़ोलियो की धारणा है; यह ऊपर दिए गए मापे गए GPU बोर्ड ऊर्जा सुधार से अलग है। कम माँग में स्थिर लागत कम बेची गई इकाइयों पर बाँटी जाती है।

अलग-अलग परीक्षणों में हर घटक ने सभी आठ GPU इस्तेमाल किए; उनकी अधिकतम दरों को जोड़कर एक साथ उपलब्ध सेवा क्षमता नहीं माना जा सकता। लागत में स्टोरेज, एप्लिकेशन संचालन, श्रम, नेटवर्किंग, सेवा के लिए आरक्षित क्षमता और उत्तर जनरेशन शामिल नहीं हैं। प्रति स्वीकार किए गए उत्तर की लागत के लिए शुरू से अंत तक सत्यापन चाहिए।

पद्धति और सीमाएँ

  • हार्डवेयर और मॉडल: आठ RTX PRO 6000 Blackwell Server Edition GPU, हर एक में नाममात्र 96 GB मेमोरी और प्रति GPU एक रेप्लिका। एम्बेडिंग में Qwen/Qwen3-Embedding-8B का रिविज़न 1d8ad4ca9b3dd8059ad90a75d4983776a23d44af इस्तेमाल हुआ; रीरैंकिंग में Qwen/Qwen3-Reranker-8B का रिविज़न 77d193c791ed757ca307ee72715aa132723da912 इस्तेमाल हुआ।
  • रनटाइम: vLLM 0.25.1; प्रिसीजन तुलना में float16 एक्टिवेशन, डायनेमिक FP8 वेट और सत्यापित FP8 कर्नेल पथ इस्तेमाल हुए। अंतिम तुलनाओं में प्रीफ़िक्स कैशिंग बंद थी।
  • एम्बेडिंग क्षमता: 64 इनपुट प्रति अनुरोध वाले सिंथेटिक छोटे इनपुट, औसतन हर एक में 56 मॉडल टोकन, और आउटपुट में 1,024 आयाम। हर नोड रन ने 65,536 इनपुट प्रोसेस किए। चुनी गई FP8 की साझा समय विंडो 11.467 सेकंड थी; दोनों रन में 0.47% अंतर था और कोई अनुरोध विफल नहीं हुआ। वास्तविक दस्तावेज़ों की गुणवत्ता अलग से जाँची गई।
  • रिट्रीवल गुणवत्ता: पूरा BEIR SciFact टेस्ट स्प्लिट: शीर्षक और सार वाले 5,183 दस्तावेज़, 300 क्वेरी और आधिकारिक प्रासंगिकता निर्णय। मूल्यांकन प्रकाशक के क्वेरी निर्देश और संपूर्ण कोसाइन खोज के साथ हुआ। SciFact वैज्ञानिक क्षेत्र का एक बेंचमार्क है; दूसरे कॉर्पस और अनुमानित इंडेक्स का व्यवहार अलग हो सकता है।
  • रीरैंकर की मापन सीमा: हर नोड रन ने 2,400 खोज सँभालीं, हर खोज में 20 पूरे दस्तावेज़ थे। उम्मीदवार FP16 1,024-आयामी डेंस बेसलाइन से निश्चित रखे गए थे, इसलिए यह संयुक्त FP8 एम्बेडिंग और रीरैंकिंग पाइपलाइन का माप नहीं है। हम मापे गए कम थ्रूपुट और कम गुणवत्ता परिणाम देते हैं।
  • समय मापन और तैनाती: वार्म API विंडो सबसे पहले शुरू हुए रेप्लिका से अंतिम पूर्णता तक चलती है। स्टार्टअप और पेलोड निर्माण शामिल नहीं हैं। कनेक्टर, चंकिंग, वेक्टर डेटाबेस संचालन, जनरेशन और उत्पादन में कतार का प्रभाव शुरू से अंत तक पायलट में जाँचना होगा। प्रति घंटे और बिलियन टोकन वाले आँकड़े अंकगणितीय रूपांतरण हैं, लंबे समय तक चलने वाले परीक्षण नहीं।
  • स्टोरेज और ऊर्जा: 75% कमी समान स्टोरेज प्रिसीजन पर कच्चे वेक्टर की है; मेटाडेटा, इंडेक्स संरचनाएँ, रेप्लिकेशन और बैकअप अतिरिक्त ओवरहेड जोड़ते हैं। ऊर्जा आँकड़े केवल GPU बोर्ड को कवर करते हैं। परिणाम बताए गए कॉन्फ़िगरेशन की स्थानीय तुलनाएँ हैं; मॉडल-समकक्ष प्रबंधित API के मुकाबले लागत का कोई दावा नहीं है।

निजी RAG रिट्रीवल और सिमैंटिक सर्च

निजी रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) की योजना बनाने वाली टीमों के लिए यह अध्ययन एम्बेडिंग-वेक्टर स्टोरेज, दस्तावेज़ इंडेक्सिंग क्षमता और रीरैंकिंग गुणवत्ता को अलग रखता है। ये माप सिमैंटिक-सर्च इंफ्रास्ट्रक्चर चुनने में मदद कर सकते हैं, लेकिन छोटे वेक्टर अपने आप तेज़ डेटाबेस क्वेरी साबित नहीं करते। डिप्लॉयमेंट में पूरे रिट्रीवल पाइपलाइन पर प्रासंगिकता, प्रतिक्रिया समय और उत्तर की गुणवत्ता सत्यापित करनी चाहिए।

अपने कॉर्पस के लिए सही रिट्रीवल समझौता चुनें

ProsGrow आपके गुणवत्ता लक्ष्यों, अपडेट की समय-सीमा और क्वेरी विलंबता बजट के अनुसार आयाम, प्रिसीजन और रीरैंकिंग का साथ में बेंचमार्क कर सकता है।

निजी RAG पायलट पर चर्चा करें