المشكلة: للاسترجاع نوعان مختلفان من تكاليف الموارد
يتكبد نظام RAG الخاص تكلفة ترميز المستندات وتخزين متجهاتها وترتيب نتائج البحث. وتعتمد نقطة تشغيله المفيدة على التغيرات المقبولة في الجودة ومواضع تقييد القدرة. قيّمت ProsGrow هذه القرارات بصورة منهجية باستخدام التمثيلات التي يدعمها Qwen ومسارات الدقة في vLLM.
اخترنا متجهات من 1,024 بُعدًا تقلل بايتات المتجهات الخام بنسبة 75%، وفي تجربة منفصلة اخترنا FP8 الديناميكي مع زيادة إنتاجية التضمين بنسبة 69.10%. ولكل منهما مقايضة مستقلة تتعلق بالجودة.
القرار الأول: الاحتفاظ بالأبعاد التي تستحق مساحة تخزينها
بدأنا بالمخرجات الأصلية ذات 4,096 بُعدًا من Qwen3-Embedding-8B. على مجموعة اختبار SciFact الكاملة، سجّل خط أساس FP16 هذا 0.79279 في nDCG@10، وهو مقياس صلة يكافئ ظهور المستندات المفيدة قرب قمة النتائج. أدى خفض المخرجات إلى 1,024 بُعدًا إلى نتيجة 0.78944: أي 99.58% من nDCG@10 لخط الأساس.
حجم المتجه الخام عند دقة التخزين نفسها
أدى الضغط الأشد إلى خسارة أكبر في جودة الترتيب. اخترنا 1,024 بُعدًا لهذه المجموعة، مع انخفاض Recall@100 من 0.98000 إلى 0.97333. وتشير نسبة الاحتفاظ البالغة 99.58% تحديدًا إلى nDCG@10 في تجربة الأبعاد هذه بدقة FP16.
أين تفيد المتجهات الأصغر وأين لا تفيد
يوفر Qwen3-Embedding-8B تمثيلات Matryoshka، بدعم من بيئة تشغيل التضمين في vLLM. تدعم هذه الإمكانية الأصلية متجهات أقصر تظل مفيدة. وتمثلت مساهمة ProsGrow في تقييم المقايضة الناتجة بين التخزين والجودة لهذا العبء.
بالنسبة إلى 100 مليون متجه بصيغة float32، ينخفض التخزين الخام المحسوب من 1.64 TB إلى 0.41 TB. ولا يزال الحجم الإجمالي لقاعدة البيانات وزمن استجابة البحث يحتاجان إلى القياس باستخدام الفهرس الفعلي.
ظل المرمّز يحسب عرضه الخفي الأصلي، ولم تتغير الإنتاجية بأكثر من 1.2% عبر الأبعاد المختبرة. وتأتي زيادة الإنتاجية اللاحقة بنسبة 69.10% من تجربة الدقة المنفصلة.
القرار الثاني: استخدام FP8 لزيادة مقاسة في قدرة الترميز
مع تثبيت أبعاد المخرجات وعبء المدخلات القصيرة، حقق FP8 الديناميكي 319,951 رمز إدخال/ثانية عبر ثماني نسخ، مقارنةً بـ 189,213 مع FP16. وتعطي النتيجة الأدنى من تشغيلَي عقدة FP8 تحسنًا بنسبة 69.10%.
إنتاجية التضمين على وحدات GPU الثماني نفسها
يأتي مسار التنفيذ الأسرع من دعم vLLM لـ FP8 الديناميكي. تحققت ProsGrow من تنفيذ نوى FP8 المقصودة على كل GPU، وقيّمت الدقة والتزامن وتوزيع النسخ معًا. أضاف رفع التزامن فوق الإعداد المختار قدرة محدودة، بينما ضاعف متوسط زمن الاستجابة تقريبًا.
ظل التخزين المؤقت للبادئات معطلًا في المقارنات النهائية حتى لا تستبدل مدخلات الاختبار المتكررة عمل Transformer بإعادة استخدام الذاكرة المؤقتة.
استخدمت هذه العقدة المحسّنة أيضًا طاقة أقل على لوحات GPU لكل مليون رمز إدخال بنسبة 44.19%: 3.921 Wh مقابل 7.025 Wh. هذا تحسن مقاس في طاقة GPU، ولا يشمل المقياس طاقة المضيف والمنشأة.
تكلفة FP8 على الجودة قرار مستقل
كررنا تقييم جودة SciFact الكامل باستخدام مجموعة ضابطة مطابقة بدقة FP16 وتشغيلين منفصلين بدقة FP8. عند 1,024 بُعدًا، سجلت نتيجة FP8 الأكثر تحفظًا 0.786211 في nDCG@10 مقابل 0.789717 للمجموعة الضابطة المطابقة بدقة FP16: أي انخفاضًا بمقدار 0.003506. وظل Recall@100 عند 0.97333.
سجّل تشغيل FP8 الآخر 0.790021 في nDCG@10. نعرض النتيجة الأدنى لاتخاذ قرار قبول متحفظ. وتخص نسبة الاحتفاظ السابقة البالغة 99.58% تجربة الأبعاد الأصلية فقط؛ وهي ليست ضمان جودة مشتركًا لخفض الأبعاد وFP8.
إعادة الترتيب: تخصيص الحوسبة للمرشحين القادرين على تغيير الإجابة
بالنسبة إلى Qwen3-Reranker-8B، اخترنا 20 مستندًا كاملًا لكل استعلام. غيّرت دراسة السياسة عدد المرشحين واقتطاع المستندات معًا، ولذلك لا يمكن إرجاع أثرها إلى عدد المرشحين وحده. سجّلت السياسة المختارة 0.80482 في nDCG@10، مع موازنة مجموعة المرشحين الأصغر بين توفير الحوسبة واستدعاء الاسترجاع.
وفق مواصفات ثابتة من 20 مستندًا، حسّن FP8 الديناميكي الإنتاجية المنفردة من 2.7444 إلى 4.6958 عملية بحث/ثانية، أي زيادة بنسبة 71.10%. وارتفعت النتيجة المتحفظة للنسخ الثماني من 21.6248 إلى 44.4738 عملية بحث/ثانية: أي من 77,849 إلى 160,106 عملية بحث top-20/ساعة، بزيادة 105.66%. وتغير nDCG@10 من 0.804821 إلى 0.803368، بينما بقي Recall@20 عند 0.94000.
تجاوزت نتيجة العقدة ثمانية أمثال معدل FP8 المنفرد في تشغيلين؛ ولا يزال السبب غير محسوم بعد التدقيق. تنطبق قدرتها على هذا الإعداد بعينه. وتوفر المقارنة المنفردة بنسبة 71.10% دليلًا أوضح على فائدة الدقة لكل GPU.
ما الذي يتغير بالنسبة إلى العميل
بالنسبة إلى مجموعة مستندات تجتاز معيار الجودة عند 1,024 بُعدًا، ينخفض حجم بيانات المتجهات بثلاثة أرباع. ولعملية فهرسة بمدخلات قصيرة تجتاز أيضًا معيار FP8، تعادل الإنتاجية المقاسة نحو 52 دقيقة لكل مليار رمز إدخال، مقابل 88 دقيقة عند خط أساس FP16. وهذه تقديرات زمن معالجة محسوبة وفق معدل الاختبار.
يوفر ذلك مساحة لتحديث الفهرس بوتيرة أعلى. يحتاج البحث المباشر إلى خطة قدرة مشتركة: فقد قيس معدلا التضمين وإعادة الترتيب للعقدة كاملةً بصورة منفصلة.
تتمثل مساهمة ProsGrow في اختيار نقطة تشغيل والتحقق منها وفق متطلبات عبء العمل. يحتاج المشروع التجريبي للعميل إلى أحكام صلة خاصة به ومسار استرجاع كامل، بما يشمل جودة الإجابات وزمن الاستجابة عند p95. يحدد الاختبار المقايضات على مستوى المكونات؛ أما الخدمة الإنتاجية فتحتاج إلى تحقق مشترك.
التكلفة المقدّرة للمكوّنين المنفصلين
عند الاستخدام المدفوع الكامل، يقدّر نموذج البنية التحتية لشهر سبتمبر تكلفة التضمين بـ $0.00453–$0.00646 لكل مليون رمز إدخال وإعادة ترتيب top-20 بـ $0.03258–$0.04644 لكل 1,000 عملية بحث، عند تكلفة شراء عقدة قدرها $100,000–$150,000. يستخدم الحساب المعدل المقاس للعقدة كاملةً لكل مكوّن على حدة: 319,951 رمز إدخال/ثانية أو 44.4738 عملية بحث/ثانية.
تفترض هذه السيناريوهات إهلاكًا على ثلاث سنوات، وصيانة سنوية بنسبة 5%، و720 ساعة/شهر، وكهرباء بسعر $0.10/kWh، ومعامل استخدام طاقة 1.30، وقدرة خادم نشط 6 kW. وينتج عن ذلك تكلفة بنية تحتية مقدّرة بـ $5.22–$7.44 لكل ساعة عقدة نشطة. قيمة 6 kW افتراض عام لمجموعة الحلول؛ وهي منفصلة عن تحسن طاقة لوحات GPU المقاس والمذكور أعلاه. ومع انخفاض الطلب، تتوزع التكلفة الثابتة على وحدات مبيعة أقل.
استخدم كل مكوّن وحدات GPU الثماني كلها في اختبارات منفصلة؛ ولا يمكن جمع قيمهما القصوى باعتبارها قدرة خدمة متزامنة. لا تشمل التكاليف التخزين وتشغيل التطبيق والعمالة والشبكات والقدرة الاحتياطية للخدمة وتوليد الإجابات. وتتطلب تكلفة كل إجابة مقبولة تحققًا شاملًا من البداية إلى النهاية.
المنهجية والقيود
- العتاد والنماذج: ثماني وحدات RTX PRO 6000 Blackwell Server Edition GPU، بذاكرة اسمية 96 GB لكل منها، ونسخة واحدة لكل GPU. استخدم التضمين
Qwen/Qwen3-Embedding-8Bبالمراجعة1d8ad4ca9b3dd8059ad90a75d4983776a23d44af؛ واستخدمت إعادة الترتيبQwen/Qwen3-Reranker-8Bبالمراجعة77d193c791ed757ca307ee72715aa132723da912. - بيئة التشغيل: vLLM 0.25.1؛ استخدمت مقارنة الدقة تنشيطات float16 مع أوزان FP8 ديناميكية ومسار نوى FP8 جرى التحقق منه. عُطّل التخزين المؤقت للبادئات في المقارنات النهائية.
- قدرة التضمين: مدخلات قصيرة اصطناعية ضمن طلبات تحوي 64 مدخلًا، بمتوسط 56 رمز نموذج لكل مدخل، مع إرجاع 1,024 بُعدًا. عالج كل تشغيل للعقدة 65,536 مدخلًا. بلغت نافذة القياس المشتركة لإعداد FP8 المختار 11.467 ثانية؛ واختلف التشغيلان بنسبة 0.47% دون أي طلبات فاشلة. جرى تقييم جودة المستندات الحقيقية بصورة منفصلة.
- جودة الاسترجاع: مجموعة اختبار BEIR SciFact الكاملة: 5,183 مستندًا يتألف من عنوان وملخص، و300 استعلام، وأحكام الصلة الرسمية، مع التقييم باستخدام تعليمات الاستعلام من الناشر والبحث الشامل بتشابه جيب التمام. SciFact اختبار واحد في المجال العلمي؛ وقد تختلف النتائج مع مجموعات أخرى وفهارس تقريبية.
- حدود قياس إعادة الترتيب: عالج كل تشغيل للعقدة 2,400 عملية بحث، مع 20 مستندًا كاملًا لكل بحث. ثُبّت المرشحون من خط الأساس الكثيف بدقة FP16 و1,024 بُعدًا، لذا لا يقيس هذا مسارًا يجمع تضمين FP8 وإعادة الترتيب. نعرض أدنى إنتاجية وجودة لوحظتا.
- التوقيت والنشر: تمتد نوافذ API بعد الإحماء من بدء أسبق نسخة إلى آخر اكتمال. يُستبعد بدء التشغيل وبناء حمولة الطلب. وتتطلب الموصلات والتقسيم وعمليات قاعدة بيانات المتجهات والتوليد والاصطفاف في الإنتاج مشروعًا تجريبيًا شاملًا. أرقام الساعة والمليار رمز تحويلات حسابية، وليست اختبارات تحمل ممتدة.
- التخزين والطاقة: يخص الانخفاض بنسبة 75% المتجهات الخام عند دقة التخزين نفسها؛ وتضيف البيانات الوصفية وهياكل الفهرسة والنسخ والتخزين الاحتياطي أعباء أخرى. تغطي أرقام الطاقة لوحات GPU فقط. النتائج مقارنات محلية لإعدادات محددة، دون ادعاء تكلفة مقابل API مُدارة لنموذج مكافئ.
الاسترجاع الخاص لـ RAG والبحث الدلالي
للفرق التي تخطط لتوليد خاص معزز بالاسترجاع (RAG)، تفصل هذه الدراسة بين تخزين متجهات التضمين وقدرة فهرسة المستندات وجودة إعادة الترتيب. يمكن أن ترشد هذه القياسات اختيار بنية البحث الدلالي، لكن صغر المتجهات لا يثبت وحده أن استعلامات قاعدة البيانات أسرع. ينبغي التحقق من الصلة وزمن الاستجابة وجودة الإجابات عبر مسار الاسترجاع الكامل في بيئة النشر.
اعثر على المقايضة المناسبة للاسترجاع في مجموعة مستنداتك
يمكن لـ ProsGrow قياس الأبعاد والدقة وإعادة الترتيب معًا وفق أهداف الجودة لديك وموعد تحديث الفهرس وميزانية زمن استجابة الاستعلام.
ناقش مشروعًا تجريبيًا لـ RAG خاص