المشكلة: تساوي أعداد الأسئلة لا يعني تساوي حجم العمل
تحتاج خدمة المستندات الخاصة إلى إنهاء الأعمال المتراكمة بدقة وفي الموعد المحدد. يبدو توزيع العدد نفسه من الأسئلة على كل GPU منطقيًا، حتى تتلقى إحدى عمليات المعالجة صفحات أكثر عالية الدقة أو مطالبات أطول متعددة الوسائط. عندها تحدد أبطأ عملية موعد انتهاء الدفعة كلها.
حددت ProsGrow هذا الاختلال الخفي وقيّمت توزيعًا يسترشد بتحليل الأداء على العقدة نفسها. ارتفع المعدل من 44,608 إلى 45,978 سؤالًا حول المستندات في الساعة، بزيادة 3.07%. يوضح ذلك كيف قد تترك خدمة النماذج متعددة الوسائط قدرةً غير مستغلة حتى حين تبدو أعداد الطلبات متوازنة.
خط الأساس ← تحسين ProsGrow
استخدم التشغيلان Qwen3.6-27B بدقة BF16 على vLLM 0.25.1 عبر وحدات GPU الثماني نفسها. تضمن كل طلب صورة صفحة وسؤالًا يتطلب إجابة قصيرة. واحتوى عبء التحقق الكامل على 5,349 سؤالًا موزعة على 1,285 صورة صفحة.
وازن خط الأساس التوزيع بحسب عدد الأسئلة. واستخدمت ProsGrow تحليل عبء العمل لتقليل الفروق في العمل المسند إلى كل نسخة، مع إبقاء أسئلة الصفحة المتكررة في النسخة نفسها للاستفادة من إعادة الاستخدام.
أسئلة المستندات المُجاب عنها في الساعة
| المقياس | خط أساس متوازن بحسب العدد | توزيع ProsGrow المسترشد بتحليل الأداء |
|---|---|---|
| نافذة إكمال العمل على العقدة كاملة | 431.676 s | 418.821 s · أقصر بنسبة 2.98% |
| أسئلة المستندات/ساعة | 44,608 | 45,978 · أعلى بنسبة 3.07% |
| أكبر / أصغر عدد من رموز المطالبات لكل نسخة | 1.0759× | 1.00017× |
| متوسط ANLS | 0.96402 | 0.96531 |
اكتملت جميع الأسئلة بنجاح، مع تطابق تام بنسبة 91.92%. وبحسب الكثافة المقاسة، وهي 4.16265 سؤالًا لكل صفحة، يعادل المعدل 11,045 صورة صفحة/ساعة. يعتمد هذا التحويل على كثافة الأسئلة.
ما الذي كشفه تحليل الأداء
أخفت أعداد الأسئلة المتساوية فرقًا قدره 7.59% بين أثقل وأخف أعباء المطالبات. كشف تحليل الأداء هذا الاختلال، وخفّضه التوزيع المختار إلى حدود 0.017%. وبلغ المعدل النهائي ضمن النافذة الزمنية المشتركة 98.61% من ثمانية أضعاف معدل GPU منفردة عند اختبارها بمعزل عن البقية.
كان لا بد أيضًا من الحفاظ على إعادة الاستخدام عند تعلق عدة أسئلة بالصفحة نفسها. حافظ التوزيعان على هذه الخاصية، وسجل التشغيل المحسّن معدل إصابة قدره 76.06% في ذاكرة التخزين المؤقت للمعالج متعدد الوسائط، بما في ذلك الإحماء. جاءت الزيادة المقاسة من توزيع العمل بصورة أكثر توازنًا فوق هذا الأساس التشغيلي.
لا يفسر حجم المطالبات جميع المهام البطيئة؛ فما زالت أبعاد الصفحات وتجميع الدفعات والطلبات المتأخرة تؤثر في وقت الإنجاز. كانت الإشارة المفيدة هي الفجوة بين الطلبات المتوازنة ظاهريًا والعمل الفعلي الناتج عنها، وليست قاعدة جدولة تصلح لكل الحالات.
المفاضلات: هامش الذاكرة والدقة العددية
جعلت صور الصفحات الكبيرة هامش الذاكرة مسألة صحة تنفيذ، إلى جانب كونه قيدًا على الأداء. استطاع إعداد الخدمة المختار استيعاب مجموعة التحقق كاملة، ووازن بين استغلال مرحلة المعالجة الأولية وزمن الاستجابة والهامش الذي تحتاج إليه أكبر الصفحات.
اختبرنا أيضًا نقطة تحقق أصغر تستخدم NVFP4 مختلطًا وفق متطلبات المهمة نفسها. شغلت 20.43 GiB على القرص مقابل 51.75 GiB لـ BF16، لكنها حققت 44,970 سؤالًا/ساعة، أي أقل من نتيجة BF16 بنسبة 2.19%. انخفض متوسط ANLS من 0.96531 إلى 0.96314، والتطابق التام من 91.92% إلى 91.14%. لذلك أبقينا على BF16 لهذا الإعداد بعد إحماء خدمة المستندات.
ظلت المعالجة المسبقة للصور والمشفّر البصري والمعالجة الأولية الطويلة متعددة الوسائط تمثل تكاليف كبيرة في مسار التكميم. لم تحسّن الأوزان الأصغر هامش الذاكرة عند الذروة ضمن سياسة التشغيل المختبرة. خفّض NVFP4 طاقة الخادم الكامل لكل سؤال بنسبة 2.33%، لكن هذه الفائدة لم تعوّض التراجع في المعدل والجودة لهذا العبء.
ماذا يعني ذلك لخدمة مستندات خاصة
يضيف تغيير الجدولة نحو 1,369 سؤالًا مكتملًا لكل ساعة تشغيل للعقدة عند المعدل المقاس. وهذا يعني إنجاز عمل مفيد أكثر باستخدام وحدات GPU الثماني نفسها عندما تتضمن الأعمال المتراكمة استعلامات متكررة عن الصفحات. يتطلب الاعتماد في الإنتاج تحليل أداء تمثيليًا أو مقدّر تكلفة مُتحققًا منه للصفحات الواردة؛ أما هذا الاختبار فاستخدم تكاليف مستمدة من مجموعة المستندات الثابتة نفسها.
بلغ وسيط زمن استجابة الطلبات في التشغيل المحسّن 4.521 ثانية، وبلغ p95 نحو 9.411 ثانية. وسجلت الأسئلة ذات النص الحر 0.93498 على مقياس ANLS، دون المتوسط العام. تحتاج التجربة الأولية إلى أهداف جودة تناسب مزيج صفحات العميل وسياسة مراجعة تلائم تكلفة الإجابة الخاطئة.
من عدد الأسئلة المقاس إلى نموذج التكلفة
يقسم نموذج التكلفة تكلفة البنية التحتية بالساعة على الجزء المباع من القدرة المقاسة البالغة 11,045 صفحة مكافئة/ساعة. وهو تحليل مستقل عن مقارنة الزيادة المحلية في المعدل بنسبة 3.07%.
| تكلفة شراء العقدة | استخدام مدفوع لكامل القدرة | طلب مدفوع بنسبة 10% |
|---|---|---|
| $100,000 | $0.49 | $4.21 |
| $150,000 | $0.69 | $6.22 |
يفترض النموذج إهلاكًا على ثلاث سنوات، وصيانة سنوية بنسبة 5%، و720 ساعة/شهر، وكهرباء بسعر $0.10/kWh، ومعامل استهلاك طاقة قدره 1.30 للتبريد وأعباء المنشأة. ويستخدم قدرة خادم نشطة قدرها 7.476590 kW وقدرة خمول تبلغ 1.016 kW. عند طلب مدفوع بنسبة 10%، يكون الحجم المباع 10% من قدرة الاختبار، فيما تستمر تكاليف الإهلاك والصيانة وكهرباء الخمول. لا تشمل الحسابات العمالة أو تشغيل التطبيقات أو الشبكات أو التخزين أو احتياطيات الخدمة.
للمقارنة السعرية، يعرض المثال 5 لتسعير Queries في AWS Textract سعرًا قدره $15 لكل 1,000 صفحة في منطقة غرب الولايات المتحدة (أوريغون)، وفق المراجعة في 15 سبتمبر 2026. ويقل سعر الخدمة التوضيحي في التقرير، البالغ $10 لكل 1,000 صفحة، عن ذلك المرجع بنسبة 33.33%. هذا سيناريو تسعير؛ إذ يحتوي عبؤنا المقاس على نحو 4.16 سؤالًا لكل صفحة، ولم نختبر تكافؤ جودة الاستخراج أو تغطية الميزات أو الخدمة المقدمة.
المنهجية والقيود
- النموذج وبيئة التشغيل: Qwen/Qwen3.6-27B، بالمراجعة
6a9e13bd6fc8f0983b9b99948120bc37f49c13e9، ودقة BF16؛ وvLLM 0.25.1 مع FlashAttention 2. ثماني نسخ مستقلة على وحدات RTX PRO 6000 Blackwell Server Edition، بذاكرة اسمية قدرها 96 GB لكل وحدة. ثبتنا إعدادات الخدمة؛ وعُطّل التفكير والتخزين المؤقت للبادئات، وفُعّل التخزين المؤقت للمعالج متعدد الوسائط. - البيانات والتقييم: مجموعة التحقق الكاملة من
lmms-lab-encoder/DocVQAبالمراجعة539088ef8a8ada01ac8e2e6d4e372586748a265e: 5,349 سؤالًا و1,285 صورة فريدة. طلبت الاستدعاءات إجابات قصيرة باستخدام أخذ عينات حتمي. تأتي نتائج الجودة والقدرة من التشغيل المحسّن نفسه على مجموعة التحقق كاملة. - تعريف المقياس: يقيس متوسط تشابه ليفنشتاين المطبّع (ANLS) التشابه مع الإجابات المرجعية؛ أما التطابق التام فيوحّد حالة الأحرف والمسافات البيضاء. لا تقيس مقاييس DocVQA هذه مباشرةً الأخطاء التجارية على مستوى الحقول.
- حدود التوقيت: من إرسال طلبات أسئلة المستندات عبر API بعد الإحماء حتى اكتمال الإجابات، ضمن نافذة زمنية مشتركة ومتزامنة للعقدة. المعدلات بالساعة تحويلات لتشغيل استغرق نحو سبع دقائق. ولا تشمل القياسات إدخال ملفات PDF أو موصلات المؤسسات أو التحقق من البنية أو المراجعة البشرية أو البدء البارد أو هندسة إتاحة الخدمة.
- حدود المقارنة: غيّر تبديل أشكال الدفعات 35 تنبؤًا مطبّعًا رغم ضبط درجة الحرارة على الصفر. الزيادة الطفيفة في ANLS اختلاف عددي مرصود، وليست دليلًا على أن الجدولة تحسّن دقة النموذج. مقارنة الجدولة في الظروف المتطابقة اختبار محلي، وليست تجربة إنتاج متكررة أو نتيجة معتمدة من المورّد. وينطبق تحويل معدل الصفحات على كثافة الأسئلة هذه فقط.
الإجابة الخاصة عن أسئلة المستندات والاستدلال متعدد الوسائط
في الإجابة الخاصة عن أسئلة المستندات، يساعد هذا الاختبار على ربط قدرة الاستدلال متعدد الوسائط بتراكم المستندات وموعد المعالجة. وحدته سؤال أُجيب عنه، لا ملف PDF أُدخل أو حقل أعمال جرى التحقق منه. ينبغي في نشر العميل تقييم صور صفحات ممثلة وجودة الإجابات وعملية المراجعة إلى جانب أداء الخدمة على GPU.
اجعل عبء مستنداتك معيار الاختبار
يمكن لـ ProsGrow تصميم تجربة أولية خاصة للمستندات تراعي مزيج صفحاتك وجودة الاستخراج والموعد المطلوب للمعالجة ومتطلبات الحوكمة.
ناقش تجربة أولية للمستندات