النتيجة: تقليل الانتظار بأكثر من 30%
عندما يعالج المساعد مستندًا أو طلبًا برمجيًا، يصبح الانتظار قبل بدء التوليد جزءًا من تجربة المستخدم. في اختبارات الخدمة الفعلية، قلّصت ProsGrow هذا الانتظار من 0.564 إلى 0.384 ثانية لموجّه يبلغ نحو 8,000 رمز: أي انخفاض بنسبة 32.0% في زمن وصول أول رمز (TTFT).
استخدمت المقارنة نموذج DeepSeek V4.1 Flash على المضيف نفسه المجهّز بـ 8 × AMD MI325X، مقابل خط الأساس المحلي لدينا مع إصدار النموذج وإصدارات بيئة التشغيل نفسها. لم تستفد الطلبات الباردة من أي إصابات في ذاكرة التخزين المؤقت للبادئات. وشملت التحسينات أطوال الموجّهات الثلاثة التي اختبرناها.
| طول المدخلات | خط الأساس المحلي | بعد تحسين ProsGrow | انخفاض زمن الاستجابة |
|---|---|---|---|
| نحو 8K رمز | 0.564 ثانية | 0.384 ثانية | 32.0% |
| نحو 60K رمز | 3.931 ثانية | 2.813 ثانية | 28.4% |
| نحو 300K رمز | 27.532 ثانية | 21.872 ثانية | 20.6% |
عند أطول موجّه اختبرناه، يعني ذلك انتظارًا أقل بنحو 5.66 ثانية قبل وصول المحتوى الأول. يصف العنوان زمن وصول أول رمز؛ ونقيس إنتاجية الطلب الكامل بصورة منفصلة أدناه.
مصدر التحسن
ركزنا على كيفية تنفيذ منظومة الخدمة للنموذج على عتاد AMD، وخاصةً العمل المطلوب لمعالجة الموجّه الوارد قبل بدء التوليد. وقد أتاح تحليل الأداء والتحسين الموجّه لبيئة التشغيل استعادة أداء إضافي من بيئة النشر القائمة.
تعتمد النتيجة على نموذج DeepSeek وإمكانات بيئتي التشغيل vLLM وAMD AITER الأصليتين. حافظنا على دقة نقطة التحقق الأصلية وعلى التحقق الفعلي بواسطة النموذج الهدف في التوليد التخميني. ولم نضف أي تكميم آخر فاقد للدقة.
بالنسبة إلى الفرق التي تشغّل بنية تحتية خاصة للذكاء الاصطناعي، تشير هذه النتيجة إلى فرصة: قياس موضع الاختناق في الخدمة قبل توسيع العتاد. ويعتمد التحسين المناسب على النموذج وأطوال الموجّهات ومتطلبات زمن الاستجابة للتطبيق.
فحوص الإنتاجية والجودة
أظهر فحص منفصل بعد النشر باستخدام موجّهات متكررة ومخزّنة مؤقتًا ارتفاع إنتاجية مخرجات الطلب الكامل بنسبة 7.7–10.2% عبر أطوال الموجّهات الثلاثة. يشمل هذا القياس الانتظار حتى أول رمز والوقت اللازم لاستلام الاستجابة كاملةً. وارتفع زمن وصول أول رمز مع التخزين المؤقت قليلًا، بنسبة 2.4–3.2%، لذا تتوقف الفائدة على المقياس الأهم لعبء العمل.
قبل اعتماد التغيير، قارنا الأسئلة الرياضية الـ 128 نفسها في حالتي الموجّه القصير والطويل. لم تتحول أي إجابة صحيحة في خط الأساس إلى إجابة خاطئة في أي من الحالتين، واجتازت الفحوص الوظيفية الستة بعد النشر جميعها الاختبار. تدعم هذه الفحوص المحدودة النطاق التغيير؛ أما جودة البرمجة الأوسع والمهام متعددة اللغات ومهام العملاء فتحتاج إلى تقييمات مستقلة.
مرجع InferenceX مقارنةً بـ ProsGrow
في اختبار AgentX منفصل استمر ساعة واحدة، حققت بيئتنا المحسّنة وسيط تفاعلية بلغ 261.780 رمزًا/ثانية/مستخدم، مقارنةً بـ 239.808 في مرجع InferenceX MI325X المحفوظ: أي زيادة بنسبة 9.16%. وارتفعت إنتاجية المخرجات لكل GPU من 15.83257 إلى 16.55379 رمزًا/ثانية، أي زيادة بنسبة 4.56%.
تستخدم هذه التشغيلات طول قبول تخميني اصطناعيًا مقداره 3.51 وفق إعداد الاختبار. وهذا إعداد لاختبار الأداء، وهو منفصل عن التحقق الفعلي المستخدم في اختبارات الخدمة والجودة لدينا. كما أن مكاسب الرسم البياني منفصلة عن انخفاض زمن وصول أول رمز للطلبات الباردة بنسبة 32%.
وسيط التفاعلية هو مقلوب وسيط الزمن بين الرموز، مع تطبيق طريقة التقريب في لوحة المعلومات. تشمل الإنتاجية فترات الخمول في سجل الطلبات. لا يحدد المرجع التاريخي نقطة التحقق وصورة بيئة التشغيل تحديدًا كاملًا؛ لذا فهذه مقارنة مرجعية مع إعادة إنتاج جزئية. أكمل التشغيل المنشور والتشغيل المحسّن 244 و252 طلبًا خضع لتحليل الأداء، على الترتيب، ولذلك يختلف مزيج الطلبات المكتملة بينهما. يوجد تشغيل واحد لكل إعداد، دون فاصل ثقة. قياسات ProsGrow المعروضة هنا نتائج محلية.
نطاق القياس
أُجريت الاختبارات في 24 سبتمبر 2026، مع توزيع النموذج على وحدات GPU الثماني كلها. أنتج كل طلب خدمة فعلية 1,024 رمز مخرجات بالضبط. يقيس TTFT الزمن من بدء الطلب إلى أول محتوى متدفق غير فارغ. ضُبطت الموجّهات المقابلة وأطوال المخرجات، وتأكدنا من عدم وجود أي إصابة في ذاكرة التخزين المؤقت للبادئات للطلبات الباردة.
استخدم كل إعداد بارد طلب إحماء واحدًا وأربعة طلبات مقاسة لكل طول موجّه. نُفّذت التشغيلات بالتتابع، مع اختلاف تاريخ التجميع والتخزين المؤقت. هذه قياسات محلية مقابل خط الأساس الذي أعدنا إنتاجه؛ وستختلف النتائج باختلاف حركة الطلبات والتزامن ومزيج الموجّهات. تمثل نسبة 32% أفضل انخفاض لوحظ عبر الأطوال الثلاثة المختبرة، ولا تتضمن فاصل ثقة أو التزامًا باتفاقية مستوى خدمة إنتاجية.
استضافة DeepSeek الخاصة وحوسبة AMD GPU
للفرق التي تقيّم استضافة DeepSeek الخاصة أو خوادم AMD GPU المخصصة، يربط هذا الاختبار تخطيط النشر بدقة النموذج وطول الموجّه وزمن الاستجابة. يقيس زمن وصول أول رمز (TTFT) متى تبدأ الإجابة؛ وتقيس إنتاجية الطلب الكامل جانبًا آخر من التجربة. يمكن لـ ProsGrow تقييم هذه المقايضات لعبء الاستدلال الخاص لديك.
استكشف إمكانات تحسين بيئة التشغيل لديك
هل تشغّل DeepSeek أو تخطط لنشر ذكاء اصطناعي خاص؟ تواصل معنا لمناقشة النتائج ونهج التحسين لدينا وإجراء تقييم باستخدام نموذجك وعبء عملك. يمكننا مساعدتك في تحديد مواضع التحسين الممكنة في بنيتك التحتية.
للحصول على موارد حوسبة AMD GPU أو خوادم GPU مخصصة أو بنية تحتية خاصة للاستدلال، تواصل معنا لمناقشة متطلباتك.
احجز مكالمة معناتفضّل البريد الإلكتروني؟ contact@prosgrow.ai