الهندسة · استدلال الفيديو

كيف خفّضت ProsGrow زمن استدلال الفيديو في MiniMax-H3 بنسبة 54%

انخفض زمن استدلال MiniMax-H3 على الخادم من 19.392 إلى 8.913 ثانية للطلب نفسه بصيغة BF16 Turbo على وحدات GPU الثماني نفسها. وخفّضت دراسات منفصلة زمن Wan بعد الإحماء بنسبة 59.1%، ورفعت إنتاجية Animate بنسبة 17.62%.

· آخر تحديث · فريق هندسة ProsGrow AI · قراءة في 8 دقائق

استدلال MiniMax-H3 على الخادم: من 19.392 إلى 8.913 ثانية على وحدات GPU الثماني نفسها، بانخفاض الزمن 54% للطلب نفسه بصيغة BF16 Turbo.

المهام المختلفة تحتاج فئات خدمة مختلفة

تحتاج المعاينة الإبداعية إلى انتظار قصير. ويحتاج نقل الحركة إلى الحفاظ على أداء المصدر في مخرج أطول. وقد يشغل طلب سمعي بصري عالي الدقة عدة وحدات GPU في وقت واحد. ويتطلب تحسين هذه الخدمات قرارات تتعلق بالدقة العددية والانتباه والإقامة في الذاكرة والتوازي والترجمة البرمجية والجودة.

قيّمت ProsGrow هذه الفئات على عقدة تضم ثماني وحدات RTX PRO 6000 Blackwell GPU. خفّضت مقارنة MiniMax-H3 زمن الاستدلال على الخادم من 19.392 إلى 8.913 ثانية للطلب نفسه بصيغة BF16 Turbo على الوحدات الثماني نفسها، أي انخفاضًا في الزمن بنسبة 54.0%. وتوضح دراسات Wan وAnimate المنفصلة كيف تغيّر مواعيد التسليم والطلب الإجمالي ومتطلبات الجودة الإعداد المناسب.

كان نهجنا تحديد متطلبات عبء العمل، وتحليل اختناقاته، ومقارنة إعدادات التشغيل المرشحة، والتحقق من النتيجة المختارة. وتربط الدراسات كل تحسن مقاس بقيود الموارد والجودة المرتبطة به.

MiniMax-H3: زمن الاستجابة والذاكرة والجودة

كشف MiniMax-H3 عن كلفة توزيع عبء عمل سمعي بصري كبير عبر عقدة PCIe. وأدى تغيير تقسيم العمل المتوازي إلى خفض الاستدلال على الخادم من 19.392 إلى 8.913 ثانية على وحدات GPU الثماني نفسها، أي انخفاض الزمن بنسبة 54.0% للطلب نفسه بصيغة BF16 Turbo.

يفرض توازي الموترات وتوازي التسلسل احتياجات مختلفة للاتصال والذاكرة. دعمت القياسات المضبوطة انخفاض كلفة الاتصال لهذا العبء، رغم عدم وجود تتبع صالح للنواة يثبت السبب على مستوى النواة. استهلك إعداد الزمن المختار نحو 84.2 GB لكل GPU، بينما أدت الإعدادات ذات هامش الذاكرة الأكبر إلى زيادة الزمن.

توفر حزمة SGLang MiniMax-H3 الأصلية المكوّنات الأساسية لخدمة النموذج والتوازي. وكانت مساهمة ProsGrow تقييم سلوكها على هذا العتاد والاختيار وفق هدف الخدمة.

أعادت تجربة مستقلة للحساب التقريبي استخدام حسابات وسيطة، وخفّضت زمن الاستدلال على الخادم من 8.913 إلى 7.092 ثانية، بتحسن إضافي قدره 20.44%. وانخفض زمن اكتمال API من 10.045 إلى 8.040 ثانية، مع استمرار تخصيص وحدات GPU الثماني كلها لطلب واحد. وظل زمن فك الترميز شبه ثابت.

لهذا التحسن الإضافي شرط قبول مختلف: الحساب التقريبي يحتاج إلى بوابة جودة. اجتاز المرشح المختار فحصًا محدودًا للاتساق العددي على مشهد واحد. وهذا دليل لصالح إعداد تشغيل مرشح، وليس إثباتًا لتكافؤ إدراكي واسع أو اعتمادًا لجميع أعباء عمل العملاء.

Wan2.2: مقارنة مضبوطة بأربع خطوات

خط الأساس · BF16 مقطّر، وانتباه كثيف، ونقل إلى CPU22.164 ثانية
إعداد ProsGrow · دقة أقل، وانتباه متناثر، وإقامة على GPU9.062 ثانية · أقل بنسبة 59.1%
وحدة RTX PRO 6000 Blackwell GPU واحدة؛ المطالبة والبذرة وجدول الخطوات الأربع والمخرج المكوّن من 81 إطارًا بدقة 832×480 ثابتة. جرى إحماء المسارين. تتغير الدقة والانتباه وموضع الذاكرة معًا. وتختلف التكوينات المرئية المولّدة؛ ولم يُثبت التكافؤ الإدراكي.
وحدة GPU والمطالبة والبذرة وجدول الخطوات الأربع وأبعاد المخرجات نفسها
المقياسخط أساس BF16 المقطّرإعداد LightX2V المختار
المسار بعد الإحماء22.164 s9.062 s · أقل بنسبة 59.1%
إزالة الضوضاء19.164 s6.076 s
فك ترميز VAEنحو 2.37 sنحو 2.36 s

يجمع المسار المختار بين خفض الدقة والانتباه المتناثر والإقامة على GPU. تأتي هذه القدرات من نموذج LightWan2.2 وبيئة تشغيل LightX2V الأصليين، بما فيها تقطير الخطوات الواعي بالتكميم. دمجت ProsGrow مسار التنفيذ وتحققت منه، وأنشأت ضوابط مقارنة محلية، وقاست المفاضلات الناتجة للخدمة.

استغرق تشغيل قياسي بصيغة BF16 من 40 خطوة 357.640 ثانية. ويعود جزء كبير من الفرق عن هذا المرجع إلى تقطير الخطوات الذي يوفره المشروع الأصلي. وتقيس مقارنة BF16 ذات الخطوات الأربع تحسنًا إضافيًا مجمعًا في التنفيذ قدره 2.45×، منفصلًا عن فائدة تقطير الخطوات.

تفاعل الدقة والانتباه والإقامة في الذاكرة

امتدت فرص التحسين عبر عدة طبقات من مسار التنفيذ:

  • الدقة والانتباه: قلّص التمثيل العددي الأصغر والانتباه المتناثر عمل إزالة الضوضاء. وتعتمد فائدتهما المشتركة على النموذج ومسار التنفيذ المدعوم؛ فتغيير التنسيق وحده لا يضمن خدمة أسرع.
  • الإقامة على GPU: أمكن إبقاء أوزان الخبراء الأصغر في ذاكرة GPU، ما أزال عمليات النقل من المضيف إلى الجهاز من المسار الحرج. وقد غيّر توفير الذاكرة مكان تنفيذ الحسابات وحجم العمليات الحسابية المطلوبة معًا.
  • توازن المسار: بقي فك الترميز قرب 2.36 ثانية. ومع تسارع إزالة الضوضاء، أصبحت هذه المرحلة شبه الثابتة تشكّل حصة أكبر من الطلب، ما حدّ من مكاسب أي تحسين إضافي لمزيل الضوضاء.
  • الخدمة بعد الإحماء مقابل البدء البارد: استغرقت العملية المنفردة المحسّنة 72.12 ثانية، بما يشمل تحميل النموذج والإحماء والإغلاق. لذا تعتمد نتيجة الاستدلال القصيرة بعد الإحماء على خدمة تدير أعمال البدء والإقامة في الذاكرة.

تقيس النتيجة المضبوطة هذه التغييرات مجتمعة، ولا تنسب تسريعًا سببيًا مستقلًا إلى كل طبقة. ولهذا يحتاج التحسين إلى توقيت المراحل وإلى حدود تسليم شاملة من البداية إلى النهاية.

أظهرت جولة متزامنة للعقدة أزمنة متقاربة بعد الإحماء عبر وحدات GPU. ويعادل أبطأ اكتمال فيها نحو 3,138 مقطعًا في الساعة وفق متطلبات هذه المعاينة. وهذا تحويل للسعة من جولة مقاسة واحدة، وليس اختبار API مستمرًا لمدة ساعة. كما تقيّد الجودة النتيجة: اختلفت التكوينات المولّدة ولم يُثبت التكافؤ الإدراكي.

Animate-2: إنتاجية لخدمة غير متزامنة

ينتج Animate-2 فيديو لنقل الحركة مدته 11.21 ثانية انطلاقًا من صورة مرجعية وفيديو مصدر. وتناسب مهامه الأطول طابورًا غير متزامن، حيث تكون المخرجات المكتملة والطاقة لكل مهمة أهم من موعد تسليم معاينة تفاعلية.

جمعت ProsGrow مسار تنفيذ FP8 متحققًا منه مع ذاكرة تخزين مؤقت دائمة للترجمة البرمجية. قلّلت إعادة استخدام الشيفرة المترجمة أعمال البدء المتكررة، بينما غيّرت الدقة العددية كلفة التنفيذ المستقر. وقيس الاثنان ضمن حدود الإطلاق الكامل التي تستخدمها الخدمة.

عبء عمل متكافئ للعقدة، مع ملء ذاكرة الترجمة المؤقتة للنتيجة المختارة
المقياسخط أساس BF16FP8 + ذاكرة ترجمة مؤقتة
معدل مخرجات العقدة24.382 مخرجًا/ساعة28.678 مخرجًا/ساعة · +17.62%
متوسط قدرة العقدة كاملة6.581 kW6.575 kW
الطاقة لكل مخرج0.270 kWh0.229 kWh

أدى ثبات قدرة الخادم تقريبًا مع ارتفاع الإنتاجية إلى خفض الطاقة لكل مخرج بنحو 15.1%. ولم يترك الإعداد المختار سوى نحو 4 GiB من هامش ذاكرة GPU، ما يجعل أبعاد المخرجات والعمل المتزامن قيدين مهمين في النشر.

تُعد ذاكرة الترجمة المؤقتة أيضًا أصلًا تشغيليًا: يجب إدارة إصداراتها أو إعادة بنائها عند تغير العتاد أو بيئة التشغيل أو شكل النموذج أو إعدادات الترجمة. وتشمل النتيجة المفيدة قرار دورة الحياة هذا إلى جانب الإنتاجية وفحص التراجع البصري.

اختيار إعداد التشغيل المناسب للعميل

قد يؤدي استخدام العقدة كاملة إلى تقصير طلب واحد. وقد يتيح تقسيم السعة إلى نُسخ أصغر إكمال عدد أكبر من المهام المستقلة إجمالًا. أنتجت دراسة MiniMax منفصلة، باستخدام تقليم النموذج الأصلي ومهايئ Turbo، معدلًا قدره 478.14 مقطعًا في الساعة من جولة متزامنة واحدة، مع طلبات تستغرق نحو 30.1 ثانية لكل منها. ويحتاج تغير النموذج وشكل الخدمة إلى تقييم جودة مستقل.

ما الذي ينبغي تحسينه لكل فئة خدمة
فئة الخدمةالهدف الرئيسيالقيود الواجب مراعاتها
معاينة تفاعليةزمن قصير لإكمال الطلبالإقامة بعد الإحماء والاصطفاف والتغير البصري المقبول
التوليد الإجماليالمقاطع المقبولة لكل عقدةذاكرة النسخ وانتظار كل طلب والجودة
نقل حركة غير متزامنالمهام المكتملة والطاقة لكل مخرجدورة حياة الترجمة وهامش الذاكرة والحفاظ على المصدر

لا يوجد إعداد واحد يتفوق عبر جميع هذه الأهداف. النتيجة المفيدة هي مجموعة خيارات مقاسة بين الزمن والإنتاجية والذاكرة والطاقة والجودة. توفر هذه الدراسات أدلة لاختيار فئة الخدمة؛ ثم يجب على تجربة العميل التحقق من المخرجات المقبولة والاصطفاف ومواعيد التسليم باستخدام وسائط ممثلة.

المنهجية والقيود

متطلبات الطلبات وراء الدراسات الثلاث
الدراسةمتطلبات المخرجاتحدود القياس
Wan2.2 / LightWan2.281 إطارًا، 832×480، ‏16 FPS، ‏5.0625 s؛ مطالبة وبذرة مضبوطتانLightX2V؛ مسار متزامن بعد الإحماء حتى الترميز والحفظ؛ يستثني تحميل النموذج والإحماء
Wan2.2 Animate-2 14B269 إطارًا، 713×1264، ‏24 FPS، ‏11.2083 s، صوت المصدر؛ الوسائط المرجعية نفسها وأربعة مقاطع × عشر خطواتLightX2V؛ الزمن الفعلي للإطلاق الكامل، مع ملء ذاكرة الترجمة المؤقتة للنتيجة المختارة
MiniMax-H3 FL2VA Turbo1344×768، ‏124 إطارًا، ‏24 FPS، ملف مدته 5.175 s، صوت مولّد؛ المطالبة والبذرة نفسيهما، مع أربع عمليات تقييم مرصودة لمزيل الضوضاءSGLang؛ قياس الاستدلال على الخادم واكتمال API الكامل كلٌّ على حدة
  • العتاد والتكرار: عقدة واحدة بثماني وحدات RTX PRO 6000 Blackwell GPU، بذاكرة اسمية 96 GB لكل وحدة. يسجل Wan عملية توليد مقاسة واحدة بعد الإحماء لكل عملية عاملة. ومعدل Animate المختار هو الأبطأ من تشغيلين للعقدة. لكل مرشح زمن في H3 طلب إحماء وطلب مقاس واحد؛ وتأتي معدلات النسخ من جولة متزامنة واحدة. لا تثبت هذه الدراسات القصيرة اتفاقيات خدمة تحت حمل مستمر أو مئينات زمن الاستجابة.
  • جودة Wan: أظهرت مراجعة لوحات اللقطات مقاطع متماسكة، لكن المرجع القياسي ذي 40 خطوة التزم بحرفية المطالبة بصورة أوضح في المشهد الوحيد المختبر. ولا تثبت تغييرات التقطير والتناثر والدقة التكافؤ الإدراكي.
  • جودة Animate: قورنت الإطارات الـ 269 جميعها مع BF16، فنتج SSIM قدره 0.9534 وPSNR قدره 31.74 dB. وهذه فحوص تراجع بصري على مدخل واحد.
  • جودة H3: سجّل التقريب المختار SSIM قدره 0.8128 مقابل المرجع، أعلى بفارق ضئيل من الحد الأدنى 0.8102 المرصود عبر إعدادات التوازي المحلية. ولا يحل هذا الفحص العددي محل مراجعة متعددة المطالبات للحركة والالتزام بالمطالبة وتزامن الصوت أو التفضيل البشري. وسجّلت دراسة إنتاجية النموذج المقلّم المنفصلة SSIM قدره 0.8815 مقابل مرجع النموذج الأصلي.
  • الإسناد والتوقيت: توفر النماذج وبيئات التشغيل الأصلية لبنات التحسين. ولا تعزل التغييرات المجمعة أثر كل مكوّن. يستثني استدلال H3 على الخادم استقصاء العميل والتنزيل؛ ويجب إبقاء نتيجة الخادم البالغة 8.913 ثانية منفصلة عن نتيجة API البالغة 10.045 ثانية في المقارنات.

جُمعت قياسات Wan بين 12 و18 أغسطس، واختبارات متابعة MiniMax يومَي 1 و2 سبتمبر 2026. وتنطبق النتائج على الوسائط ومتطلبات المخرجات المذكورة.

توليد الفيديو الخاص باستخدام MiniMax-H3 وWan

في توليد الفيديو الخاص باستخدام MiniMax-H3 أو Wan2.2، يكون سؤال النشر الأول ما إذا كانت الخدمة تعطي الأولوية لمعاينة سريعة أم للمهام المكتملة بمرور الوقت. يصف زمن استدلال الخادم وإتمام طلب API بالكامل وإنتاجية التوليد حدودًا مختلفة. ينبغي أن يربط تقييم العميل كل نتيجة بأبعاد المخرجات والوسائط المصدرية والتغيرات المرئية المقبولة.

حدّد خدمة الفيديو التي يحتاجها عبء عملك

قدّم الوسائط المصدرية وأبعاد المخرجات ومتطلبات الجودة وهدف التسليم. سنضع خط أساس ونقارن إعدادات التشغيل التي تغيّر سعة هذه الخدمة أو زمنها.

ناقش مشروعًا تجريبيًا