المهام المختلفة تحتاج فئات خدمة مختلفة
تحتاج المعاينة الإبداعية إلى انتظار قصير. ويحتاج نقل الحركة إلى الحفاظ على أداء المصدر في مخرج أطول. وقد يشغل طلب سمعي بصري عالي الدقة عدة وحدات GPU في وقت واحد. ويتطلب تحسين هذه الخدمات قرارات تتعلق بالدقة العددية والانتباه والإقامة في الذاكرة والتوازي والترجمة البرمجية والجودة.
قيّمت ProsGrow هذه الفئات على عقدة تضم ثماني وحدات RTX PRO 6000 Blackwell GPU. خفّضت مقارنة MiniMax-H3 زمن الاستدلال على الخادم من 19.392 إلى 8.913 ثانية للطلب نفسه بصيغة BF16 Turbo على الوحدات الثماني نفسها، أي انخفاضًا في الزمن بنسبة 54.0%. وتوضح دراسات Wan وAnimate المنفصلة كيف تغيّر مواعيد التسليم والطلب الإجمالي ومتطلبات الجودة الإعداد المناسب.
كان نهجنا تحديد متطلبات عبء العمل، وتحليل اختناقاته، ومقارنة إعدادات التشغيل المرشحة، والتحقق من النتيجة المختارة. وتربط الدراسات كل تحسن مقاس بقيود الموارد والجودة المرتبطة به.
MiniMax-H3: زمن الاستجابة والذاكرة والجودة
كشف MiniMax-H3 عن كلفة توزيع عبء عمل سمعي بصري كبير عبر عقدة PCIe. وأدى تغيير تقسيم العمل المتوازي إلى خفض الاستدلال على الخادم من 19.392 إلى 8.913 ثانية على وحدات GPU الثماني نفسها، أي انخفاض الزمن بنسبة 54.0% للطلب نفسه بصيغة BF16 Turbo.
يفرض توازي الموترات وتوازي التسلسل احتياجات مختلفة للاتصال والذاكرة. دعمت القياسات المضبوطة انخفاض كلفة الاتصال لهذا العبء، رغم عدم وجود تتبع صالح للنواة يثبت السبب على مستوى النواة. استهلك إعداد الزمن المختار نحو 84.2 GB لكل GPU، بينما أدت الإعدادات ذات هامش الذاكرة الأكبر إلى زيادة الزمن.
توفر حزمة SGLang MiniMax-H3 الأصلية المكوّنات الأساسية لخدمة النموذج والتوازي. وكانت مساهمة ProsGrow تقييم سلوكها على هذا العتاد والاختيار وفق هدف الخدمة.
أعادت تجربة مستقلة للحساب التقريبي استخدام حسابات وسيطة، وخفّضت زمن الاستدلال على الخادم من 8.913 إلى 7.092 ثانية، بتحسن إضافي قدره 20.44%. وانخفض زمن اكتمال API من 10.045 إلى 8.040 ثانية، مع استمرار تخصيص وحدات GPU الثماني كلها لطلب واحد. وظل زمن فك الترميز شبه ثابت.
لهذا التحسن الإضافي شرط قبول مختلف: الحساب التقريبي يحتاج إلى بوابة جودة. اجتاز المرشح المختار فحصًا محدودًا للاتساق العددي على مشهد واحد. وهذا دليل لصالح إعداد تشغيل مرشح، وليس إثباتًا لتكافؤ إدراكي واسع أو اعتمادًا لجميع أعباء عمل العملاء.
Wan2.2: مقارنة مضبوطة بأربع خطوات
| المقياس | خط أساس BF16 المقطّر | إعداد LightX2V المختار |
|---|---|---|
| المسار بعد الإحماء | 22.164 s | 9.062 s · أقل بنسبة 59.1% |
| إزالة الضوضاء | 19.164 s | 6.076 s |
| فك ترميز VAE | نحو 2.37 s | نحو 2.36 s |
يجمع المسار المختار بين خفض الدقة والانتباه المتناثر والإقامة على GPU. تأتي هذه القدرات من نموذج LightWan2.2 وبيئة تشغيل LightX2V الأصليين، بما فيها تقطير الخطوات الواعي بالتكميم. دمجت ProsGrow مسار التنفيذ وتحققت منه، وأنشأت ضوابط مقارنة محلية، وقاست المفاضلات الناتجة للخدمة.
استغرق تشغيل قياسي بصيغة BF16 من 40 خطوة 357.640 ثانية. ويعود جزء كبير من الفرق عن هذا المرجع إلى تقطير الخطوات الذي يوفره المشروع الأصلي. وتقيس مقارنة BF16 ذات الخطوات الأربع تحسنًا إضافيًا مجمعًا في التنفيذ قدره 2.45×، منفصلًا عن فائدة تقطير الخطوات.
تفاعل الدقة والانتباه والإقامة في الذاكرة
امتدت فرص التحسين عبر عدة طبقات من مسار التنفيذ:
- الدقة والانتباه: قلّص التمثيل العددي الأصغر والانتباه المتناثر عمل إزالة الضوضاء. وتعتمد فائدتهما المشتركة على النموذج ومسار التنفيذ المدعوم؛ فتغيير التنسيق وحده لا يضمن خدمة أسرع.
- الإقامة على GPU: أمكن إبقاء أوزان الخبراء الأصغر في ذاكرة GPU، ما أزال عمليات النقل من المضيف إلى الجهاز من المسار الحرج. وقد غيّر توفير الذاكرة مكان تنفيذ الحسابات وحجم العمليات الحسابية المطلوبة معًا.
- توازن المسار: بقي فك الترميز قرب 2.36 ثانية. ومع تسارع إزالة الضوضاء، أصبحت هذه المرحلة شبه الثابتة تشكّل حصة أكبر من الطلب، ما حدّ من مكاسب أي تحسين إضافي لمزيل الضوضاء.
- الخدمة بعد الإحماء مقابل البدء البارد: استغرقت العملية المنفردة المحسّنة 72.12 ثانية، بما يشمل تحميل النموذج والإحماء والإغلاق. لذا تعتمد نتيجة الاستدلال القصيرة بعد الإحماء على خدمة تدير أعمال البدء والإقامة في الذاكرة.
تقيس النتيجة المضبوطة هذه التغييرات مجتمعة، ولا تنسب تسريعًا سببيًا مستقلًا إلى كل طبقة. ولهذا يحتاج التحسين إلى توقيت المراحل وإلى حدود تسليم شاملة من البداية إلى النهاية.
أظهرت جولة متزامنة للعقدة أزمنة متقاربة بعد الإحماء عبر وحدات GPU. ويعادل أبطأ اكتمال فيها نحو 3,138 مقطعًا في الساعة وفق متطلبات هذه المعاينة. وهذا تحويل للسعة من جولة مقاسة واحدة، وليس اختبار API مستمرًا لمدة ساعة. كما تقيّد الجودة النتيجة: اختلفت التكوينات المولّدة ولم يُثبت التكافؤ الإدراكي.
Animate-2: إنتاجية لخدمة غير متزامنة
ينتج Animate-2 فيديو لنقل الحركة مدته 11.21 ثانية انطلاقًا من صورة مرجعية وفيديو مصدر. وتناسب مهامه الأطول طابورًا غير متزامن، حيث تكون المخرجات المكتملة والطاقة لكل مهمة أهم من موعد تسليم معاينة تفاعلية.
جمعت ProsGrow مسار تنفيذ FP8 متحققًا منه مع ذاكرة تخزين مؤقت دائمة للترجمة البرمجية. قلّلت إعادة استخدام الشيفرة المترجمة أعمال البدء المتكررة، بينما غيّرت الدقة العددية كلفة التنفيذ المستقر. وقيس الاثنان ضمن حدود الإطلاق الكامل التي تستخدمها الخدمة.
| المقياس | خط أساس BF16 | FP8 + ذاكرة ترجمة مؤقتة |
|---|---|---|
| معدل مخرجات العقدة | 24.382 مخرجًا/ساعة | 28.678 مخرجًا/ساعة · +17.62% |
| متوسط قدرة العقدة كاملة | 6.581 kW | 6.575 kW |
| الطاقة لكل مخرج | 0.270 kWh | 0.229 kWh |
أدى ثبات قدرة الخادم تقريبًا مع ارتفاع الإنتاجية إلى خفض الطاقة لكل مخرج بنحو 15.1%. ولم يترك الإعداد المختار سوى نحو 4 GiB من هامش ذاكرة GPU، ما يجعل أبعاد المخرجات والعمل المتزامن قيدين مهمين في النشر.
تُعد ذاكرة الترجمة المؤقتة أيضًا أصلًا تشغيليًا: يجب إدارة إصداراتها أو إعادة بنائها عند تغير العتاد أو بيئة التشغيل أو شكل النموذج أو إعدادات الترجمة. وتشمل النتيجة المفيدة قرار دورة الحياة هذا إلى جانب الإنتاجية وفحص التراجع البصري.
اختيار إعداد التشغيل المناسب للعميل
قد يؤدي استخدام العقدة كاملة إلى تقصير طلب واحد. وقد يتيح تقسيم السعة إلى نُسخ أصغر إكمال عدد أكبر من المهام المستقلة إجمالًا. أنتجت دراسة MiniMax منفصلة، باستخدام تقليم النموذج الأصلي ومهايئ Turbo، معدلًا قدره 478.14 مقطعًا في الساعة من جولة متزامنة واحدة، مع طلبات تستغرق نحو 30.1 ثانية لكل منها. ويحتاج تغير النموذج وشكل الخدمة إلى تقييم جودة مستقل.
| فئة الخدمة | الهدف الرئيسي | القيود الواجب مراعاتها |
|---|---|---|
| معاينة تفاعلية | زمن قصير لإكمال الطلب | الإقامة بعد الإحماء والاصطفاف والتغير البصري المقبول |
| التوليد الإجمالي | المقاطع المقبولة لكل عقدة | ذاكرة النسخ وانتظار كل طلب والجودة |
| نقل حركة غير متزامن | المهام المكتملة والطاقة لكل مخرج | دورة حياة الترجمة وهامش الذاكرة والحفاظ على المصدر |
لا يوجد إعداد واحد يتفوق عبر جميع هذه الأهداف. النتيجة المفيدة هي مجموعة خيارات مقاسة بين الزمن والإنتاجية والذاكرة والطاقة والجودة. توفر هذه الدراسات أدلة لاختيار فئة الخدمة؛ ثم يجب على تجربة العميل التحقق من المخرجات المقبولة والاصطفاف ومواعيد التسليم باستخدام وسائط ممثلة.
المنهجية والقيود
| الدراسة | متطلبات المخرجات | حدود القياس |
|---|---|---|
| Wan2.2 / LightWan2.2 | 81 إطارًا، 832×480، 16 FPS، 5.0625 s؛ مطالبة وبذرة مضبوطتان | LightX2V؛ مسار متزامن بعد الإحماء حتى الترميز والحفظ؛ يستثني تحميل النموذج والإحماء |
| Wan2.2 Animate-2 14B | 269 إطارًا، 713×1264، 24 FPS، 11.2083 s، صوت المصدر؛ الوسائط المرجعية نفسها وأربعة مقاطع × عشر خطوات | LightX2V؛ الزمن الفعلي للإطلاق الكامل، مع ملء ذاكرة الترجمة المؤقتة للنتيجة المختارة |
| MiniMax-H3 FL2VA Turbo | 1344×768، 124 إطارًا، 24 FPS، ملف مدته 5.175 s، صوت مولّد؛ المطالبة والبذرة نفسيهما، مع أربع عمليات تقييم مرصودة لمزيل الضوضاء | SGLang؛ قياس الاستدلال على الخادم واكتمال API الكامل كلٌّ على حدة |
- العتاد والتكرار: عقدة واحدة بثماني وحدات RTX PRO 6000 Blackwell GPU، بذاكرة اسمية 96 GB لكل وحدة. يسجل Wan عملية توليد مقاسة واحدة بعد الإحماء لكل عملية عاملة. ومعدل Animate المختار هو الأبطأ من تشغيلين للعقدة. لكل مرشح زمن في H3 طلب إحماء وطلب مقاس واحد؛ وتأتي معدلات النسخ من جولة متزامنة واحدة. لا تثبت هذه الدراسات القصيرة اتفاقيات خدمة تحت حمل مستمر أو مئينات زمن الاستجابة.
- جودة Wan: أظهرت مراجعة لوحات اللقطات مقاطع متماسكة، لكن المرجع القياسي ذي 40 خطوة التزم بحرفية المطالبة بصورة أوضح في المشهد الوحيد المختبر. ولا تثبت تغييرات التقطير والتناثر والدقة التكافؤ الإدراكي.
- جودة Animate: قورنت الإطارات الـ 269 جميعها مع BF16، فنتج SSIM قدره 0.9534 وPSNR قدره 31.74 dB. وهذه فحوص تراجع بصري على مدخل واحد.
- جودة H3: سجّل التقريب المختار SSIM قدره 0.8128 مقابل المرجع، أعلى بفارق ضئيل من الحد الأدنى 0.8102 المرصود عبر إعدادات التوازي المحلية. ولا يحل هذا الفحص العددي محل مراجعة متعددة المطالبات للحركة والالتزام بالمطالبة وتزامن الصوت أو التفضيل البشري. وسجّلت دراسة إنتاجية النموذج المقلّم المنفصلة SSIM قدره 0.8815 مقابل مرجع النموذج الأصلي.
- الإسناد والتوقيت: توفر النماذج وبيئات التشغيل الأصلية لبنات التحسين. ولا تعزل التغييرات المجمعة أثر كل مكوّن. يستثني استدلال H3 على الخادم استقصاء العميل والتنزيل؛ ويجب إبقاء نتيجة الخادم البالغة 8.913 ثانية منفصلة عن نتيجة API البالغة 10.045 ثانية في المقارنات.
جُمعت قياسات Wan بين 12 و18 أغسطس، واختبارات متابعة MiniMax يومَي 1 و2 سبتمبر 2026. وتنطبق النتائج على الوسائط ومتطلبات المخرجات المذكورة.
توليد الفيديو الخاص باستخدام MiniMax-H3 وWan
في توليد الفيديو الخاص باستخدام MiniMax-H3 أو Wan2.2، يكون سؤال النشر الأول ما إذا كانت الخدمة تعطي الأولوية لمعاينة سريعة أم للمهام المكتملة بمرور الوقت. يصف زمن استدلال الخادم وإتمام طلب API بالكامل وإنتاجية التوليد حدودًا مختلفة. ينبغي أن يربط تقييم العميل كل نتيجة بأبعاد المخرجات والوسائط المصدرية والتغيرات المرئية المقبولة.
حدّد خدمة الفيديو التي يحتاجها عبء عملك
قدّم الوسائط المصدرية وأبعاد المخرجات ومتطلبات الجودة وهدف التسليم. سنضع خط أساس ونقارن إعدادات التشغيل التي تغيّر سعة هذه الخدمة أو زمنها.
ناقش مشروعًا تجريبيًا