ملاحظات هندسية · التعرف على الكلام

كيف حققت ProsGrow معالجة 7,200 ساعة صوتية في الساعة باستخدام Whisper

تعادل إنتاجية Whisper المعيارية نحو 7,200 ساعة من الصوت المصدر لكل ساعة فعلية على ثماني وحدات GPU. رفعت ProsGrow الإنتاجية من 291.771 إلى 299.444 عينة/ثانية، بزيادة 2.63%، مع اجتياز اختبار الدقة. والرقم الساعي هو تحويل للسعة انطلاقًا من اختبارات مدتها 10 دقائق.

· آخر تحديث · فريق هندسة ProsGrow AI · قراءة في 7 دقائق

تكلفة البنية التحتية المقدرة لـ Whisper أقل بنسبة 97.80% من سعر OpenAI API: ‏$0.0001321 مقابل $0.006 لكل دقيقة صوتية، عند طلب مدفوع 10% على عقدة بقيمة $100K وكفاءة خدمة 70%.

المشكلة: استعادة السعة دون تغيير نموذج الكلام

تحتاج خدمة تفريغ الأرشيف الصوتي إلى معالجة مزيد من الصوت مع تحقيق هدف جودة محدد. بدأت ProsGrow بتنفيذ Whisper العام المستخدم في MLPerf Inference v6.0، وأعادت إنتاج إعداد مدعوم منه على عقدة تضم ثماني وحدات RTX PRO 6000 Blackwell GPU. وحقق خط الأساس في الاختبار الكامل 291.771 عينة صوتية/ثانية.

حلّلنا سلوك تجميع الدفعات في المحرك، ووجدنا أن الإعداد العام لم يكن الأمثل لهذا النظام. وأدى تعديل مدعوم للإعداد إلى 299.444 عينة/ثانية عبر تشغيلين كاملين، أي زيادة الإنتاجية بنسبة 2.63% على وحدات GPU الثماني نفسها. واجتاز الإعداد المختار أيضًا عتبة الدقة للاختبار المعياري.

خط الأساس ← ضبط ProsGrow

الإعداد العام · خط الأساس المحلي291.771 عينة صوتية/ثانية
إعداد ProsGrow المختار · متوسط تشغيلين299.444 عينة صوتية/ثانية · +2.63%
اختبارات Whisper Offline محلية مشتقة من MLPerf على العقدة نفسها ذات الثماني وحدات GPU، بمدة اختبار دنيا تبلغ 10 دقائق لكل تشغيل. تبدأ الأعمدة من الصفر.
الإعداد المحليعينات صوتية/ثانيةعينات/ثانية/GPUالتحسن مقارنة بخط الأساس المحلي
الإعداد العام · خط الأساس291.77136.471—
الإعداد المختار · التشغيل 1299.62837.4542.69%
الإعداد المختار · التشغيل 2، أدنى نتيجة مرصودة299.26037.4082.57%
الإعداد المختار · متوسط تشغيلين299.44437.4312.63%

لم يختلف التشغيلان المضبوطان إلا بنسبة 0.123% من متوسطهما. ولتخطيط السعة بصورة محافظة، نستخدم النتيجة الأدنى المرصودة وهي 299.260 عينة/ثانية. يتوفر قياس كامل واحد لخط الأساس وقياسان للإعداد المضبوط.

ما كشفه تحليل الأداء عن تجميع الدفعات في المحرك

ارتفع متوسط استخدام GPU من 94.417% إلى 97.373% و97.312% في التشغيلين المختارين. ومع نتائج الإنتاجية، يدعم ذلك تفسير استعادة السعة بتحسين وتيرة تجميع الدفعات. وهو استنتاج من بيانات الرصد، وليس ادعاءً بشأن تفاصيل داخلية غير موثقة للمحرك.

قيّمت ProsGrow المسار الكامل، واختارت إعداد محرك مدعومًا، وتحققت منه بتكرارات كاملة المدة وفحوص دقة منفصلة. وظلت الشيفرة العامة ونقطة التحقق ومجموعة البيانات وسلوك فك الترميز وبذور LoadGen وأداة التقييم ثابتة. واستُخدمت نقطة التحقق المصدرية نفسها بدقة FP16 وإضافة ضرب المصفوفات بدقة NVFP4 في مفكك الترميز، دون تفعيل أي تعديل أداء على الشيفرة المصدرية.

المفاضلة: إنتاجية أعلى مع زيادة طفيفة في القدرة أثناء النشاط

رفع أول تشغيل كامل بعد الضبط متوسط القدرة الإجمالية لوحدات GPU من 3,428 W إلى 3,508 W، بينما زادت الإنتاجية بنسبة 2.69%. وانخفض استهلاك GPU وحدها لكل 1,000 ساعة صوت مصدر انخفاضًا طفيفًا، من 0.4885 إلى 0.4868 kWh. لم تتطلب زيادة السعة تراجعًا في كفاءة الطاقة المقاسة، لكن الفرق في الطاقة صغير.

ظلت الجودة شرط قبول صريحًا. شمل تشغيل AccuracyOnly للإعداد المضبوط جميع العينات البالغ عددها 1,633، وحقق معدل خطأ كلمات يبلغ 2.131770% باستخدام أداة تقييم MLCommons، دون الحد المسموح البالغ 3.046429%. يثبت ذلك النجاح على المتن المقيّم؛ ولم يخضع خط الأساس المحلي لاختبار دقة منفصل في هذه المقارنة.

السياق الخارجي: إنتاجية مماثلة بوحدات GPU أقل

المقارنة العامة الرئيسية لـ Whisper في التقرير هي نتيجة HPE البالغة 294.821 عينة/ثانية على ثماني وحدات GPU. ويعني متوسطنا البالغ 299.444 عينة/ثانية إنتاجية عقدة أعلى بنسبة 1.57%. يستخدم كلا النظامين ثماني وحدات RTX PRO 6000 GPU، مع اختلاف تفاصيل المضيف والبرمجيات.

تتضمن لقطة MLPerf v6.0 العامة التي جرى تدقيقها نتيجة HPE البالغة 297.661 عينة/ثانية على عشر وحدات GPU. كان متوسطنا المحلي على ثماني وحدات أعلى بنسبة 0.60% مع عدد مسرّعات أقل بنسبة 20%. وبالقسمة على عدد الوحدات نحصل على 37.431 مقابل 29.766 عينة/ثانية/GPU، بفارق 25.75%.

يوفر ذلك سياقًا مفيدًا لكفاءة النظام. أما التحسن الهندسي المعزول على عقدتنا فهو زيادة 2.63% الناتجة عن اختيار إعداد المحرك. وتشمل المقارنة الخارجية أيضًا اختلافات المضيف والحزمة البرمجية، لذا لا يمكن نسبة كامل التفوق لكل GPU إلى هذا التغيير وحده.

ماذا يتغير لخدمة التفريغ النصي

على المتن المقيّم، يعادل متوسط التشغيلين نحو 7,202 ساعة من الصوت المصدر لكل ساعة فعلية، مقابل 7,017 عند خط الأساس. أي معالجة نحو 185 ساعة إضافية من الصوت المصدر لكل ساعة نشاط للعقدة، استنادًا إلى متوسط مدة المقاطع في الاختبار. ويمكن لخدمة ذات تراكم أرشيفي مستمر استخدام هذا التحسن لتقصير فترات المعالجة على وحدات GPU المثبتة نفسها.

ستقيّم ProsGrow تفريغ الأرشيف وفق الإنتاجية وجودة التفريغ وعمر الطلبات في الطابور وحدود البيانات. أما التفريغ المباشر فيحتاج متطلبات خدمة خاصة به: الاتصالات المتزامنة وسلوك النتائج الجزئية وزمن إخراج النتيجة النهائية والتعافي. ولا يحدد معدل عينات Offline سعة البث المباشر.

تكلفة معالجة الكلام عند طلب مدفوع بنسبة 10%

يقدّر تقرير القدرات بتاريخ 15 سبتمبر تكلفة $0.0001321 لكل دقيقة صوتية مباعة باستخدام عقدة بقيمة $100,000، وإهلاك على ثلاث سنوات، وكفاءة تحويل من الاختبار إلى الخدمة بنسبة 70%، وطلب مدفوع بنسبة 10%. ومدخلات أسعار API المؤرخة فيه هي whisper-1 المستضاف من OpenAI بسعر $0.006/دقيقة وDeepgram Nova-3 أحادي اللغة للصوت المسجل مسبقًا بنظام PAYG بسعر $0.0043/دقيقة. وتقل تكلفة البنية التحتية المقدرة بنسبة 97.80% و96.93% على الترتيب.

يحوّل الحساب السعة المقاسة إلى نحو 30,247.5 دقيقة صوتية مباعة لكل ساعة تقويمية، ثم يقسم تكلفة البنية التحتية الساعية البالغة نحو $3.995 على تلك السعة. وتشمل التكلفة إهلاك العتاد بقيمة $100,000 ÷ (3 × 8,760 ساعة) وكهرباء بسعر $0.10/kWh، مع قدرة مفترضة للعقدة كاملة تبلغ 1.5 kW في الخمول و5.5 kW أثناء النشاط، مرجّحة بطلب بنسبة 10%. كفاءة الخدمة والطلب المدفوع افتراضان منفصلان.

مع تثبيت التكلفة الساعية وسائر الافتراضات، فإن زيادة الإنتاجية المقاسة بنسبة 2.63% وحدها تخفض تكلفة الوحدة بنحو 2.56%. أما الفجوة الأكبر مع أسعار API فتأتي من النموذج الاقتصادي لسعة المعالجة الخاصة بالدفعات وتعتمد بشدة على الطلب.

هذه مقارنة بين تكلفة البنية التحتية والسعر، وليست وفورات مثبتة للعميل. وهي تستثني الصيانة والتبريد/PUE والعمالة والشبكات والتخزين والدعم والتكرار الاحتياطي واحتياطي SLA. وتختلف النماذج وميزات الخدمة بين Whisper Large v3 المحلي وwhisper-1 المستضاف وNova-3؛ ولم يُثبت تكافؤ جودة الخدمة.

واجهة Granite API والكلام المباشر

يقيس التقرير أيضًا خدمة Granite API مستقلة ذات طابور. رفع توزيع العمل على المضيف وتجميع الطلبات الإنتاجية من 19,062.88 إلى 28,368.99 RTFx، أي زيادة بنسبة 48.82% مقارنة بخط أساس API المحلي الأصلي. ويعني RTFx عدد ثواني الصوت المعالجة لكل ثانية فعلية. قيّمت واجهة الدفعات 62,880 ملفوظًا، دون أي مخرجات متدهورة، وبأسوأ معدل WER بلغ 3.4942%.

تبلغ نتيجة Granite المنفصلة في وضع Offline غير المتزامن 68,932.91 RTFx. وحافظ اختبار ASR المباشر في التقرير على 5,568 اتصال WebSocket في ثلاثة اختبارات اتصال حلقي محلي على المضيف نفسه، مدة كل منها 24 ثانية. تستخدم هذه الاختبارات نماذج وحدود تقييم وتوقيت مختلفة. وتشغل كل نتيجة رئيسية العقدة في اختبار مستقل؛ وما زالت حركة الشبكة الخارجية والتشغيل المباشر طويل الأمد والتعافي بحاجة إلى التحقق.

المنهجية والقيود

  • النظام والحزمة البرمجية: استخدمت اختبارات 20–21 أغسطس 2026 ثماني وحدات NVIDIA RTX PRO 6000 Blackwell Server Edition GPU ومعالجَي AMD EPYC 9575F، مع TensorRT 10.14.1.48 وTensorRT-LLM 1.3.0rc0 وCUDA 13.1. وثُبّتت الشيفرة المرجعية العامة وقيم تجزئة النموذج والبيانات وجرى التحقق منها.
  • عبء العمل والوحدات: تعيد مواصفات بيانات MLPerf Whisper تجميع LibriSpeech في 1,633 عينة صوتية أحادية القناة بتردد 16 kHz. تتطلب كل عينة حسابات Whisper على مدة محشوة إلى 30 ثانية، بينما يبلغ متوسط مدة المصدر الفعلية 24.0505 ثانية. العينات الصوتية/ثانية والرموز المولدة/ثانية وساعات الصوت المصدر وحدات مختلفة.
  • صلاحية الأداء: استوفى خط الأساس وكلا التشغيلين الرئيسيين المضبوطين الحد الأدنى البالغ 10 دقائق وحصلا على حالة LoadGen VALID. استُخدمت تشغيلات تشخيصية قصيرة لاختيار المرشحين، ولم تُخلط مع النتائج الرئيسية كاملة المدة. ويغطي نطاق 0.123% تكرارين مضبوطين، ولا يمثل فاصل ثقة.
  • الدقة والامتثال: هذه قياسات محلية مشتقة من MLPerf وليست تقديمات رسمية إلى MLPerf أو نتائج راجعتها MLCommons. اجتاز التحقق من الأداء TEST01. كشفت المقارنة المباشرة للمخرجات عن اختلافات؛ وسجّل المسار البديل المسموح معدل WER متطابقًا قدره 2.168070% لمخرجات الأساس والتدقيق، فاستوفى الفحص. كان ذلك استيفاءً عبر المسار البديل، وليس نجاحًا في المطابقة بايتًا ببايت. ويبقى WER لاختبار AccuracyOnly الكامل 2.131770%.
  • نطاق الإنتاج: تشمل أرقام القدرة وحدات GPU فقط، وتستثني المضيف والتبريد. تستند تحويلات ساعات الصوت إلى هذا المتن وتفترض وجود طابور مستمر. وتحتاج لهجات العملاء ولغاتهم والضوضاء وتداخل الكلام والمفردات والتخزين والشبكات وإعادة المحاولة والاستخدام وزمن الاستجابة إلى قياسات مستقلة.

تحويل الكلام إلى نص بشكل خاص والتفريغ غير المباشر باستخدام Whisper

في تفريغ الصوت الخاص، يساعد اختبار Whisper هذا على تقدير القدرة اللازمة لمعالجة أرشيف ضمن موعد محدد. يجب تقييم إنتاجية تحويل الكلام إلى نص ومعدل خطأ الكلمات (WER) معًا على تسجيلات ممثلة. لا تثبت قدرة الاختبار غير المباشر عدد التدفقات الحية التي يمكن للخدمة دعمها أو سرعة وصول النصوص الجزئية.

استعد السعة في مسار معالجة الكلام الخاص بك

يمكن لـ ProsGrow اختبار عبء عملك الصوتي، وعزل المرحلة التي تحد الأداء، والتحقق من إعداد النشر وفق أهداف الإنتاجية وجودة التفريغ وزمن الاستجابة.

تحدث مع ProsGrow AI