Notas de ingeniería · Reconocimiento de voz

Cómo ProsGrow alcanzó 7,200 horas de audio por hora con Whisper

El rendimiento de Whisper equivale a unas 7,200 horas de audio fuente por hora real en ocho GPU. ProsGrow pasó de 291.771 a 299.444 muestras/s, una mejora del 2.63%, con un resultado de precisión válido. La cifra horaria es una conversión de capacidad desde pruebas de 10 minutos.

· Actualizado · Ingeniería de ProsGrow AI · 7 min de lectura

Coste de infraestructura Whisper modelado un 97.80% inferior al precio API de OpenAI: $0.0001321 frente a $0.006 por minuto, con demanda de pago del 10%, nodo de $100K y eficiencia del 70%.

El problema: recuperar capacidad sin cambiar el modelo de voz

Un servicio de transcripción de archivos necesita procesar más audio cumpliendo una calidad definida. ProsGrow partió de la implementación pública de Whisper usada en MLPerf Inference v6.0 y reprodujo su perfil compatible en un nodo de ocho GPU RTX PRO 6000 Blackwell. La base de duración completa entregó 291.771 muestras de audio/s.

Analizamos el comportamiento por lotes del motor y vimos que el perfil público no era óptimo para este sistema. Un ajuste compatible logró 299.444 muestras/s en dos ejecuciones completas: 2.63% más rendimiento en las mismas ocho GPU. El perfil elegido también superó el umbral de precisión del benchmark.

Base → Ajuste de ProsGrow

Perfil público · Base local291.771 muestras de audio/s
Perfil elegido por ProsGrow · Media de dos ejecuciones299.444 muestras de audio/s · +2.63%
Pruebas locales Whisper Offline derivadas de MLPerf en el mismo nodo de ocho GPU, con una duración mínima de 10 minutos cada una. Las barras parten de cero.
Configuración localMuestras de audio/sMuestras/s/GPUMejora frente a la base local
Perfil público · Base291.77136.471—
Perfil elegido · Ejecución 1299.62837.4542.69%
Perfil elegido · Ejecución 2, mínimo observado299.26037.4082.57%
Perfil elegido · Media de dos ejecuciones299.44437.4312.63%

Las dos ejecuciones ajustadas difirieron solo un 0.123% de su media. Para planificar de forma conservadora usamos el menor resultado observado, 299.260 muestras/s. Hay una medición completa de la base y dos del perfil ajustado.

Qué reveló el análisis sobre los lotes del motor

La utilización media de GPU pasó de 94.417% a 97.373% y 97.312% en las dos ejecuciones elegidas. Junto con el rendimiento, esto respalda una mejor cadencia de lotes como explicación de la capacidad recuperada. Es una inferencia de la telemetría, no una afirmación sobre detalles internos no documentados.

ProsGrow evaluó toda la canalización, eligió un perfil compatible y lo validó con repeticiones completas y pruebas de precisión separadas. Se mantuvieron fijos código público, checkpoint, datos, decodificación, semillas LoadGen y evaluador. Se conservaron el checkpoint fuente FP16 y el plugin NVFP4 de multiplicación matricial del decodificador; no había parches de rendimiento activos en el código.

La contrapartida: más rendimiento con algo más de potencia activa

La primera ejecución completa ajustada elevó la potencia media agregada de GPU de 3,428 W a 3,508 W, mientras el rendimiento aumentó un 2.69%. La energía solo de GPU por 1,000 horas de audio fuente bajó ligeramente, de 0.4885 a 0.4868 kWh. La mejora de capacidad no redujo la eficiencia energética medida, aunque la diferencia es pequeña.

La calidad siguió siendo un requisito explícito. AccuracyOnly cubrió las 1,633 muestras y obtuvo una tasa de error de palabra del 2.131770% con el evaluador MLCommons, inferior al 3.046429% permitido. Es un resultado válido para ese corpus; la base local no tuvo una prueba de precisión separada en esta comparación.

Contexto externo: rendimiento comparable con menos GPU

La comparación pública principal de Whisper es el resultado de HPE con ocho GPU de 294.821 muestras/s. Nuestra media de 299.444 muestras/s supone un 1.57% más de rendimiento por nodo. Ambos usan ocho RTX PRO 6000, con diferencias en host y software.

La instantánea pública auditada de MLPerf v6.0 incluye un resultado de HPE con diez GPU de 297.661 muestras/s. Nuestra media local con ocho GPU fue un 0.60% mayor, con un 20% menos de aceleradores. Por GPU son 37.431 frente a 29.766 muestras/s/GPU, una diferencia del 25.75%.

Es un contexto útil de eficiencia del sistema. La mejora aislada en nuestro nodo es el 2.63% logrado al elegir el perfil del motor. La comparación externa también incluye diferencias de host y software; no puede atribuirse toda la ventaja por GPU a ese único cambio.

Qué cambia para un servicio de transcripción

En el corpus evaluado, la media equivale a unas 7,202 horas de audio fuente por hora real, frente a 7,017 de la base. Son unas 185 horas adicionales por hora de nodo activo, calculadas con la duración media de los clips. Un servicio con archivos pendientes de forma sostenida puede acortar sus ventanas de proceso con las mismas GPU instaladas.

ProsGrow evaluaría la transcripción de archivos según rendimiento, calidad, antigüedad de la cola y límites de datos. La transcripción en directo necesita su propio contrato: conexiones simultáneas, resultados parciales, latencia de finalización y recuperación. Una tasa Offline no determina la capacidad de streaming.

Coste de voz con un 10% de demanda de pago

El informe de capacidades del 15 de septiembre modela $0.0001321 por minuto de audio vendido con un nodo de $100,000, amortización a tres años, eficiencia de benchmark a servicio del 70% y demanda de pago del 10%. Sus precios de API fechados son whisper-1 alojado por OpenAI a $0.006/minuto y Deepgram Nova-3 monolingüe pregrabado PAYG a $0.0043/minuto. La cifra de infraestructura modelada es un 97.80% y un 96.93% menor, respectivamente.

El cálculo convierte la capacidad medida en unos 30,247.5 minutos vendidos por hora de calendario y divide unos $3.995 de coste horario entre esa capacidad. Incluye amortización de hardware de $100,000 ÷ (3 × 8,760 horas) y electricidad a $0.10/kWh, con potencia supuesta del nodo de 1.5 kW en reposo y 5.5 kW activo, ponderada por un 10% de demanda. Eficiencia del servicio y demanda de pago son supuestos separados.

Con coste horario y demás supuestos fijos, la mejora medida del 2.63% por sí sola reduce el coste unitario cerca del 2.56%. La diferencia mayor con los precios API procede de la economía modelada de la capacidad privada por lotes y depende mucho de la demanda.

Es una comparación de infraestructura con precio, no un ahorro probado para clientes. Excluye mantenimiento, refrigeración/PUE, personal, red, almacenamiento, soporte, redundancia y reserva SLA. Whisper Large v3 local, whisper-1 alojado y Nova-3 difieren en modelo y funciones; no se estableció calidad de servicio equivalente.

API Granite y voz en directo

El informe también mide un servicio API Granite independiente con cola. La ubicación en el host y los lotes de solicitudes elevaron el rendimiento de 19,062.88 a 28,368.99 RTFx, una mejora del 48.82% frente a su base API local original. RTFx son segundos de audio procesados por segundo real. La API por lotes evaluó 62,880 enunciados, sin salidas degeneradas y con un WER máximo del 3.4942%.

El resultado async Offline separado de Granite es 68,932.91 RTFx. La prueba ASR en directo mantuvo 5,568 conexiones WebSocket en tres ensayos de bucle local de 24 segundos en el mismo host. Cambian los modelos y límites de puntuación y tiempo. Cada cifra principal ocupa el nodo en una prueba independiente; faltan validar tráfico externo, operación prolongada y recuperación.

Metodología y limitaciones

  • Sistema y software: las pruebas del 20–21 de agosto de 2026 usaron ocho GPU NVIDIA RTX PRO 6000 Blackwell Server Edition y dos CPU AMD EPYC 9575F, TensorRT 10.14.1.48, TensorRT-LLM 1.3.0rc0 y CUDA 13.1. Se fijaron y comprobaron código de referencia y hashes de modelo y datos.
  • Carga y unidades: el contrato de datos de MLPerf Whisper reagrupa LibriSpeech en 1,633 muestras mono a 16 kHz. Cada una implica 30 segundos de cómputo Whisper con relleno; la duración real media es 24.0505 segundos. Muestras/s, tokens generados/s y horas de audio fuente son unidades distintas.
  • Validez: la base y ambas ejecuciones principales ajustadas cumplieron el mínimo de 10 minutos y fueron LoadGen VALID. Las pruebas diagnósticas breves eligieron candidatos y no se mezclan con los resultados completos. El rango del 0.123% cubre dos repeticiones, no un intervalo de confianza.
  • Precisión y cumplimiento: son mediciones locales derivadas de MLPerf, no envíos oficiales ni resultados revisados por MLCommons. TEST01 pasó. La comparación directa de salidas encontró discrepancias; la alternativa permitida puntuó base y auditoría con un WER idéntico de 2.168070% y satisfizo la comprobación. Fue una validación alternativa, no coincidencia byte a byte. El WER completo de AccuracyOnly sigue siendo 2.131770%.
  • Alcance productivo: la potencia solo cubre GPU, sin host ni refrigeración. La conversión de horas usa este corpus y supone una cola sostenida. Acentos, idiomas, ruido, solapamiento, vocabulario, almacenamiento, red, reintentos, utilización y latencia del cliente requieren sus propias mediciones.

Conversión privada de voz a texto y transcripción offline con Whisper

Para la transcripción privada de audio, este benchmark de Whisper ayuda a estimar la capacidad necesaria para procesar un archivo dentro de un plazo. El rendimiento de voz a texto y la tasa de error de palabras (WER) deben evaluarse juntos con grabaciones representativas. La capacidad del benchmark offline no establece cuántas transmisiones en directo puede admitir un servicio ni la rapidez con que llegan las transcripciones parciales.

Recupera capacidad en tu canalización privada de voz

ProsGrow puede probar tu carga de audio, aislar la etapa limitante y validar un perfil de despliegue según los objetivos de rendimiento, calidad de transcripción y latencia.

Hablar con ProsGrow AI