Notas de ingeniería · DeepSeek en AMD

Cómo ProsGrow redujo hasta un 32% la latencia hasta el primer token de DeepSeek v4 Flash

Menos espera antes de la primera respuesta. ProsGrow redujo hasta un 32.0% el tiempo en frío hasta el primer token de DeepSeek V4.1 Flash en las mismas ocho GPU AMD MI325X, manteniendo la precisión original del checkpoint del modelo.

· Ingeniería de ProsGrow AI · 4 min de lectura

Latencia en frío hasta el primer token de DeepSeek: de 0.564 a 0.384 segundos con aproximadamente 8K tokens de entrada, una reducción del 32% en las mismas ocho GPU AMD MI325X.

El resultado: más de un 30% menos de espera

Para un asistente que procesa un documento o una solicitud de programación, la espera antes de que comience la generación forma parte de la experiencia de usuario. En nuestras pruebas de servicio real, ProsGrow redujo esa espera de 0.564 a 0.384 segundos para un prompt de aproximadamente 8,000 tokens: una reducción del 32.0% en el tiempo hasta el primer token (TTFT).

La comparación utilizó DeepSeek V4.1 Flash en el mismo servidor con 8 × AMD MI325X, frente a nuestra referencia local con la misma revisión del modelo y las mismas versiones del entorno de ejecución. Las solicitudes en frío no tuvieron aciertos en la caché de prefijos. Hubo mejoras en las tres longitudes de prompt probadas.

Mediana del tiempo en frío hasta el primer token · servicio real · cuanto menor, mejor
Longitud de entradaReferencia localOptimización de ProsGrowReducción de latencia
~8K tokens0.564 s0.384 s32.0%
~60K tokens3.931 s2.813 s28.4%
~300K tokens27.532 s21.872 s20.6%

Para el prompt más largo probado, eso supone unos 5.66 segundos menos de espera antes de recibir el primer contenido. El titular describe la latencia hasta el primer token; el rendimiento de la solicitud completa se mide por separado a continuación.

De dónde vino la mejora

Nos centramos en cómo la pila de servicio ejecuta el modelo en hardware AMD, especialmente en el trabajo necesario para procesar un prompt entrante antes de iniciar la generación. El análisis de rendimiento y la optimización dirigida del entorno de ejecución recuperaron rendimiento del despliegue existente.

El resultado se apoya en el modelo de DeepSeek y en las capacidades originales de los entornos vLLM y AMD AITER. Conservamos la precisión original del checkpoint y la verificación real del modelo objetivo para la generación especulativa. No se introdujo cuantización adicional con pérdida.

Para los equipos que operan infraestructura privada de IA, esto señala una oportunidad: medir el cuello de botella del servicio antes de ampliar el hardware. La optimización adecuada depende del modelo, de la longitud de los prompts y de los requisitos de tiempo de respuesta de la aplicación.

Comprobaciones de rendimiento y calidad

Una comprobación independiente tras el despliegue con prompts repetidos y en caché mostró un rendimiento de salida de la solicitud completa entre un 7.7% y un 10.2% mayor en las tres longitudes. Esta medida incluye la espera hasta el primer token y el tiempo para recibir la respuesta completa. La latencia hasta el primer token con caché aumentó ligeramente, entre un 2.4% y un 3.2%, por lo que el beneficio depende de la métrica relevante para la carga.

Antes de adoptar la optimización, comparamos las mismas 128 preguntas matemáticas con prompts cortos y largos. Ninguna respuesta correcta de la referencia pasó a ser incorrecta en ninguna de las dos condiciones, y se superaron las seis comprobaciones funcionales posteriores al despliegue. Estas comprobaciones acotadas respaldan el cambio; la calidad en programación más amplia, en varios idiomas y en tareas de clientes aún requiere evaluaciones propias.

Referencia de InferenceX frente a ProsGrow

En una prueba independiente de AgentX de una hora, nuestro despliegue optimizado logró 261.780 tokens/s/usuario de interactividad mediana, frente a 239.808 de la referencia guardada de InferenceX MI325X: un aumento del 9.16%. El rendimiento de salida por GPU pasó de 15.83257 a 16.55379 tokens/s, un aumento del 4.56%.

Referencia de InferenceX frente a ProsGrow en ocho GPU AMD MI325X: interactividad mediana de 239.808 frente a 261.780 tokens/s/usuario, un 9.16% más; rendimiento de salida de 15.83257 frente a 16.55379 tokens/s/GPU, un 4.56% más. Ambos gráficos de barras comienzan en cero.
DeepSeek V4.1 Flash · AgentX de una hora · ocho GPU MI325X · paralelismo tensorial 8 · concurrencia 1. Referencia: InferenceX, fila 442872 del 22 de septiembre de 2026 (ejecución publicada). ProsGrow: medición local del 24 de septiembre de 2026. Seleccione la imagen para verla a tamaño completo.

Estas ejecuciones utilizan la longitud de aceptación especulativa sintética de 3.51 del benchmark. Es un ajuste de prueba de rendimiento, independiente de la verificación real utilizada en nuestras pruebas de servicio y calidad. Las mejoras del gráfico son independientes de la reducción del 32% en la latencia en frío hasta el primer token.

La interactividad mediana es el inverso de la mediana de latencia entre tokens, aplicando el criterio de redondeo del panel. El rendimiento incluye el tiempo inactivo de la traza. La referencia histórica no identifica completamente su checkpoint y su imagen de ejecución; esta es una comparación de referencia con reproducción parcial. Las ejecuciones publicada y optimizada completaron 244 y 252 solicitudes perfiladas, respectivamente, por lo que sus mezclas de solicitudes completadas difieren. Hay una ejecución por configuración y no hay intervalo de confianza. Las mediciones de ProsGrow mostradas aquí son resultados locales.

Qué medimos

Las pruebas se realizaron el 24 de septiembre de 2026, con el modelo distribuido entre las ocho GPU. Cada solicitud de servicio real generó exactamente 1,024 tokens de salida. TTFT mide el tiempo desde el inicio de la solicitud hasta el primer contenido no vacío recibido por streaming. Se controlaron los prompts correspondientes y las longitudes de salida, y se verificó que las solicitudes en frío no tuvieran aciertos en la caché de prefijos.

Cada configuración en frío utilizó una solicitud de calentamiento y cuatro solicitudes medidas por longitud de prompt. Las ejecuciones fueron secuenciales, con diferentes historiales de compilación y caché. Son mediciones locales frente a nuestra referencia reproducida; los resultados variarán con el tráfico, la concurrencia y la mezcla de prompts. El 32% es la mayor reducción observada entre las tres longitudes probadas, sin implicar un intervalo de confianza ni un SLA de producción.

Alojamiento privado de DeepSeek y cómputo AMD GPU

Para los equipos que evalúan alojamiento privado de DeepSeek o servidores AMD GPU dedicados, este benchmark conecta la planificación del despliegue con la precisión del modelo, la longitud del prompt y el tiempo de respuesta. El tiempo hasta el primer token (TTFT) mide cuándo empieza una respuesta; el rendimiento de la solicitud completa mide otro aspecto de la experiencia. ProsGrow puede evaluar estos compromisos para su carga privada de inferencia.

Explore el potencial de su despliegue

¿Ejecuta DeepSeek o está planificando un despliegue privado de IA? Contacte con nosotros para hablar de los resultados, de nuestro enfoque de optimización y de una evaluación con su modelo y carga de trabajo. Podemos ayudarle a identificar dónde puede mejorar su infraestructura.

Para acceder a capacidad de cómputo AMD GPU, servidores GPU dedicados o infraestructura privada de inferencia, contacte con nosotros para comentar sus necesidades.

Reserve una llamada con nosotros

¿Prefiere el correo? contact@prosgrow.ai