El resultado: más de un 30% menos de espera
Para un asistente que procesa un documento o una solicitud de programación, la espera antes de que comience la generación forma parte de la experiencia de usuario. En nuestras pruebas de servicio real, ProsGrow redujo esa espera de 0.564 a 0.384 segundos para un prompt de aproximadamente 8,000 tokens: una reducción del 32.0% en el tiempo hasta el primer token (TTFT).
La comparación utilizó DeepSeek V4.1 Flash en el mismo servidor con 8 × AMD MI325X, frente a nuestra referencia local con la misma revisión del modelo y las mismas versiones del entorno de ejecución. Las solicitudes en frío no tuvieron aciertos en la caché de prefijos. Hubo mejoras en las tres longitudes de prompt probadas.
| Longitud de entrada | Referencia local | Optimización de ProsGrow | Reducción de latencia |
|---|---|---|---|
| ~8K tokens | 0.564 s | 0.384 s | 32.0% |
| ~60K tokens | 3.931 s | 2.813 s | 28.4% |
| ~300K tokens | 27.532 s | 21.872 s | 20.6% |
Para el prompt más largo probado, eso supone unos 5.66 segundos menos de espera antes de recibir el primer contenido. El titular describe la latencia hasta el primer token; el rendimiento de la solicitud completa se mide por separado a continuación.
De dónde vino la mejora
Nos centramos en cómo la pila de servicio ejecuta el modelo en hardware AMD, especialmente en el trabajo necesario para procesar un prompt entrante antes de iniciar la generación. El análisis de rendimiento y la optimización dirigida del entorno de ejecución recuperaron rendimiento del despliegue existente.
El resultado se apoya en el modelo de DeepSeek y en las capacidades originales de los entornos vLLM y AMD AITER. Conservamos la precisión original del checkpoint y la verificación real del modelo objetivo para la generación especulativa. No se introdujo cuantización adicional con pérdida.
Para los equipos que operan infraestructura privada de IA, esto señala una oportunidad: medir el cuello de botella del servicio antes de ampliar el hardware. La optimización adecuada depende del modelo, de la longitud de los prompts y de los requisitos de tiempo de respuesta de la aplicación.
Comprobaciones de rendimiento y calidad
Una comprobación independiente tras el despliegue con prompts repetidos y en caché mostró un rendimiento de salida de la solicitud completa entre un 7.7% y un 10.2% mayor en las tres longitudes. Esta medida incluye la espera hasta el primer token y el tiempo para recibir la respuesta completa. La latencia hasta el primer token con caché aumentó ligeramente, entre un 2.4% y un 3.2%, por lo que el beneficio depende de la métrica relevante para la carga.
Antes de adoptar la optimización, comparamos las mismas 128 preguntas matemáticas con prompts cortos y largos. Ninguna respuesta correcta de la referencia pasó a ser incorrecta en ninguna de las dos condiciones, y se superaron las seis comprobaciones funcionales posteriores al despliegue. Estas comprobaciones acotadas respaldan el cambio; la calidad en programación más amplia, en varios idiomas y en tareas de clientes aún requiere evaluaciones propias.
Referencia de InferenceX frente a ProsGrow
En una prueba independiente de AgentX de una hora, nuestro despliegue optimizado logró 261.780 tokens/s/usuario de interactividad mediana, frente a 239.808 de la referencia guardada de InferenceX MI325X: un aumento del 9.16%. El rendimiento de salida por GPU pasó de 15.83257 a 16.55379 tokens/s, un aumento del 4.56%.
Estas ejecuciones utilizan la longitud de aceptación especulativa sintética de 3.51 del benchmark. Es un ajuste de prueba de rendimiento, independiente de la verificación real utilizada en nuestras pruebas de servicio y calidad. Las mejoras del gráfico son independientes de la reducción del 32% en la latencia en frío hasta el primer token.
La interactividad mediana es el inverso de la mediana de latencia entre tokens, aplicando el criterio de redondeo del panel. El rendimiento incluye el tiempo inactivo de la traza. La referencia histórica no identifica completamente su checkpoint y su imagen de ejecución; esta es una comparación de referencia con reproducción parcial. Las ejecuciones publicada y optimizada completaron 244 y 252 solicitudes perfiladas, respectivamente, por lo que sus mezclas de solicitudes completadas difieren. Hay una ejecución por configuración y no hay intervalo de confianza. Las mediciones de ProsGrow mostradas aquí son resultados locales.
Qué medimos
Las pruebas se realizaron el 24 de septiembre de 2026, con el modelo distribuido entre las ocho GPU. Cada solicitud de servicio real generó exactamente 1,024 tokens de salida. TTFT mide el tiempo desde el inicio de la solicitud hasta el primer contenido no vacío recibido por streaming. Se controlaron los prompts correspondientes y las longitudes de salida, y se verificó que las solicitudes en frío no tuvieran aciertos en la caché de prefijos.
Cada configuración en frío utilizó una solicitud de calentamiento y cuatro solicitudes medidas por longitud de prompt. Las ejecuciones fueron secuenciales, con diferentes historiales de compilación y caché. Son mediciones locales frente a nuestra referencia reproducida; los resultados variarán con el tráfico, la concurrencia y la mezcla de prompts. El 32% es la mayor reducción observada entre las tres longitudes probadas, sin implicar un intervalo de confianza ni un SLA de producción.
Alojamiento privado de DeepSeek y cómputo AMD GPU
Para los equipos que evalúan alojamiento privado de DeepSeek o servidores AMD GPU dedicados, este benchmark conecta la planificación del despliegue con la precisión del modelo, la longitud del prompt y el tiempo de respuesta. El tiempo hasta el primer token (TTFT) mide cuándo empieza una respuesta; el rendimiento de la solicitud completa mide otro aspecto de la experiencia. ProsGrow puede evaluar estos compromisos para su carga privada de inferencia.
Explore el potencial de su despliegue
¿Ejecuta DeepSeek o está planificando un despliegue privado de IA? Contacte con nosotros para hablar de los resultados, de nuestro enfoque de optimización y de una evaluación con su modelo y carga de trabajo. Podemos ayudarle a identificar dónde puede mejorar su infraestructura.
Para acceder a capacidad de cómputo AMD GPU, servidores GPU dedicados o infraestructura privada de inferencia, contacte con nosotros para comentar sus necesidades.
Reserve una llamada con nosotros¿Prefiere el correo? contact@prosgrow.ai