결과: 대기 시간 30% 이상 단축
문서나 코딩 요청을 처리하는 어시스턴트에게 생성 시작 전 대기 시간도 사용자 경험의 일부입니다. 실제 서빙 테스트에서 ProsGrow는 약 8,000토큰 프롬프트의 대기 시간을 0.564초에서 0.384초로 줄였습니다. 이는 첫 토큰 도달 시간(TTFT) 32.0% 감소에 해당합니다.
동일한 8 × AMD MI325X 호스트에서 DeepSeek V4.1 Flash를 사용해 모델 리비전과 런타임 버전이 같은 로컬 기준 구성과 비교했습니다. 콜드 요청에는 접두사 캐시 적중이 없었습니다. 테스트한 세 가지 프롬프트 길이 모두에서 개선이 나타났습니다.
| 입력 길이 | 로컬 기준 | ProsGrow 최적화 후 | 지연 시간 감소율 |
|---|---|---|---|
| 약 8K 토큰 | 0.564초 | 0.384초 | 32.0% |
| 약 60K 토큰 | 3.931초 | 2.813초 | 28.4% |
| 약 300K 토큰 | 27.532초 | 21.872초 | 20.6% |
가장 긴 테스트 프롬프트에서는 첫 콘텐츠가 도착하기까지의 대기 시간이 약 5.66초 단축됩니다. 제목의 수치는 첫 토큰 지연 시간을 뜻하며, 전체 요청 처리량은 아래에서 별도로 측정합니다.
성능 개선이 나온 지점
서빙 스택이 AMD 하드웨어에서 모델을 실행하는 방식, 특히 생성 전에 입력 프롬프트를 처리하는 데 필요한 작업에 집중했습니다. 프로파일링과 목표를 정한 런타임 최적화를 통해 기존 배포 환경의 성능을 더 끌어냈습니다.
이 결과는 DeepSeek 모델과 업스트림 vLLM 및 AMD AITER 런타임의 기능을 기반으로 합니다. 원래 체크포인트 정밀도를 유지하고, 추측 생성에서도 실제 대상 모델 검증을 유지했습니다. 손실을 수반하는 양자화를 추가로 도입하지 않았습니다.
프라이빗 AI 인프라를 운영하는 팀에게는 하드웨어를 늘리기 전에 서빙 병목을 측정할 기회가 있다는 뜻입니다. 적합한 최적화는 모델, 프롬프트 길이, 애플리케이션의 응답 시간 요구 사항에 따라 달라집니다.
처리량 및 품질 검증
배포 후 반복되는 캐시된 프롬프트로 별도 점검한 결과, 세 가지 프롬프트 길이에서 전체 요청 출력 처리량이 7.7–10.2% 증가했습니다. 이 지표에는 첫 토큰을 기다리는 시간과 전체 응답을 받는 시간이 포함됩니다. 캐시 사용 시 첫 토큰 지연 시간은 2.4–3.2% 소폭 증가했으므로, 이점은 워크로드에 어떤 지표가 중요한지에 따라 달라집니다.
최적화 구성을 채택하기 전에 동일한 수학 문제 128개를 짧은 프롬프트와 긴 프롬프트 조건에서 비교했습니다. 두 조건 모두 기준 구성에서 맞았던 답이 오답으로 바뀐 경우는 없었으며, 배포 후 기능 점검 6개도 모두 통과했습니다. 이 제한된 검증은 변경을 뒷받침하지만, 더 광범위한 코딩·다국어·고객 작업 품질은 별도로 평가해야 합니다.
InferenceX 참조 결과와 ProsGrow 비교
별도로 진행한 1시간 AgentX 벤치마크에서 최적화된 배포 환경은 상호작용성 중앙값 261.780토큰/초/사용자를 기록했습니다. 저장된 InferenceX MI325X 참조값 239.808보다 9.16% 증가한 수치입니다. GPU당 출력 처리량은 15.83257에서 16.55379토큰/초로 4.56% 증가했습니다.
이 실행들은 벤치마크의 합성 추측 수락 길이 3.51을 사용합니다. 이는 성능 테스트 설정으로, 서빙 및 품질 테스트에 사용한 실제 검증과는 별개입니다. 차트의 개선율도 콜드 첫 토큰 지연 시간 32% 감소와는 별도로 측정한 결과입니다.
상호작용성 중앙값은 토큰 간 지연 시간 중앙값의 역수이며, 대시보드의 반올림 규칙을 적용합니다. 처리량에는 요청 트레이스의 유휴 시간이 포함됩니다. 과거 참조 결과는 체크포인트와 런타임 이미지를 완전히 식별하지 않으므로, 이번 비교는 부분 재현에 기반한 참조 비교입니다. 공개 실행과 최적화 실행은 프로파일링된 요청을 각각 244개, 252개 완료했으므로 완료된 요청 구성이 다릅니다. 구성별 실행은 1회이며 신뢰구간은 없습니다. 여기에 제시한 ProsGrow 측정값은 로컬 결과입니다.
측정 범위
테스트는 2026년 9월 24일에 진행했으며, 모델은 GPU 8개 전체에 분산했습니다. 실제 서빙 요청마다 출력 토큰을 정확히 1,024개 생성했습니다. TTFT는 요청 시작부터 비어 있지 않은 첫 스트리밍 콘텐츠까지의 시간을 측정합니다. 대응하는 프롬프트와 출력 길이를 통제했고, 콜드 요청의 접두사 캐시 적중 수가 0인지 확인했습니다.
각 콜드 구성에서 프롬프트 길이별로 워밍업 1회 후 요청 4개를 측정했습니다. 실행은 순차적으로 이루어졌고 컴파일 및 캐시 이력은 달랐습니다. 이는 재현한 기준 구성과 비교한 로컬 측정이며, 결과는 트래픽·동시 실행 수·프롬프트 구성에 따라 달라집니다. 32%는 테스트한 세 길이에서 관측된 최대 감소율로, 신뢰구간이나 프로덕션 SLA를 의미하지 않습니다.
프라이빗 DeepSeek 호스팅과 AMD GPU 컴퓨팅
프라이빗 DeepSeek 호스팅이나 전용 AMD GPU 서버를 검토하는 팀에게 이 벤치마크는 배포 계획을 모델 정밀도, 프롬프트 길이, 응답 시간과 연결해 줍니다. 첫 토큰 도달 시간(TTFT)은 답변이 시작되는 시점을 측정하며, 전체 요청 처리량은 경험의 다른 측면을 측정합니다. ProsGrow는 고객의 프라이빗 추론 워크로드에서 이러한 절충점을 평가할 수 있습니다.
배포 환경의 개선 가능성 살펴보기
DeepSeek를 실행하거나 프라이빗 AI 배포를 계획 중이신가요? 결과, 최적화 접근 방식, 고객 모델과 워크로드를 활용한 평가에 대해 저희와 상담하세요. 인프라에서 개선 여지가 있는 지점을 찾도록 도와드립니다.
AMD GPU 컴퓨팅 자원, 전용 GPU 서버 또는 프라이빗 추론 인프라가 필요하다면 요구 사항을 상담해 주세요.
저희와 통화 예약이메일이 편하신가요? contact@prosgrow.ai