엔지니어링 · 영상 추론

ProsGrow가 MiniMax-H3 영상 추론 지연 시간을 54% 개선하는 방법

동일한 GPU 8개에서 같은 BF16 Turbo 요청을 처리할 때 MiniMax-H3 서버 추론은 19.392초에서 8.913초로 줄었습니다. 별도 연구에서는 Wan의 준비된 상태 지연 시간이 59.1% 줄고 Animate 처리량이 17.62% 증가했습니다.

· 수정 · ProsGrow AI 엔지니어링 · 읽는 시간 8분

MiniMax-H3 서버 추론: 동일한 GPU 8개에서 같은 BF16 Turbo 요청의 지연 시간이 19.392초에서 8.913초로 54% 감소.

작업마다 필요한 서비스 유형이 다릅니다

창작용 미리보기는 대기 시간이 짧아야 합니다. 모션 전이는 더 긴 출력에 원본의 동작을 유지해야 합니다. 고해상도 시청각 요청 하나가 여러 GPU를 동시에 점유할 수도 있습니다. 이 서비스를 최적화하려면 정밀도, 어텐션, 메모리 상주, 병렬화, 컴파일, 품질 전반의 결정이 필요합니다.

ProsGrow는 RTX PRO 6000 Blackwell GPU 8개를 탑재한 노드에서 이러한 서비스 유형을 평가했습니다. MiniMax-H3 비교에서는 동일한 GPU 8개와 같은 BF16 Turbo 요청으로 서버 추론을 19.392초에서 8.913초로 줄여 지연 시간을 54.0% 감소시켰습니다. 별도의 Wan·Animate 연구는 납기, 전체 수요, 품질 요구에 따라 유용한 구성이 달라짐을 보여 줍니다.

작업 조건을 정하고 병목을 분석한 뒤, 후보 운용 지점을 비교하고 선택한 결과를 검증했습니다. 각 연구는 실측 개선을 자원과 품질 제약에 연결합니다.

MiniMax-H3: 지연 시간, 메모리, 품질

MiniMax-H3는 대규모 시청각 작업을 PCIe 노드에 분산하는 비용을 드러냈습니다. 병렬 작업을 나누는 방식을 바꿔 동일한 GPU 8개에서 서버 추론을 19.392초에서 8.913초로 줄였습니다. 같은 BF16 Turbo 요청에서 지연 시간이 54.0% 감소한 것입니다.

텐서 병렬화와 시퀀스 병렬화는 통신 및 메모리 요구가 다릅니다. 통제된 측정은 이 작업에서 통신 오버헤드를 줄이는 방향을 뒷받침했지만, 커널 수준의 원인을 확정할 유효한 커널 추적은 없었습니다. 선택한 지연 시간 구성은 GPU당 약 84.2 GB를 사용했으며, 메모리 여유가 더 큰 구성은 지연 시간이 늘었습니다.

상위 프로젝트의 SGLang MiniMax-H3 스택이 모델 서빙과 병렬화 구성 요소를 제공합니다. ProsGrow의 기여는 이 하드웨어에서 동작을 평가하고 서비스 목표에 맞춰 선택한 것입니다.

별도의 근사 계산 실험에서는 중간 계산을 재사용해 서버 추론을 8.913초에서 7.092초로, 추가로 20.44% 줄였습니다. API 완료 시간은 10.045초에서 8.040초로 줄었고, 여전히 GPU 8개 모두를 한 요청에 할당했습니다. 디코딩 시간은 거의 변하지 않았습니다.

이 추가 개선에는 별도의 수용 조건이 있습니다. 근사 계산에는 품질 검증 기준이 필요합니다. 선택한 후보는 한 장면에 대한 제한된 수치 일관성 검사를 통과했습니다. 이는 후보 운용 지점의 근거이며, 폭넓은 지각적 동등성이나 모든 고객 작업에 대한 승인을 뜻하지 않습니다.

Wan2.2: 통제된 4단계 비교

기준 · 증류된 BF16, 밀집 어텐션, CPU 오프로딩22.164초
ProsGrow 구성 · 낮은 정밀도, 희소 어텐션, GPU 상주9.062초 · 59.1% 감소
RTX PRO 6000 Blackwell GPU 1개, 같은 프롬프트·시드·4단계 일정, 81프레임 832×480 출력입니다. 두 경로 모두 준비된 상태입니다. 정밀도, 어텐션, 메모리 배치를 함께 바꿉니다. 생성 구도는 다르며 지각적 동등성을 입증하지 않았습니다.
동일한 GPU, 프롬프트, 시드, 4단계 일정, 출력 형태
지표증류된 BF16 기준선택한 LightX2V 구성
준비된 파이프라인22.164 s9.062 s · 59.1% 감소
노이즈 제거19.164 s6.076 s
VAE 디코딩약 2.37 s약 2.36 s

선택한 경로는 낮은 정밀도, 희소 어텐션, GPU 상주를 결합합니다. 양자화를 고려한 단계 증류를 비롯한 이 기능은 상위 프로젝트의 LightWan2.2 모델과 LightX2V 런타임에서 제공합니다. ProsGrow는 실행 경로를 통합·검증하고 로컬 대조 조건을 설정해 서비스의 절충점을 측정했습니다.

표준 40단계 BF16 실행은 357.640초가 걸렸습니다. 그 기준과의 차이 상당 부분은 상위 프로젝트의 단계 증류에서 나옵니다. 4단계 BF16 대조 실험은 증류 이득과 별개로 런타임 변경의 복합 효과인 추가 2.45× 개선을 측정합니다.

정밀도, 어텐션, 상주는 서로 영향을 줍니다

개선 기회는 실행 경로의 여러 계층에 걸쳐 있었습니다.

  • 정밀도와 어텐션: 작은 수치 표현과 희소 어텐션으로 노이즈 제거 작업을 줄였습니다. 복합 이득은 모델과 지원 실행 경로에 따라 달라지며, 형식 변경만으로 더 빠른 서빙을 보장하지 않습니다.
  • GPU 상주: 작아진 전문가 가중치를 GPU 메모리에 계속 둘 수 있어 핵심 경로에서 호스트-디바이스 전송을 없앴습니다. 메모리 절약은 필요한 연산량뿐 아니라 계산을 실행할 위치도 바꿨습니다.
  • 파이프라인 균형: 디코딩은 약 2.36초를 유지했습니다. 노이즈 제거가 빨라지자 거의 변하지 않은 이 단계가 요청에서 차지하는 비중이 커져, 노이즈 제거기를 더 개선해 얻을 수 있는 효과를 제한했습니다.
  • 준비된 서비스와 콜드 서비스: 최적화된 독립 프로세스는 모델 로딩, 준비 실행, 종료를 포함해 72.12초가 걸렸습니다. 따라서 짧은 준비 상태 추론 결과는 시작 작업과 상주를 관리하는 서비스에 의존합니다.

통제된 결과는 이러한 변경을 함께 측정합니다. 각 계층에 독립적인 인과적 속도 개선을 부여하지 않습니다. 그래서 최적화에는 단계별 시간과 전체 전달 범위가 모두 필요합니다.

동기화된 노드 실행에서 GPU들의 준비 상태 지연 시간은 비슷했습니다. 가장 느린 완료 시간을 환산하면 이 미리보기 조건에서 시간당 약 3,138클립입니다. 한 번의 실측을 처리 능력으로 환산한 값이지 1시간 지속 API 시험이 아닙니다. 품질도 제약입니다. 생성 구도가 달랐고 지각적 동등성은 입증되지 않았습니다.

Animate-2: 비동기 서비스를 위한 처리량

Animate-2는 참조 이미지와 원본 영상으로 11.21초짜리 모션 전이 영상을 만듭니다. 긴 작업은 비동기 큐에 적합하며, 대화형 미리보기 기한보다 완료 출력 수와 작업당 에너지가 더 중요합니다.

ProsGrow는 검증된 FP8 실행 경로와 영속 컴파일 캐시를 결합했습니다. 컴파일된 코드를 재사용해 반복 시작 작업을 줄였고, 정밀도는 정상 실행 비용을 바꿨습니다. 두 효과 모두 이 서비스의 전체 시작 측정 범위에서 측정했습니다.

조건을 맞춘 노드 작업, 선택 결과는 컴파일 캐시가 채워진 상태
지표BF16 기준FP8 + 컴파일 캐시
노드 출력 속도24.382개/시간28.678개/시간 · +17.62%
전체 노드 평균 전력6.581 kW6.575 kW
출력당 에너지0.270 kWh0.229 kWh

서버 전력은 거의 같고 처리량이 늘어 출력당 에너지가 약 15.1% 줄었습니다. 선택한 구성의 GPU 메모리 여유는 약 4 GiB뿐이어서 출력 형태와 동시 작업이 중요한 배포 제약이 됩니다.

컴파일 캐시 역시 운영 산출물입니다. 하드웨어, 런타임, 모델 형태, 컴파일 설정이 바뀌면 버전 관리하거나 다시 만들어야 합니다. 유용한 결과에는 처리량과 시각적 회귀 검사 외에 이 수명주기 결정도 포함됩니다.

고객에 맞는 운용 지점을 선택하세요

전체 노드를 쓰면 한 요청을 단축할 수 있습니다. 용량을 작은 복제본으로 나누면 독립 작업의 총 완료 수를 늘릴 수 있습니다. 상위 프로젝트의 모델 가지치기와 Turbo 어댑터를 사용한 별도 MiniMax 연구는 동기화된 한 번의 실행에서 시간당 478.14클립을 산출했고, 각 요청은 약 30.1초가 걸렸습니다. 모델과 서비스 형태가 달라져 별도의 품질 평가가 필요합니다.

서비스 유형별 최적화 대상
서비스 유형주요 목표유지해야 할 제약
대화형 미리보기짧은 요청 완료 시간준비된 상주 상태, 대기열, 허용 가능한 시각적 변화
전체 생성량노드당 수용된 클립 수복제본 메모리, 요청별 대기, 품질
비동기 모션 전이완료 작업 수와 출력당 에너지컴파일 수명주기, 메모리 여유, 원본 충실도

모든 목표에 통하는 단 하나의 최적 설정은 없습니다. 유용한 결과는 지연 시간, 처리량, 메모리, 에너지, 품질 간에 측정된 선택지입니다. 이 연구들은 서비스 유형 선택에 필요한 근거를 제공합니다. 이후 고객 파일럿에서 대표 미디어로 수용 출력, 대기열, 납기를 검증해야 합니다.

방법 및 한계

세 연구의 요청 조건
연구출력 조건측정 범위
Wan2.2 / LightWan2.281프레임, 832×480, 16 FPS, 5.0625 s; 프롬프트와 시드 통제LightX2V; 준비된 동기화 파이프라인에서 인코딩/저장까지, 모델 로딩과 준비 실행 제외
Wan2.2 Animate-2 14B269프레임, 713×1264, 24 FPS, 11.2083 s, 원본 오디오; 같은 참조 미디어와 4구간 × 10단계LightX2V; 전체 시작 실제 경과 시간, 선택 결과는 컴파일 캐시가 채워진 상태
MiniMax-H3 FL2VA Turbo1344×768, 124프레임, 24 FPS, 5.175 s 파일, 생성 오디오; 같은 프롬프트와 시드, 관측된 노이즈 제거기 평가 4회SGLang; 서버 추론과 전체 API 완료를 별도로 측정
  • 하드웨어와 반복: GPU당 명목 메모리 96 GB인 RTX PRO 6000 Blackwell GPU 8개 노드 하나입니다. Wan은 작업자당 준비된 생성 1회를 기록했습니다. Animate의 선택 속도는 노드 실행 2회 중 느린 값입니다. 각 H3 지연 시간 후보는 준비 실행 1회와 측정 요청 1회이며, 복제본 속도는 동시 실행 한 번에서 나옵니다. 이 짧은 연구는 지속 부하 SLA나 지연 시간 백분위수를 확정하지 않습니다.
  • Wan 품질: 콘택트 시트 검토에서 일관된 클립을 확인했지만, 시험한 단일 장면에서는 표준 40단계 기준이 프롬프트의 문자적 내용을 더 충실하게 따랐습니다. 증류, 희소화, 정밀도 변경은 지각적 동등성을 입증하지 않습니다.
  • Animate 품질: 269프레임 모두를 BF16과 비교해 SSIM 0.9534, PSNR 31.74 dB를 얻었습니다. 하나의 입력에 대한 시각적 회귀 검사입니다.
  • H3 품질: 선택한 근사 구성은 기준 대비 SSIM 0.8128로, 로컬 병렬화 구성에서 관측한 하한 0.8102를 조금 웃돌았습니다. 이 수치 검사는 여러 프롬프트의 움직임, 프롬프트 충실도, 오디오 동기화, 사람의 선호도 검토를 대신하지 않습니다. 별도 가지치기 모델 처리량 연구는 원본 모델 기준 대비 SSIM 0.8815를 기록했습니다.
  • 기여와 시간: 상위 모델과 런타임이 최적화 구성 요소를 제공합니다. 복합 변경은 각 요소의 효과를 분리하지 않습니다. H3 서버 추론은 클라이언트 폴링과 다운로드를 제외합니다. 서버 결과 8.913초와 API 결과 10.045초는 비교할 때 구분해야 합니다.

Wan 측정은 2026년 8월 12~18일, MiniMax 후속 측정은 9월 1~2일에 수집했습니다. 결과는 명시된 미디어 및 출력 조건에 적용됩니다.

프라이빗 MiniMax-H3 및 Wan 영상 생성

MiniMax-H3 또는 Wan2.2를 사용하는 프라이빗 영상 생성에서 첫 배포 질문은 서비스가 빠른 미리보기를 우선하는지, 일정 시간 내 완료된 작업 수를 우선하는지입니다. 서버 추론 지연 시간, 전체 API 완료, 생성 처리량은 서로 다른 측정 범위를 설명합니다. 고객 평가에서는 출력 형상, 원본 미디어, 허용 가능한 시각적 변화를 각 결과와 함께 고려해야 합니다.

작업에 필요한 영상 서비스를 정의하세요

원본 미디어, 출력 형태, 품질 요구, 전달 목표를 알려 주세요. 기준을 세우고 해당 서비스의 처리 능력이나 지연 시간을 바꾸는 운용 지점을 비교하겠습니다.

파일럿 상담