엔지니어링 노트 · 프라이빗 문서 AI

ProsGrow가 시간당 문서 질문 45,978건을 처리한 방법

ProsGrow는 드러나지 않던 작업량 불균형을 줄여 동일한 GPU 8개에서 문서 질의응답 처리량을 시간당 44,608건에서 45,978건으로 높였습니다. 이 수치는 DocVQA 전체 검증 실행에서 얻었으며, 성능과 함께 답변 품질도 평가했습니다.

· 수정 · ProsGrow AI 엔지니어링 · 읽는 시간 5분

문서 질의응답: 동일한 GPU 8개에서 시간당 44,608건에서 45,978건으로 3.07% 증가.

문제: 질문 수가 같아도 실제 작업량은 다를 수 있습니다

프라이빗 문서 서비스는 쌓인 작업을 정확하고 제시간에 끝내야 합니다. 모든 GPU에 같은 수의 질문을 배분하는 것은 합리적으로 보이지만, 한 작업자가 고해상도 페이지나 긴 멀티모달 프롬프트를 더 많이 받으면 가장 느린 작업자가 전체 배치의 완료 시점을 결정합니다.

ProsGrow는 이 숨은 불균형을 찾아 동일한 노드에서 프로파일 기반 배분을 평가했습니다. 처리량은 시간당 문서 질문 44,608건에서 45,978건으로 3.07% 증가했습니다. 요청 수가 균등해 보여도 멀티모달 서빙에서는 처리 능력이 남을 수 있음을 보여 줍니다.

기준 설정 → ProsGrow 최적화

두 실행 모두 동일한 GPU 8개에서 Qwen3.6-27B BF16과 vLLM 0.25.1을 사용했습니다. 각 요청은 페이지 이미지와 질문을 제공하고 짧은 답변을 요구했습니다. 전체 검증 작업에는 페이지 이미지 1,285개에 대한 질문 5,349건이 포함됐습니다.

기준 설정은 질문 수를 균등하게 배분했습니다. ProsGrow는 작업량 프로파일링으로 각 복제본에 할당되는 작업의 차이를 줄이면서, 같은 페이지의 반복 질문은 동일 복제본에 두는 지역성을 유지했습니다.

시간당 답변한 문서 질문 수

기준 설정: 질문 수 균등 배분44,608건/시간
ProsGrow: 프로파일 기반 배분45,978건/시간 · +3.07%
동일한 GPU 8개, BF16 모델, 전체 검증 세트 및 서빙 설정을 사용했습니다. 두 배분 방식 모두 한 페이지의 모든 질문을 같은 복제본에 둡니다. 막대는 0에서 시작하며, 개선은 작업 배분 방식에서 비롯됩니다.
지표질문 수 기준 균등 배분ProsGrow 프로파일 기반 배분
전체 노드 작업 완료 시간431.676 s418.821 s · 2.98% 단축
문서 질문 수/시간44,60845,978 · 3.07% 증가
복제본별 프롬프트 토큰 수 최댓값/최솟값1.0759×1.00017×
평균 ANLS0.964020.96531

모든 질문이 성공적으로 완료됐으며, 정확 일치율은 91.92%였습니다. 실측한 페이지당 질문 수 4.16265건으로 환산하면 시간당 페이지 이미지 11,045개에 해당합니다. 이 환산은 질문 밀도에 따라 달라집니다.

프로파일링으로 확인한 사실

동일한 질문 수 뒤에는 가장 무거운 프롬프트 작업과 가장 가벼운 작업 사이의 7.59% 차이가 숨어 있었습니다. 프로파일링으로 이를 드러냈고, 선택한 배분 방식은 차이를 0.017% 이내로 줄였습니다. 최종 공통 시간 구간 처리량은 독립 실행한 단일 GPU 속도의 8배 대비 98.61%에 도달했습니다.

여러 질문이 같은 페이지를 참조할 때는 작업을 균등화하면서 재사용도 유지해야 했습니다. 두 방식 모두 이 지역성을 유지했고, 최적화 실행의 멀티모달 프로세서 캐시 적중률은 준비 실행을 포함해 76.06%였습니다. 실측 이득은 이 서빙 기반 위에서 작업을 더 고르게 배분한 결과입니다.

프롬프트 양만으로 모든 느린 작업을 설명할 수는 없습니다. 페이지 형태, 배치 구성, 끝까지 남는 요청도 완료 시간에 영향을 줍니다. 유용했던 신호는 보편적인 스케줄링 규칙이 아니라, 명목상 균등한 요청 수와 실제 발생 작업량 사이의 차이였습니다.

절충점: 메모리 여유와 정밀도

큰 페이지 이미지는 메모리 여유를 성능 제약이자 정상 처리의 조건으로 만들었습니다. 선택한 서빙 구성은 전체 검증 세트를 수용하면서 프리필 활용률, 지연 시간, 가장 큰 페이지에 필요한 여유를 조정했습니다.

동일한 문서 작업 조건에서 더 작은 혼합 NVFP4 체크포인트도 시험했습니다. 디스크 사용량은 BF16의 51.75 GiB보다 작은 20.43 GiB였지만, 처리량은 시간당 44,970건으로 BF16보다 2.19% 낮았습니다. 평균 ANLS는 0.96531에서 0.96314로, 정확 일치율은 91.92%에서 91.14%로 내려갔습니다. 이 준비된 문서 서빙 구성에는 BF16을 유지했습니다.

양자화 경로에서도 이미지 전처리, 비전 인코더, 긴 멀티모달 프리필에 상당한 비용이 들었습니다. 시험한 런타임 정책에서는 가중치가 작아져도 최대 메모리 사용 시 여유가 개선되지 않았습니다. NVFP4는 질문당 전체 서버 에너지를 2.33% 줄였지만, 이 작업에서는 처리량과 품질 저하를 상쇄하지 못했습니다.

프라이빗 문서 서비스에 주는 의미

실측 속도에서 이 스케줄링 변경은 노드당 시간당 약 1,369건의 질문을 더 완료합니다. 동일 페이지에 대한 반복 질의가 있는 대기 작업에서 같은 GPU 8개로 더 많은 유효 작업을 처리한다는 뜻입니다. 운영 도입에는 대표 작업의 프로파일링이나 새 페이지용으로 검증된 비용 추정기가 필요합니다. 이 벤치마크는 동일한 고정 코퍼스에서 얻은 비용을 사용했습니다.

최적화 실행의 요청 지연 중앙값은 4.521초, p95는 9.411초였습니다. 자유 텍스트 질문의 ANLS는 0.93498로 전체 평균보다 낮았습니다. 파일럿에는 고객 페이지 구성에 맞는 품질 목표와 잘못된 답변의 비용에 적합한 검토 정책이 필요합니다.

실측 질문 처리량에서 비용 모델로

비용 모델은 시간당 인프라 비용을 실측한 시간당 11,045개 페이지 상당 처리 능력 중 판매된 부분으로 나눕니다. 이는 로컬 처리량 3.07% 개선 비교와 별개의 분석입니다.

1,000개 페이지 상당당 추정 인프라 비용
노드 구매 비용전체 유료 사용유료 수요 10%
$100,000$0.49$4.21
$150,000$0.69$6.22

모델은 3년 감가상각, 연간 유지보수 5%, 월 720시간, 전기요금 $0.10/kWh, 냉각 및 시설 부하용 전력 사용 계수 1.30, 서버 작동 전력 7.476590 kW, 유휴 전력 1.016 kW를 가정합니다. 유료 수요가 10%이면 판매량은 벤치마크 용량의 10%지만, 노드의 감가상각·유지보수·유휴 전력 비용은 계속 발생합니다. 인건비, 애플리케이션 운영, 네트워크, 스토리지, 서비스 예비 용량은 제외했습니다.

가격 참고로 AWS Textract Queries 요금 예시 5는 미국 서부(오리건)에서 1,000페이지당 $15를 제시하며, 2026년 9월 15일 확인했습니다. 보고서의 예시 서비스 가격인 1,000페이지당 $10는 이 기준보다 33.33% 낮습니다. 이는 가격 시나리오입니다. 실측 작업은 페이지당 약 4.16건의 질문을 포함하며, 추출 품질·기능 범위·제공 서비스의 동등성은 시험하지 않았습니다.

방법 및 한계

  • 모델 및 런타임: Qwen/Qwen3.6-27B, 리비전 6a9e13bd6fc8f0983b9b99948120bc37f49c13e9, BF16; FlashAttention 2를 사용하는 vLLM 0.25.1. 명목 메모리 96 GB의 RTX PRO 6000 Blackwell Server Edition GPU 8개에서 독립 복제본 8개를 실행했습니다. 서빙 설정은 고정했으며, 사고 모드와 접두사 캐시는 끄고 멀티모달 프로세서 캐시는 켰습니다.
  • 데이터 및 평가: lmms-lab-encoder/DocVQA 리비전 539088ef8a8ada01ac8e2e6d4e372586748a265e의 전체 검증 세트로, 질문 5,349건과 고유 이미지 1,285개입니다. 결정적 샘플링으로 짧은 답변을 요청했습니다. 품질과 처리 능력은 동일한 전체 검증 최적화 실행에서 얻었습니다.
  • 지표 정의: 평균 정규화 레벤슈타인 유사도(ANLS)는 기준 답변과의 유사성을 측정하며, 정확 일치는 대소문자와 공백을 정규화합니다. 이러한 DocVQA 지표는 필드 수준의 업무 오류를 직접 측정하지 않습니다.
  • 측정 범위: 준비된 API 문서 질문 요청부터 답변 완료까지 동기화된 노드 공통 시간 구간을 사용했습니다. 시간당 속도는 약 7분 실행을 환산한 값입니다. PDF 수집, 기업용 커넥터, 스키마 검증, 사람의 검토, 콜드 스타트, 가용성 설계는 측정 범위에 포함하지 않았습니다.
  • 비교 한계: 온도가 0이어도 배치 형태가 바뀌면서 정규화된 예측 35개가 달라졌습니다. 작은 ANLS 상승은 관측된 수치 변동이며, 스케줄링이 모델 정확도를 높인다는 증거가 아닙니다. 조건을 맞춘 스케줄링 비교는 로컬 벤치마크이지 반복 운영 시험이나 공급업체 인증 결과가 아닙니다. 페이지 속도 환산은 이 질문 밀도에만 적용됩니다.

프라이빗 문서 질의응답과 멀티모달 추론

프라이빗 문서 질의응답에서 이 벤치마크는 멀티모달 추론 처리 능력을 밀린 문서와 처리 기한에 연결하는 데 도움이 됩니다. 측정 단위는 답변한 질문이며, 수집한 PDF나 검증된 업무 필드가 아닙니다. 고객 배포에서는 GPU 서빙 성능과 함께 대표 페이지 이미지, 답변 품질, 검토 절차를 평가해야 합니다.

실제 문서 작업을 벤치마크로 삼으세요

ProsGrow는 페이지 구성, 추출 품질, 처리 기한, 거버넌스 요구에 맞춰 프라이빗 문서 파일럿을 설계할 수 있습니다.

문서 파일럿 상담