Inference Budget

Inference Budget / GUIDE

추정치를 실제 배포 검증으로 연결하기

메모리 계산이 배포 준비의 끝은 아닙니다. Inference Budget은 측정할 후보를 선택하도록 돕는 도구이며, 저장소의 Terraform·Helm 예제를 실행했다는 증거를 대신하지 않습니다.

먼저 같은 조건을 고정하기

모델 리비전, 토크나이저, 양자화 형식, 서빙 엔진 버전, GPU 드라이버, 최대 문맥과 배치 설정을 기록하세요. 설정이 바뀐 뒤의 결과를 이전 수치와 비교하면 원인을 구분하기 어렵습니다. 계산기 보고서도 같은 실행 기록에 첨부할 수 있습니다.

측정은 단계별로

  1. 모델을 로딩하고 요청이 없는 상태의 점유량을 기록합니다.
  2. 짧은 요청 한 개로 기본 응답과 인증·시간 제한을 확인합니다.
  3. 최대 허용 길이의 요청 한 개로 피크 메모리를 기록합니다.
  4. 목표 동시성까지 올리고 오류·대기시간·첫 토큰 지연을 관찰합니다.
  5. 긴 실행 뒤 메모리가 예상 상태로 돌아오는지 확인합니다.

각 단계에서 실패하면 다음 단계의 수치를 성능으로 발표하지 말고 실패 조건을 남기세요. 같은 가상 요청으로 반복 가능한 기준선을 만드는 편이 유용합니다.

인프라 검증과 모델 검증을 분리하기

저장소의 Kubernetes 스모크 경로는 TLS 라우팅과 프로세스 연결을 확인하기 위해 합성 추론 프로토콜을 사용합니다. 그 경로의 성공은 실제 GPU 모델 추론, 답변 품질, 오프라인 설치 또는 고객 환경 운영을 증명하지 않습니다. 이 웹 계산기도 그런 주장을 하지 않습니다.

서비스 상한을 정하기

요청 길이, 동시성, 실행 시간, 대기열 길이에 명시적 상한을 두면 사용자는 실패 이유를 이해할 수 있고 운영자는 재현할 수 있습니다. 최대치를 늘리기 전에 대표 요청뿐 아니라 의도적으로 큰 요청도 검증하세요. 결과를 숫자 하나로 줄이지 말고 어떤 범위에서 확인했는지 함께 기록하는 것이 핵심입니다.