Inference Budget / GUIDE
문맥 길이와 동시성의 타협점을 찾는 법
서빙 시스템의 메모리는 평균 질문 길이보다 동시에 남아 있는 시퀀스에 민감합니다. 짧은 질문이 대부분이어도 긴 문서를 넣은 요청이 여러 개 겹칠 수 있습니다. 계산기에서는 목표 토큰 수와 동시 시퀀스 수를 별도로 입력하세요.
입력 토큰과 출력 토큰을 함께 잡기
예를 들어 검색 문서와 대화 이력이 6,000토큰이고 최대 2,000토큰을 생성한다면 보수적인 전체 길이 후보는 8,000입니다. 최대 문맥 길이를 전부 채우는 요청이 흔하지 않더라도, 서비스가 그 요청을 허용한다면 어떻게 제한하거나 대기시킬지 정해야 합니다.
동시 사용자 수와 시퀀스 수는 다릅니다
사용자 100명이 사이트를 보고 있어도 100개 추론이 동시에 실행되는 것은 아닙니다. 반대로 한 요청이 여러 후보 응답을 생성하면 여러 시퀀스가 필요할 수 있습니다. 큐의 대기 요청과 실제 GPU에서 유지되는 시퀀스를 구분하세요. 계산기의 배치는 동시에 캐시를 보유하는 같은 길이 시퀀스 수라는 단순 가정입니다.
세 가지 비교를 기록하기
- 대표 문맥, 평소 동시성: 일상적인 운영 후보입니다.
- 긴 문맥, 평소 동시성: 문서 입력이 커질 때를 확인합니다.
- 긴 문맥, 최대 동시성: 허용 상한을 동시에 만났을 때를 확인합니다.
화면의 비교 표는 현재 문맥의 절반, 현재 값, 두 배를 보여줍니다. 입력 범위를 넘어가면 최대 지원 값으로 제한합니다. 이 표는 메모리만 비교하며 응답 속도와 처리량의 변화를 계산하지 않습니다.
메모리를 줄이면 항상 더 빨라질까요?
캐시 정밀도 변경, CPU 오프로딩, 요청 대기 전략은 메모리와 지연시간에 서로 다른 영향을 줍니다. 계산기는 전송 시간이나 커널 구현을 모델링하지 않습니다. 설정을 정한 뒤 첫 토큰 지연, 전체 생성 속도, 실패율을 동일 요청 묶음으로 측정해야 합니다.