vLLM PagedAttention과 연속 배칭으로 처리량 튜닝
LLM을 자체 서빙할 때 값비싼 GPU를 사놓고도 처리량이 기대만큼 나오지 않는 경험은 흔합니다. 원인은 대개 연산이 아니라 메모리와 스케줄링입니다. 트랜스포머 추론은 매 토큰마다 이전 토큰들의 키·값…
8 min read
LLM을 자체 서빙할 때 값비싼 GPU를 사놓고도 처리량이 기대만큼 나오지 않는 경험은 흔합니다. 원인은 대개 연산이 아니라 메모리와 스케줄링입니다. 트랜스포머 추론은 매 토큰마다 이전 토큰들의 키·값…