vLLM PagedAttention과 연속 배칭으로 처리량 튜닝
LLM을 자체 서빙할 때 값비싼 GPU를 사놓고도 처리량이 기대만큼 나오지 않는 경험은 흔합니다. 원인은 대개 연산이 아니라 메모리와 스케줄링입니다. 트랜스포머 추론은 매 토큰마다 이전 토큰들의 키·값…
8 min read
LLM을 자체 서빙할 때 값비싼 GPU를 사놓고도 처리량이 기대만큼 나오지 않는 경험은 흔합니다. 원인은 대개 연산이 아니라 메모리와 스케줄링입니다. 트랜스포머 추론은 매 토큰마다 이전 토큰들의 키·값…
GPU 서버 비용은 ML 인프라 운영에서 가장 큰 지출 항목 중 하나입니다. A100 80GB 온디맨드 인스턴스 하나가 시간당 3~4달러(AWS p4d.24xlarge 기준)에 달하고, 대규모 추론 서비스를 24시간…
LLM을 프로덕션에 올리는 순간 가장 먼저 마주치는 벽은 처리량(throughput)입니다. GPU 메모리는 한정되어 있고, 사용자 요청은 길이가 제각각이며, 응답을 기다리는 동안 GPU는 생각보다 많이 쉬고 있습니다. vLLM은…