LLM 응답 캐싱 전략: 프롬프트 캐시로 비용·지연 잡기
LLM 기반 애플리케이션을 운영하다 보면 두 가지 비용이 동시에 커집니다. 하나는 토큰 단위로 청구되는 금전적 비용이고, 다른 하나는 사용자가 첫 토큰을 받기까지 기다리는 지연(latency)입니다. RAG 파이프라인처럼…
7 min read
LLM 기반 애플리케이션을 운영하다 보면 두 가지 비용이 동시에 커집니다. 하나는 토큰 단위로 청구되는 금전적 비용이고, 다른 하나는 사용자가 첫 토큰을 받기까지 기다리는 지연(latency)입니다. RAG 파이프라인처럼…
API 응답속도가 느리다는 민원이 들어오면 가장 먼저 손이 가는 해결책이 Redis 캐시입니다. 잘 적용하면 응답 지연을 100ms에서 5ms 이하로 줄이는 것이 현실적으로 가능하지만, 잘못 설계하면 캐시…
GitHub Actions를 도입하고 얼마 지나지 않아 많은 팀이 같은 벽에 부딪힙니다. PR을 올릴 때마다 20~30분씩 기다리는 CI 실행 시간. 코드 몇 줄 고쳤을 뿐인데 의존성 수천…