프롬프트 캐싱 Prompt caching
프롬프트 캐싱은 LLM에 매번 똑같이 들어가는 프롬프트 앞부분의 계산 결과를 저장해 두었다가 다음 요청에서 다시 쓰는 기술이다. 같은 내용을 처음부터 다시 계산하지 않아 응답이 빨라지고 비용도 줄어든다.
어떻게 작동하나
LLM은 글을 읽을 때 토큰 하나하나에 대해 중간 계산 결과를 만들고, 이를 KV 캐시라는 형태로 메모리에 담아 둔다. 프롬프트 캐싱은 이 계산 결과를 요청이 끝난 뒤에도 일정 시간 보관해 둔다. 다음 요청의 앞부분이 이전과 똑같으면 저장해 둔 결과를 그대로 불러오고, 새로 붙은 질문 부분만 계산한다. 그래서 바뀌지 않는 시스템 프롬프트, 긴 참고 문서, 도구 설명 같은 내용을 프롬프트 맨 앞에 두는 것이 요령이다.
왜 중요한가
요즘 AI 서비스는 긴 지침과 문서를 매번 함께 보내는 경우가 많아서, 같은 내용을 반복 계산하는 데 시간과 돈이 많이 든다. 프롬프트 캐싱을 쓰면 첫 응답이 나오기까지 걸리는 시간이 짧아진다. 여러 AI 제공사는 캐시에서 다시 읽은 토큰에 대해 일반 입력보다 낮은 요금을 받는 방식으로 이 기능을 제공한다. 대화가 길게 이어지는 챗봇이나 같은 도구 목록을 계속 쓰는 AI 에이전트에서 특히 효과가 크다.
알아 둘 점
캐시는 프롬프트의 '앞에서부터 똑같은 부분'에만 적용된다. 앞쪽에 날짜나 사용자 이름처럼 매번 바뀌는 내용이 들어가면 그 뒤는 모두 다시 계산해야 한다. 캐시는 보통 일정 시간이 지나면 사라지므로, 요청이 드문 서비스에서는 효과가 작을 수 있다. 서비스마다 캐시를 자동으로 적용하는지, 개발자가 직접 지정해야 하는지, 요금을 어떻게 매기는지가 다르니 사용하는 플랫폼 문서를 확인해야 한다.
예시
회사 규정 문서 전체를 넣어 두고 직원 질문에 답하는 사내 챗봇을 생각해 보자. 규정 문서는 매번 같고 질문만 바뀌므로, 문서 부분을 캐시해 두면 두 번째 질문부터는 새 질문만 계산하면 된다. 이 사이트에 소개된 'AWS, Amazon Bedrock에서 Z.ai의 753B MoE 모델 GLM 5.3 제공' 소식처럼, 클라우드에서 대형 모델을 빌려 쓰는 서비스가 늘수록 이런 비용 절감 기능을 지원하는지가 모델 선택의 기준 중 하나가 된다.
이 사이트에서 나온 사례
- 브리핑 AWS, Amazon Bedrock에서 Z.ai의 753B MoE 모델 'GLM 5.3' 제공 2026-10-07