← AI 용어집

AI 용어집 · 기초 · 효율·인프라 · 언어 모델

프롬프트 캐싱 Prompt caching

프롬프트 캐싱은 LLM에 매번 똑같이 들어가는 프롬프트 앞부분의 계산 결과를 저장해 두었다가 다음 요청에서 다시 쓰는 기술이다. 같은 내용을 처음부터 다시 계산하지 않아 응답이 빨라지고 비용도 줄어든다.

쉽게 말하면 자주 가는 식당에서 "늘 먹던 걸로요"라고 하면 주문을 처음부터 다시 설명할 필요가 없는 것과 비슷하다. 다만 메뉴가 조금이라도 바뀌면 그 뒷부분은 새로 설명해야 하듯, 앞부분이 한 글자라도 달라지면 캐시를 쓸 수 없다.

어떻게 작동하나

LLM은 글을 읽을 때 토큰 하나하나에 대해 중간 계산 결과를 만들고, 이를 KV 캐시라는 형태로 메모리에 담아 둔다. 프롬프트 캐싱은 이 계산 결과를 요청이 끝난 뒤에도 일정 시간 보관해 둔다. 다음 요청의 앞부분이 이전과 똑같으면 저장해 둔 결과를 그대로 불러오고, 새로 붙은 질문 부분만 계산한다. 그래서 바뀌지 않는 시스템 프롬프트, 긴 참고 문서, 도구 설명 같은 내용을 프롬프트 맨 앞에 두는 것이 요령이다.

프롬프트 캐싱의 흐름고정된 앞부분 → 캐시 확인; 캐시 확인 → KV 캐시(재사용); KV 캐시 → LLM; 새 질문 → LLM; LLM → 답변고정된 앞부분시스템 프롬프트·문서캐시 확인앞부분이 똑같은가?KV 캐시저장된 계산 결과처음엔 계산 후 저장새 질문LLM새 부분만 계산답변재사용
프롬프트 캐싱의 흐름 매번 같은 앞부분은 저장해 둔 KV 캐시를 다시 쓰고, 새 질문만 LLM이 새로 계산해 답을 만든다. 처음 요청에서는 앞부분도 계산한 뒤 저장한다.

왜 중요한가

요즘 AI 서비스는 긴 지침과 문서를 매번 함께 보내는 경우가 많아서, 같은 내용을 반복 계산하는 데 시간과 돈이 많이 든다. 프롬프트 캐싱을 쓰면 첫 응답이 나오기까지 걸리는 시간이 짧아진다. 여러 AI 제공사는 캐시에서 다시 읽은 토큰에 대해 일반 입력보다 낮은 요금을 받는 방식으로 이 기능을 제공한다. 대화가 길게 이어지는 챗봇이나 같은 도구 목록을 계속 쓰는 AI 에이전트에서 특히 효과가 크다.

알아 둘 점

캐시는 프롬프트의 '앞에서부터 똑같은 부분'에만 적용된다. 앞쪽에 날짜나 사용자 이름처럼 매번 바뀌는 내용이 들어가면 그 뒤는 모두 다시 계산해야 한다. 캐시는 보통 일정 시간이 지나면 사라지므로, 요청이 드문 서비스에서는 효과가 작을 수 있다. 서비스마다 캐시를 자동으로 적용하는지, 개발자가 직접 지정해야 하는지, 요금을 어떻게 매기는지가 다르니 사용하는 플랫폼 문서를 확인해야 한다.

예시

회사 규정 문서 전체를 넣어 두고 직원 질문에 답하는 사내 챗봇을 생각해 보자. 규정 문서는 매번 같고 질문만 바뀌므로, 문서 부분을 캐시해 두면 두 번째 질문부터는 새 질문만 계산하면 된다. 이 사이트에 소개된 'AWS, Amazon Bedrock에서 Z.ai의 753B MoE 모델 GLM 5.3 제공' 소식처럼, 클라우드에서 대형 모델을 빌려 쓰는 서비스가 늘수록 이런 비용 절감 기능을 지원하는지가 모델 선택의 기준 중 하나가 된다.

이 사이트에서 나온 사례

함께 보면 좋은 용어