프롬프트 캐싱을 제대로 파고들었더니, 히트율은 목표가 아니었습니다#
2026-08-05

시작은 “이게 대체 어디서 일어나는 거지"였습니다#
프롬프트 캐싱이 비용을 줄여준다는 건 알고 있었습니다. 같은 시스템 프롬프트를 반복해서 보낼 때 두 번째부터는 싸진다, 정도의 이해였습니다.
그런데 곰곰이 생각해 보니 이상했습니다. 캐싱이 모델 바깥의 어떤 중계 레이어에서 일어나는 거라면, 모델 입장에서는 절약되는 게 없어야 합니다. 그런데 절감 폭이 90%에 달한다고 합니다. 그렇다면 LLM(Large Language Model, 대규모 언어 모델) 사용 비용의 대부분이 모델 자체가 아니라 그 바깥 레이어에서 나온다는 뜻일까요.