Context Caching으로 80% 비용 절감: 구현 가이드
Anthropic/OpenAI의 Context Caching 기능을 최대 활용. 시스템 프롬프트 설계 요령 공개.
API 청구서를 보고 눈을 의심했습니다. 월 200만 엔.
도입 점포 수가 늘어남에 따라 API 비용도 비례해서 증가하고 있었습니다. 이대로는 사업이 성립하지 않습니다.
엔지니어 팀에서 청구 내역을 분석했을 때, 어떤 사실을 알게 되었습니다.
「매번 같은 걸 가르치고 있다」
저희 AI는 손님에게 질문을 받을 때마다 점포의 모든 정보를 AI에 전달하고 있었습니다. 점포명, 주소, 전화번호, 영업시간, 메뉴, FAQ——전부 합쳐서 약 3,000 토큰.
하루에 1,000건의 문의가 있으면 300만 토큰입니다. 그 대부분이 매번 같은 정보입니다.
AI에게 「우리 가게 몇 시까지 해요?」라고 물을 때마다, 저희는 처음부터 가게에 대해 전부 설명하고 있었던 것입니다. 마치 매일 아침 자기소개부터 시작하는 직장 같은 것입니다.
「한 번 가르치면 기억해 줘」
Anthropic과 OpenAI가 제공하는 Context Caching 기능은 바로 이 문제를 해결합니다.
변하지 않는 정보(점포 기본 정보, 메뉴, FAQ)를 캐시에 저장. 손님의 질문이 있을 때마다 「변하는 정보」만 추가로 전달합니다.
AI는 캐시된 정보를 「기억하고 있는」 상태에서 답변합니다.
80%의 비용 절감
캐시 도입 후의 숫자입니다.
캐시 히트율은 85%. 즉, 85%의 리퀘스트에서 점포 정보를 처음부터 다시 보낼 필요가 없어졌습니다.
월간 API 비용은 200만 엔에서 40만 엔으로. 80% 삭감입니다.
「순서」가 중요하다
한 가지 주의점이 있습니다. 캐시는 프롬프트의 맨 앞부터 일치하는 부분만 유효합니다.
저희는 변하지 않는 정보를 앞에, 변하는 정보(오늘의 빈자리 상황 등)를 뒤에 배치하도록 프롬프트를 재설계했습니다.
AI에게 같은 것을 반복해서 가르치지 않는다. 단순한 원칙이 80%의 비용 절감을 가져왔습니다.