bookmi.
30일 무료
← 블로그 목록으로
기술2026-01-18· 12 min· Bookmi 기술팀

Sierra AI에서 배우다: 음식점 AI 에이전트 설계 원칙

Bret Taylor의 Sierra AI가 제창하는 'τ-bench' 평가, 확정성 코드화, 상태 관리를 Bookmi 방식으로 어레인지.

Sierra에서 배우다

작년, 우리는 당혹스러웠습니다.

Bookmi의 AI 에이전트는 업계 표준 벤치마크 테스트에서 우수한 성적을 거두고 있었습니다. 질문에 정확하게 답하고, 정보를 올바르게 검색하며, 문법적으로 완벽한 응답을 생성했습니다. 하지만 실제로 음식점에 배포했을 때, 사장님들의 피드백은 예상과 달랐습니다.

「AI가 질문에는 답해주는데, 예약 변경이 매끄럽지 않아요.」

이 한마디가 우리의 사고방식을 근본적으로 바꾸게 되었습니다.

정답과 올바른 결과는 다르다

기존의 AI 벤치마크——GSM8K, MMLU, 그 외 많은 테스트——는 하나의 질문에 대한 하나의 답을 평가합니다. 수학 문제를 풀 수 있는가? 상식을 알고 있는가? 이것들은 분명 중요한 능력입니다.

하지만 음식점 현장에서 일어나는 일은 훨씬 더 복잡합니다.

고객이 「내일 예약을 19시에서 20시로 변경하고 싶어요」라고 말했을 때, AI에게 요구되는 것은 단순히 「네, 변경 가능합니다」라고 답하는 것이 아닙니다. 현재 예약을 확인하고, 20시 빈자리를 체크하고, 변경을 실행하고, 확인 메시지를 보내고, 필요하면 주방의 준비 스케줄을 조정해야 합니다——이 모든 것을 고객과의 자연스러운 대화 속에서 수행해야 합니다.

태스크를 완수할 수 있는가. 이것이 정말로 중요한 평가 기준이라는 것을 깨달았습니다.

태스크 완수율이라는 새로운 지표

우리는 평가 방법을 처음부터 다시 검토했습니다.

새로운 접근법은 AI를 「일문일답」이 아닌 「전체 태스크」로 평가합니다. 예약 신규 생성, 시간 변경, 인원 변경, 취소 처리, 특별 요청 대응——이러한 실제 시나리오를 시뮬레이션하고, AI가 처음부터 끝까지 올바르게 처리할 수 있는지를 측정합니다.

결과는 놀라웠습니다. 기존 테스트에서 90% 이상의 점수를 받던 모델이, 태스크 완수율에서는 60% 정도밖에 달성하지 못하는 경우가 있었습니다. 반대로, 우리가 자체적으로 튜닝한 모델은 기존 점수는 약간 낮아도 태스크 완수율에서는 크게 앞섰습니다.

음식점에 특화된 평가 시나리오

우리가 설계한 평가 시나리오에는 음식점 특유의 복잡성이 포함되어 있습니다.

피크 시간대 예약 충돌——금요일 19시에 예약이 몰렸을 때, AI가 적절하게 대안을 제안할 수 있는가. 알레르기 대응——고객이 여러 식재료에 알레르기가 있을 때, 전체 메뉴에서 안전한 선택지를 제시할 수 있는가. 급한 변경 대응——예약 당일에 인원이 크게 늘었을 때, 좌석 재배치부터 식재료 추가 주문까지 일련의 조정을 할 수 있는가.

이러한 시나리오를 수백 가지 준비하고, 매주 자동으로 테스트를 실행하고 있습니다.

지속적인 개선의 사이클

평가는 한 번 하고 끝나는 것이 아닙니다.

우리는 매일 실제 대화 로그를 분석합니다. AI가 실패한 케이스, 고객이 불만족한 케이스, 오퍼레이터가 개입한 케이스——이 모든 것이 다음 개선을 위한 소중한 데이터가 됩니다.

태스크 완수율은 초기 배포 시 72%에서 현재 94%까지 향상되었습니다. 하지만 아직 만족하지 않습니다. 나머지 6%에도 고객의 기대에 부응하지 못한 순간이 포함되어 있기 때문입니다.

완벽을 향해, 우리는 매일 AI를 진화시키고 있습니다.

전화 받기, 리뷰 답변, 고객 후속 관리

시간을 빼앗는 이런 일들은 대부분 AI 가 대신할 수 있습니다. 먼저 30일간, 카드 등록 없이 써 보세요.

30일 무료로 사용해보기 →다른 글 보기 →