bookmi.
30天免費
← 返回部落格列表
技術2026-01-18· 12 min· Bookmi技術團隊

從Sierra AI學習:餐飲店AI Agent的設計原則

將Bret Taylor的Sierra AI提出的「τ-bench」評估、確定性程式碼化、狀態管理進行Bookmi式改造。

從Sierra學習

去年,我們陷入了困惑。

Bookmi的AI智能體在行業標準的基準測試中表現優異。它能準確回答問題,正確檢索信息,生成語法完美的回覆。然而,當實際部署到餐飲店時,店主的反饋卻與預期大相徑庭。

「AI能回答問題,但預約變更總是不太順暢。」

這句話,徹底改變了我們的思維方式。

正確答案與正確結果是兩回事

傳統的AI基準測試——GSM8K、MMLU以及其他眾多測試——評估的是一個問題對應一個答案。能解數學題嗎?具備常識嗎?這些確實是重要的能力。

但餐飲店現場發生的事情,要複雜得多。

當顧客說「我想把明天的預約從19點改到20點」時,AI需要做的遠不止回答「好的,可以更改」。它需要確認當前預約,檢查20點的空位情況,執行變更,發送確認消息,必要時還要調整廚房的備餐計劃——所有這些,都要在與顧客的自然對話中完成。

能否完成任務。我們意識到,這才是真正重要的評價標準。

任務完成率:全新的衡量指標

我們從零開始重新審視評估方法。

新的方法不再以「一問一答」來評估AI,而是考察「整個任務」。新建預約、修改時間、變更人數、取消處理、特殊需求應對——我們模擬這些真實場景,測量AI能否從頭到尾正確處理。

結果令人驚訝。在傳統測試中得分超過90%的模型,在任務完成率上可能只有60%左右。相反,我們自主調優的模型雖然傳統分數略低,但任務完成率卻遙遙領先。

專為餐飲店設計的評估場景

我們設計的評估場景,涵蓋了餐飲店特有的複雜性。

高峰期預約衝突——週五19點預約扎堆時,AI能否恰當地提出替代方案。過敏應對——當顧客對多種食材過敏時,能否從整個菜單中篩選出安全的選項。臨時變更——預約當天人數大幅增加時,能否完成從座位重新安排到食材追加訂購的一系列調整。

我們準備了數百種這樣的場景,每週自動運行測試。

持續改進的循環

評估不是一次性的工作。

我們每天分析真實的對話記錄。AI失敗的案例、顧客不滿意的案例、需要人工介入的案例——所有這些都成為下一次改進的寶貴數據。

任務完成率從最初部署時的72%,提升到了現在的94%。但我們並不滿足。因為剩下的6%中,仍然包含著未能滿足顧客期望的時刻。

追求完美,我們每天都在讓AI不斷進化。

接電話、回評價、追客戶

這些佔掉你時間的事,AI 能接走一大半。先試 30 天,無需綁卡。

免費試用 30 天 →看其他文章 →