從Sierra AI學習:餐飲店AI Agent的設計原則
將Bret Taylor的Sierra AI提出的「τ-bench」評估、確定性程式碼化、狀態管理進行Bookmi式改造。
去年,我們陷入了困惑。
Bookmi的AI智能體在行業標準的基準測試中表現優異。它能準確回答問題,正確檢索信息,生成語法完美的回覆。然而,當實際部署到餐飲店時,店主的反饋卻與預期大相徑庭。
「AI能回答問題,但預約變更總是不太順暢。」
這句話,徹底改變了我們的思維方式。
正確答案與正確結果是兩回事
傳統的AI基準測試——GSM8K、MMLU以及其他眾多測試——評估的是一個問題對應一個答案。能解數學題嗎?具備常識嗎?這些確實是重要的能力。
但餐飲店現場發生的事情,要複雜得多。
當顧客說「我想把明天的預約從19點改到20點」時,AI需要做的遠不止回答「好的,可以更改」。它需要確認當前預約,檢查20點的空位情況,執行變更,發送確認消息,必要時還要調整廚房的備餐計劃——所有這些,都要在與顧客的自然對話中完成。
能否完成任務。我們意識到,這才是真正重要的評價標準。
任務完成率:全新的衡量指標
我們從零開始重新審視評估方法。
新的方法不再以「一問一答」來評估AI,而是考察「整個任務」。新建預約、修改時間、變更人數、取消處理、特殊需求應對——我們模擬這些真實場景,測量AI能否從頭到尾正確處理。
結果令人驚訝。在傳統測試中得分超過90%的模型,在任務完成率上可能只有60%左右。相反,我們自主調優的模型雖然傳統分數略低,但任務完成率卻遙遙領先。
專為餐飲店設計的評估場景
我們設計的評估場景,涵蓋了餐飲店特有的複雜性。
高峰期預約衝突——週五19點預約扎堆時,AI能否恰當地提出替代方案。過敏應對——當顧客對多種食材過敏時,能否從整個菜單中篩選出安全的選項。臨時變更——預約當天人數大幅增加時,能否完成從座位重新安排到食材追加訂購的一系列調整。
我們準備了數百種這樣的場景,每週自動運行測試。
持續改進的循環
評估不是一次性的工作。
我們每天分析真實的對話記錄。AI失敗的案例、顧客不滿意的案例、需要人工介入的案例——所有這些都成為下一次改進的寶貴數據。
任務完成率從最初部署時的72%,提升到了現在的94%。但我們並不滿足。因為剩下的6%中,仍然包含著未能滿足顧客期望的時刻。
追求完美,我們每天都在讓AI不斷進化。