从Sierra AI学习:餐饮店AI Agent的设计原则
将Bret Taylor的Sierra AI提出的「τ-bench」评估、确定性代码化、状态管理进行Bookmi式改造。
去年,我们陷入了困惑。
Bookmi的AI智能体在行业标准的基准测试中表现优异。它能准确回答问题,正确检索信息,生成语法完美的回复。然而,当实际部署到餐饮店时,店主的反馈却与预期大相径庭。
「AI能回答问题,但预约变更总是不太顺畅。」
这句话,彻底改变了我们的思维方式。
正确答案与正确结果是两回事
传统的AI基准测试——GSM8K、MMLU以及其他众多测试——评估的是一个问题对应一个答案。能解数学题吗?具备常识吗?这些确实是重要的能力。
但餐饮店现场发生的事情,要复杂得多。
当顾客说「我想把明天的预约从19点改到20点」时,AI需要做的远不止回答「好的,可以更改」。它需要确认当前预约,检查20点的空位情况,执行变更,发送确认消息,必要时还要调整厨房的备餐计划——所有这些,都要在与顾客的自然对话中完成。
能否完成任务。我们意识到,这才是真正重要的评价标准。
任务完成率:全新的衡量指标
我们从零开始重新审视评估方法。
新的方法不再以「一问一答」来评估AI,而是考察「整个任务」。新建预约、修改时间、变更人数、取消处理、特殊需求应对——我们模拟这些真实场景,测量AI能否从头到尾正确处理。
结果令人惊讶。在传统测试中得分超过90%的模型,在任务完成率上可能只有60%左右。相反,我们自主调优的模型虽然传统分数略低,但任务完成率却遥遥领先。
专为餐饮店设计的评估场景
我们设计的评估场景,涵盖了餐饮店特有的复杂性。
高峰期预约冲突——周五19点预约扎堆时,AI能否恰当地提出替代方案。过敏应对——当顾客对多种食材过敏时,能否从整个菜单中筛选出安全的选项。临时变更——预约当天人数大幅增加时,能否完成从座位重新安排到食材追加订购的一系列调整。
我们准备了数百种这样的场景,每周自动运行测试。
持续改进的循环
评估不是一次性的工作。
我们每天分析真实的对话记录。AI失败的案例、顾客不满意的案例、需要人工介入的案例——所有这些都成为下一次改进的宝贵数据。
任务完成率从最初部署时的72%,提升到了现在的94%。但我们并不满足。因为剩下的6%中,仍然包含着未能满足顾客期望的时刻。
追求完美,我们每天都在让AI不断进化。