Supervisor Agent详解:防止AI「失控」的审计系统
退款金额幻觉、库存误识别、不当承诺——公开实时防范这些问题的机制。
「非常抱歉,我们将为您全额退款」
那是导入两周后的事。一家拉面店的AI在处理投诉时这样回答了。问题在于,这家店并没有授予AI「全额退款」的权限。况且,一碗拉面的价格进行全额退款本来就不是正常的处理方式。
收到店长联系的那一刻,我们的心凉了半截。
AI会「撒谎」
准确地说,AI并不是在撒谎。但它会对自己不了解的事情充满自信地侃侃而谈。业界称之为「幻觉」现象。
承诺不存在的折扣。推荐已售罄的商品。无视店铺规则进行应对——这些都是AI「幻觉」引发的问题。
那家拉面店的事件之后,我们得出了一个结论:不能完全信任AI。但不使用AI也已经不是选项了。
那么,就需要一个「监控」AI的机制。
打造守望者
我们构建的是「Supervisor Agent」——一个在发送给顾客之前,实时检查AI输出的监控系统。
原理很简单。AI生成的所有回复,在发送前都必须通过多重验证。金额正确吗?与库存状况矛盾吗?是否超出了授予AI的权限?
只要有一项问题,该回复就会被拦截。
0.3秒的攻防
然而,验证需要时间。不能让顾客等太久。
我们通过并行处理验证解决了这个问题。金额验证、库存验证、权限验证、个人信息验证——这些同时执行,平均0.3秒完成。
对顾客来说,几乎没有等待。但在背后,这0.3秒内有4项不同的验证在同时进行。
敢于叫停,智慧衔接
并非所有事都能自动化。当Supervisor判断「危险」时,AI会保留回复,升级给人工客服。
「非常抱歉,我需要向负责人确认,请您稍等」——这一句话,能够防止重大问题的发生。
自那家拉面店的事件以来,Supervisor每天平均阻止12条「危险回复」。这个数字看起来很小,但每一条都关乎店铺的信誉。
释放AI的力量,同时防止它失控。这两者的平衡,正是我们追求的目标。