AI代理说做完了,数据库却出卖了它

最近微软发了一篇挺有意思的文章,讲他们做了一个叫ThinkingBox的评测框架,专门用来给AI代理打分。但打分的方式很特别:不看代理生成的漂亮句子,而是看它在数据库和文件系统里留下的实际痕迹。换句话说,你说你完成了任务,那我们就查一查后端状态到底变了没有。

这个思路其实戳中了很多做Agent的人的痛点。我们平时测代理,经常是跑一次成功了就认为它能用,但生产环境里最怕的是「一次成功、二十次翻车」。ThinkingBox的做法是让代理在隔离的MCP工具会话里反复执行同一个任务,然后检查它留下的副作用是否一致。比如一个客服代理说帮用户退了款,那就得看订单表里的状态是不是真的改了,而不是听它嘴上说搞定了。文章里还提到一个概念叫「一致性成本」,大概意思是让模型稳定输出正确结果,需要付出的代价并不是线性的。他们画了一条帕累托成本前沿,想说明你追求更高的可靠性,就得接受更高的推理成本或者更复杂的工程架构。这个判断我挺认同的,现在很多团队为了省token,把代理的验证环节砍掉,结果就是线上事故不断。更实用的是他们总结了几种「失败签名」,也就是代理常见的翻车模式。比如工具调用成功但没写库、写库了但写错字段、或者重试的时候产生了重复副作用。这些模式如果能在评测阶段就暴露出来,比上线后靠用户投诉发现要划算得多。文章还给了完整的复现步骤,从装依赖、启动Typesense和MCP服务,到跑一个episode打分,基本可以照着搭一套自己的评测环境。我的看法是,Agent评测正在从「看输出」转向「看状态」,这是一个很关键的范式变化。以前大家比的是谁的模型更会说话,以后比的可能是谁的代理在真实系统里更少留烂摊子。对于做跨境工具或者SaaS的团队来说,这套思路可以直接拿来用:别光测对话,测数据库。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼