Vibe Commerce 来了:当「说句话就下单」变成 Agent 考场
上个月还在聊 vibe coding,现在学界已经把「vibe commerce」搬上论文了。
Rutgers、Santa Clara 等高校联合发了一篇新论文,题目就叫「Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce」。既然你能对 AI 说「帮我写个贪吃蛇」,那能不能对它说「帮我买一件 200 块以下的白色卫衣,不要纯棉,要能机洗的」——然后让 Buyer Agent 和 Merchant Agent 自己完成交易?
这个设想不算新,但他们真搭了一个仿真环境来当考场。
ACWorld:Agent 版的「淘宝模拟器」
这个环境叫 Agentic Commerce World(ACWorld),核心是一套叫 Vibe Commerce Protocol(VCP)的交互协议。VCP 的作用是:在 Buyer Agent 和 Merchant Agent 每次交互前,先校验动作合法性,再更新交易状态,同时把整个流程记录下来。每一步都能回放、能审计、能复现结果——这对研究型评测来说至关重要,因为商业场景里「结果对了但过程错了」的情况太常见了。
论文给出了两个评测赛道:一个 200 任务的「能力覆盖」赛道,和一个 60 任务的「大目录」赛道。大目录赛道在 785,022 条可交易商品条目上做检索和匹配,规模接近真实电商场景的缩微版。
十款模型跑下来,分数比想象中低
他们测试了 10 个模型,在能力覆盖赛道上平均得分在 65.9% 到 85.6% 之间;大目录赛道更分散,从 56.1% 到 91.4%。这不是传统的 QA 准确率,而是 Agent 在多轮交易中完整走完流程的成功率——从理解用户需求、搜索商品、协商条款到完成交易。
91.4% 看着还行,但那是 60 个任务上的表现,而且是最优模型。大部分模型碰上大规模目录检索时,瓶颈暴露得很明显。
一句不显眼但关键的分析
论文里有一句不那么显眼但很关键的分析:「final state alone can miss evaluated errors」——只看最终成交状态是不够的,会漏掉大量过程错误。
做过 Agent 系统的人对这个场景不陌生:Agent 最后给了你正确答案,但中间走了弯路——比如多调了一次接口、问了不该问的信息、或者在某步做出了不符合规则的决策。如果只检查结果,这些行为风险会被完全隐藏。ACWorld 的 VCP 协议做的事情,就是把「中间过程」也变成可审计的证据链。
这正是很多 Agent 落地项目在面对的难题。你在生产环境里跑一个购物助手的 Agent,用户说「买到了,没问题」,但你的账单、权限日志和供应商那边可能已经绕了好几圈弯路。没有过程审计,老板不敢放量。
做 AI 产品的人能从中看到什么
这篇论文给「商业 Agent」画了一套考场规则。它没有给出商业产品,也没有开源代码(目前页面只提供了 PDF 和实验性 HTML),但提供了一个评测思路:Agent 到底能不能在 Buyer 和 Merchant 各自拥有私有目标、各自保有独立决策权的前提下完成交易?
这个设定很接近现实。买家不想暴露预算上限,卖家不想亮出底价,双方都由 Agent 代理谈判——多智能体博弈的复杂度就在这里。ACWorld 的贡献在于,它把这种博弈放进了一个可审计、可复现的沙箱里,让研究者、甚至最终的产品团队能比较不同模型和策略的真实差距。
785,022 条商品离真实电商平台的 SKU 量级还差几个数量级,200 个任务的覆盖度也远谈不上完备。不过论文指出的方向很清楚:如果 vibe coding 已经在改变软件的生产方式,vibe commerce 迟早会改变商品的流通方式。只不过到时候,「AI 帮我买错了能不能退」会比「AI 帮我写错了能不能改」更现实——ACWorld 至少让这个问题先变得可以测了。