A/B 测试太慢太吃流量?有人用 AI Agent 先「预演」了一遍,误差压了 77 倍
改一个按钮颜色、调一行文案、换一个推荐策略,然后等一周、两周,看数据慢慢跑出来。中间还要担心流量分得够不够、工程配置有没有漏、有没有外部因素把结果打偏。每次实验都在烧真实用户流量——对用户量没那么大的产品,一个错误的实验方向可能就浪费了小半个月的观察窗口。
读到 Hut 和 Masoero 这篇论文时,我第一反应是「终于有人认真搞这件事了」。他们的问题很直接:能不能在正式跑 A/B 测试之前,让 AI Agent 先把结果模拟一遍?基于用户行为画像和干预条件的描述,给出有统计依据的预测。
他们管这个叫 Simulated Randomized Controlled Trial(S-RCT),也就是「模拟随机对照实验」。整个框架是 agent-agnostic 的——微调过的专业模型可以用,通用大模型也能当模拟引擎。不挑模型,谁行谁上。
为了验证这个想法,他们在 67 个真实营销 A/B 测试上做了回测。直接用现成的通用大模型跑,方向判断基本靠谱(sign overlap 达到 0.70),但效应量被系统性地高估了——模型觉得效果很大,实际上没那么多。
Agent 模拟用户行为,最怕的就是「演过头」——模型想象出来的用户反应比真人更极端、更一致。直接拿这个结果决策,可能会过度乐观地推一个实际上收益平平的方案。
论文给出了两套校准方法。
第一套叫两阶段事前校准(two-phase pre-period calibration protocol)。在正式模拟干预效果之前,先用历史数据把模型的偏差摸清楚,然后在校准阶段把它拉回来。平方预测误差(扣掉不可消除的测量噪声之后)压低了大概 77 倍。
77 倍是什么概念?如果原来模拟结果跟实际结果差得离谱,校准之后大致能落在可用范围内——至少不会做出完全相反的决定。
第二套是被试内设计(within-subject design),让同一个 Agent 同时暴露在实验组和对照组下。这个设计把标准误差缩小了大约 2.4 倍。直觉上也好理解:同一个 Agent 在两种条件下做决策,相当于控制掉了个体差异的噪声,对比更干净。
他们的误差分解框架把误差拆成两层——agent 近似误差和子采样误差。这意味着可以在不同层面做优化:模型本身不够强就换模型或做微调;样本量不够就多跑几轮模拟。分层拆解之后,改进方向清晰了。
这篇论文目前只是 workshop paper,被 AI Agent Behavior workshop 接收。67 个实验全部是营销领域的 A/B 测试,跨领域迁移能力还没验证。论文自己也坦诚,当前 baseline 模型会系统性地高估效应量——校准能压下去一部分,但有没有压过头、会不会在某些场景下出现新的系统偏差,还需要更多实验来确认。
对我来说,这篇文章最有价值的地方不在于它给出了一个「可以替代 A/B 测试」的方案——远远没有。而是在于它提供了一个模拟先行、筛选后跑的工作流思路。Agent 的输出用来做预筛选,不直接上线:十个候选方案,Agent 说其中三个大概率没效果、两个可能方向错了,那可以优先跑剩下的五个。反过来,Agent 觉得某个方案效果特别大,就加大流量分配,尽快验证。
这在算力和流量都是成本的情况下,是一个很务实的中间态。
我自己的感受是,这类工作会越来越多。A/B 测试作为互联网行业的黄金标准不会消失,但它的位置会往后挪——从「唯一验证手段」变成「最终验证手段」。前面多一层模拟筛选,省流量、省时间、省工程排期。实验不浪费在明显没希望的方向上。
论文里有一句话说得实在:agentic signals 能让实验者受益,但前提是知道它的边界在哪——知道它什么时候靠谱,什么时候会骗人。
目前论文已经挂在 arXiv 上(2608.02345),完整推导见原文。代码和数据暂未看到公开信息,但框架本身不挑模型,想在自己业务里试的,拿一个现成的 LLM 配合历史实验数据就能搭个初步版本。
如果跑出来的结果跟实际实验差太多,先把校准阶段做扎实——那 77 倍的差距就是从这来的。
相关链接
- 论文 arXiv 页面:https://arxiv.org/abs/2608.02345
- AI Agent Behavior Workshop:https://www.aiagentbehavior.com/