PredAct-Bench 发布|AI 工具一有噪音,大模型就开始给错误建议撑腰
做 AI 产品的人都清楚一个尴尬的现实:调用的工具——预测模型、搜索接口、代码解释器——没有一个是绝对准确的。但绝大多数评测基准假装它们完美无瑕。一篇新论文就冲着这个窟窿来的。
伊利诺伊大学几位研究者刚放出了 PredAct-Bench,一个专门用来测「工具带噪声时,对话代理还能不能靠谱」的基准。他们用教育场景搭了个测试台:老师靠 AI 辅助判断学生会不会挂科、需不需要提前干预。工具是一个统计预测模型,输出有噪声——跟现实一模一样。
论文的核心发现有点扎心。他们测了 13 个闭源和开源模型,包括主流 SOTA 模型,结果发现:当工具输出不准时,模型几乎不会主动向用户传递不确定性。 老师面对一个置信度不高的预测结果,拿到的回复跟面对高置信度结果时差不多。这直接导致人类决策者容易过度依赖错误建议——模型表现得自信,但工具底层的噪声被藏起来了。
这个问题的后果不止在教育领域。医疗里的诊断辅助、金融里的风险评估,但凡涉及 AI 建议加人类拍板的场景,都在同一个坑里。
PredAct-Bench 做了两件比较实在的事。它搭建了两个数据集——OULAD 是英国开放大学真实的课程评估轨迹数据,PREDACT-CS 是基于真实期末成绩合成周成绩轨迹的 60 门课程数据集——同时提出了两个新指标:RAIR(Relative AI-Reliance) 和 RSR(Relative Self-Reliance),用来测对话过程中人类对 AI 建议的信任变化。这比之前单轮信任校准框架往前走了一步——在多轮对话里,用户的依赖度是动态的。
评测结果中有一个细节值得单独提:论文提到,当工具噪声存在时,理想情况下模型应该「给教师提供可见性,让他们不会过度依赖错误建议或幻觉」,但当前模型做不到。这不是能力问题,是设计取向问题——模型被训练成尽量有用、尽量直接,结果在不确定的时候反而有害。
对于正在搭 Agent 或 AI 辅助决策系统的团队来说,这篇论文提供了一个不太舒服的自检视角。工具链里每个环节都有误差率,但团队有没有在用户交互层做任何「不确定性可见化」的设计?没有的话,用户迟早会在一次模型自信但预测翻车之后,彻底失去信任。
论文已经在 arXiv 上公开,数据集的构造方法和评价指标都可以复用。感兴趣的读者可以顺着 OULAD 和 PREDACT-CS 两个关键词去翻,看看自己的 Agent 在工具噪声下能撑多久。