AI 做了全部工程,但论文被原作者拒了:一个关于「AI 做科研」的扎实实验
前段时间圈里又飘起一股「AI 马上要自己搞研究了」的风,从递归自我改进到 AI 科学家自动发文,叙事一个比一个猛。但一篇 7 月 29 日挂上 arXiv 的论文,给了一个难得扎实的 reality check。
标题很直白:《Can AI agents conduct open-ended AI research?》,作者名单里有 Helen Toner 和 Arvind Narayanan。他们没去争辩「AI 能不能搞科研」这个抽象问题,而是设计了一套叫 「影子评估」(shadow evaluation) 的方法,实际测了一把。
怎么测的?
找两篇还没公开发表的、高质量的 NeurIPS 2026 投稿,把核心研究问题抽出来,交给两个 frontier AI agent。给 6 天时间,烧几千美元算力,让 agent 自己干。论文原作者亲自打分,决定这活儿干得行不行。
结果:两个 agent 都独立完成了全部的工程实现,但都没能在研究问题上做出实质性推进。两篇论文都被原作者毫不含糊地拒了。
能干工程,不能做研究——这个区分本身就值得细看。
五个反复出现的失败模式
作者总结了五个,每一个都挺具体,不是那种「模型还不够强」的废话。
Agent 经常觉得自己做够了,离标准还差一大截——它不知道做到什么程度才算够。
实验走不通了,人类研究者会停下来想「是不是问题框架本身有问题」。Agent 不会——它只会继续在同一个方向上硬磨。
走进死胡同之后,agent 也不太会回溯到更上游的决策点重新选路,更多是在原地打转或随机换参数。
几千美元算力烧下去,agent 不会想「这笔钱花得值不值」,也不会根据剩余资源调整策略。
指令做着做着就偏离了原来的研究问题,而且自己意识不到。
一个关键判断
作者在结论里写得很清楚:今天的 agent 可以做完 AI 研究中「工程」那部分——写代码、跑实验、搭 pipeline——但在研究的核心环节上(提出好问题、判断什么算贡献、从失败中找到新方向)依然不行。
Agent 能独立完成全部工程实现,已经比以前强了很多。但「自动做科研」和「自动写实验代码」之间,差着好几层。
Paper 附带释出了完整的 expert reviews、survey responses、agent repositories 和 logs,方便查证细节。
我的看法
这篇论文最可贵的地方,是它没有用 benchmark 去替代真实判断。Shadow evaluation 这个思路本身就值得更多人用:让真正懂行的人,拿真问题去测 agent,这比跑几个标准化测试就说「AI 已经超越人类研究者了」要实在得多。
那些鼓吹「AI 马上要自动做科研」的人,不妨先看看这五个 failure mode,再想想自己的叙事站不站得住。
不过话说回来,agent 现在只花 6 天、几千美元就把工程部分全部搞定——这个速度的进步本身,已经在改变很多团队的研发流程了。只是离「取代研究者」还远,而且远在什么地方,这篇论文说得比大多数人都清楚。