ICML 2026 现场辨析:当 AI4S 从“工具”走向“创始人”,我们该如何定义科学发现?

ICML 2026 现场辨析:当 AI4S 从"工具"走向"创始人",我们该如何定义科学发现?

在 ICML 2026 的最后一天,一场主题为 "AI Scientists —— Tools, Co-authors, or Founders?" 的 Workshop 引发了在场研究者的深层焦虑。这场讨论的核心直指 AI for Science (AI4S) 的定位悖论:当 AI 试图从实验室里的"工具"进化为能独立提出问题的"创始人"时,我们究竟该如何衡量它的价值?

正如开场所言:"AI4S 在科学社区里是被低估了,但在 AI 社区,人们有时又高估了它的能力。"

一、 Benchmark 失效危机与"AI Scientist"的定义困境

Workshop 中最激烈的交锋发生在圆桌讨论环节。来自 Meta、Anthropic、LG AI、UCSF 和首尔大学的五位嘉宾,围绕一个核心困境展开辩论:当 AI 模型能在几周内刷爆任何静态 Benchmark 时,我们还能用什么标准来定义"AI Scientist"?

1. 静态 Benchmark 的迅速"死亡"

LG AI 的 Moontae Lee 抛出了一个悲观观察:他花费五年时间从事 LLM 基础工作后发现,Benchmark 一旦发布,几乎立刻就"死"了。为了竞争 SOTA,现有模型瞬间就能解决那些 Benchmark 刚发布时还不存在的问题。因此,他主张 Benchmark 必须转向动态化,像强化学习 (RL) 环境一样基于最新论文或全新数学问题不断演化,才能避免被轻易拟合。

Anthropic 的 Julian Schrittwieser 则更为激进,他直言对传统 Benchmark 持保留态度,认为很难做出能真正代表实际研究工作流的长期有效指标。他更倾向于通过 Slack 或 Discord 上的 Agent 进行实际交互,依靠"直觉"来评估模型能力。

2. "假设检验"与"假设生成"的分水岭

Meta 的 Ben Miller 与 UCSF 的 Brian Cheung 从另一个维度切入了这一话题。Brian Cheung 引用其导师的观点,区分了"假设检验"与"假设生成":目前 AI 在假设检验方面表现优异,但真正的 假设生成(提出人类从未想过的猜想)仍遥不可及。Ben Miller 也指出,AI Scientist 迈向下一步的关键在于能否组合不同想法、做出真正新颖的东西,而不仅仅是复现昂贵的过程。

3. 终极衡量标准:发现的价值

那么,如何衡量 AI 是否成为了科学家?Brian Cheung 提出了一个极高的标准:"是否做出了让人愿意在此基础上继续构建的发现。" 他认为科学验证往往是回顾性的,直到发现被广泛采纳,否则很难获取有效的验证信号。他甚至提议建立一种新的 "Evaluation Scaling Law"——系统能容纳多少评估(来自物理实验或模拟器),决定了 AI 能做多大的科学。

二、 从"掌控力"到"合著者":AI 驱动科学的新范式

在争论之外,研究者正通过具体工作回应这种焦虑,探索 AI 在没有人类反馈的情况下如何自主探索,以及 AI 如何成为科学家的"合著者"。

1. 普林斯顿团队:重新设计 AI 的"内在驱动力"

普林斯顿大学计算机科学助理教授 Benjamin Eisenberg 与其博士生 Catherine G 提出了 "掌控力" (Empowerment) 框架。针对训练前沿 AI 所需的人类反馈成本已达数十亿美元且随知识边界推进日益高昂的问题,他们引入源自信息论的"掌控力"概念,即"行为对世界可能产生的影响"。

团队区分了两种形式:
* 潜在掌控力:处于能行使选择的状态(如先爬到山顶,拥有前往四面八方的自由)。
* 有效掌控力:主动行使选择(如从山顶主动走下山进入不同路径)。

研究表明,最大化掌控力的状态能为智能体提供适应未知下游任务的理论保证。这意味着,AI 不需要解决特定任务,而是通过"掌控"环境来为无数未来问题做准备,从而减少对人类反馈的依赖。

2. Google DeepMind:AI 作为数学家的"合著者"

Google DeepMind 的 Ray Jiang 展示了 AI 作为数学家"合著者"的硬核实例。他们研究的是流体方程中的不稳定奇点——一种极其脆弱、类似"把铅笔竖立在笔尖上"的数学结构,关系到 Clay 千禧年大奖难题之一的 Navier-Stokes 方程。

传统数值模拟难以捕捉这类奇点,因为任何微小扰动都会导致漂移。团队的做法是将物理方程直接写入神经网络的损失函数,让 AI 搜索"完美平衡点"。结果令人瞩目:
* 发现了三个此前从未被找到的流体方程不稳定奇点家族。
* 残差精度达到 $10^{-13}$,接近机器极限。
* 发现了奇点间严格的线性规律,可预测更高阶奇点位置。

Jiang 表示,这套框架并非替代人类完成证明,而是帮人类找到传统方法无法触及的数学对象,为严格证明提供起点。这正是 "Co-author" 的含义。

三、 AI4S:高估与低估的错位

关于 AI4S 的现状,嘉宾们给出了不同维度的判断。

  • 社区间的认知偏差:首尔大学的 Chaok Seok 指出,在 AI 社区中 AI4S 被高估,人们常高估现有系统能力;但在科学社区中,它被低估,许多研究者仍仅将其视为生产力工具,而非改变科学研究方式的力量。
  • 投资热度与实质进展:Ben Miller 认为从投资热度看领域过热,目前尚未看到 AI 提出"对未知现象有趣而简洁的理解"的证据;而 Julian Schrittwieser 则持相反意见,认为若延续过去五年的进步,"所有软件工作自动化"并非不可能,问题在于当前模型仍需大量人类引导。

结语

ICML 2026 这场 Workshop 暴露出的,正是 AI for Science 当前最深层的张力:我们急于给 AI 的"科学能力"打分,却连"科学能力"本身该怎么定义都还没达成共识。

从 Ben Miller 对"技能退化"的担忧——希望研究者不要跳过与困难"搏斗"的过程,直接跳到给出答案的描述;到 Ray Jiang 展示的 AI 辅助突破数学边界,我们正处于一个临界点。AI 或许暂时还无法成为独立的"Founder",但它正在以"Co-author"甚至"Empowered Explorer"的身份,逐步重塑科学发现的边界。


参考来源:
* 原始文章:ICML 2026 的 AI4S 现场:工具、合著者,还是创始人?
* 作者:周蕾 | 编辑:岑峰
* 发布平台:AI 科技评论