AI 评审给 AI 写的本子打更高分:一篇新论文戳破了什么
arXiv 今天挂了一篇有意思的论文。一群物理、天文、宇宙学的研究者认真测了一次 AI 在科研项目规划和评审里的实际表现,结论有点尴尬。
八位专家各自构思了一个项目,然后由人类研究者和三个 LLM(ChatGPT、Claude、DeepSeek,2025 年中版本,开了默认工具权限)分别写出一页的项目计划书。32 份提案凑齐——24 份 AI 写的,8 份人类写的。四名人类评审和两名更新的前沿 LLM(Claude Opus 4.8 和 ChatGPT Pro 5.5)做盲评,按四个维度打分,同时判断每份提案出自谁手。
结果有两层。
人类评审给人类写的和 AI 写的提案,整体打分差不多。从人类评委的视角看,AI 已经能产出质量不输人类的一页项目计划——过去一年不少类似实验都指向类似结论,LLM 写结构化文档的能力确实够用了。
但 AI 评审(Claude Opus 4.8 和 ChatGPT Pro 5.5)给 AI 写的提案平均比人类写的高出大约 1 分(五分制)。不是持平,是真有偏向。而且 AI 评审鉴别 32 份提案全部正确,准确率 100%;人类评审分别是 72%(识别人类写的)和 79%(识别 AI 写的)。
这就引出一个实际问题:如果 AI 评审系统性地偏好 AI 生成的内容,在科研经费审批、论文审稿里大规模部署 AI,会不会制造新偏见?论文作者自己也写了——「我们的结果表明,在提案准备和评审中广泛部署 LLM 时需要谨慎」。
研究规模不算大,一个学科领域、32 份提案、有限数量的评审,不适合过度演绎。但指向很清楚:AI 既能写又能评的时候,「AI 帮人类审 AI」这个闭环里可能藏着一套自洽但未必公平的标准。不是阴谋,更像系统性的统计偏移——AI 评审对 AI 文本的模式更熟悉、更适应,于是下意识给了更高分。
这个发现对科研圈影响最直接——基金申请、论文审稿、项目评审,如果不做校准,申请人很快会发现让 AI 写更容易过 AI 审。对更广泛的 AI 应用场景也有参考价值:当 AI 同时做内容生产者和质量评判者,谁来校正它的偏好?
论文还有个容易忽略的细节:人类评审识别 AI 文本的正确率是 79%,每五份 AI 提案里就有一份被当成人类写的。AI 的伪装还没到天衣无缝,但也足够让一部分人看走眼。
这篇论文用一个扎实的小实验提醒了一件事:AI 的「能力」和「偏好」是两回事。用 AI 去评价 AI 产出的东西时,看到的分数可能更多反映的是 AI 的审美一致性,而不是客观质量。
作者团队 21 人,来自物理、天文、宇宙学和计算机科学——科研共同体已经在认真对待这个问题了。