一篇论文想把围棋AI的树搜拐杖抽掉

AlphaZero 那套体系最烧算力的地方,不是训练,而是下棋的时候。每走一步,模型都要靠 MCTS(蒙特卡洛树搜索)展开几万次模拟,才能弥补策略网络自己拿不准的地方。真正的棋力有一半是临时搜出来的,策略网络本身其实不太可靠。

在 Google 集群上这没问题。但放到一台笔记本上,MCTS 的树管理开销直接让推理速度掉到没法用。更烦人的是,你要是为了省算力把搜索砍了,模型就开始「幻觉」——对一步送子棋打出 90% 的自信,然后崩盘。跟大模型编造事实一个毛病,只不过围棋输赢很硬,幻觉一出来就是实打实的失分。

7 月底挂到 arXiv 上的一篇论文(2607.26946),盯的就是这个问题。方案叫 Belief-Guided Decision Making with Uncertainty Gating。翻译成人话就是:给模型装一个「内部裁判」和一个「自我怀疑开关」。

传统的 AlphaZero 式架构有两个头——Policy head 出招,Value head 给局面打分。这篇加了一个 Belief head,它不直接算胜率,而是做内部模拟推演,相当于模型在自己脑子里快速过几手棋,再输出一个「信念值」。同时配了一个门控机制(gating),用来过滤策略网那些「自信但其实是臭棋」的输出。模型对某一步没把握的时候,门控就把这条路压住,不让它乱拍板。

为了处理围棋里的长程依赖和打劫规则(Ko rule),模型用了 Transformer 和 GRU 来做记忆。整套设计的核心思路是:把推理阶段靠暴力搜索才能补的智力,提前压缩到模型的参数里,变成一种近似直觉的东西。

论文的实验结果是 search-free(不搜树)的胜率明显提升,幻觉也降了。说法是可以在有限硬件上实现职业级对局——具体职业级指什么段位、在多大范围内验证的,8 页正文里应该有更多细节,只看摘要还不好下判断。

我的看法是:这篇论文不太可能一下子推翻 AlphaZero 积累了好几年的工程体系,但它指的方向确实有意思——你不见得非要在推理时搜几万步才能下好棋。把决策网络自己搞靠谱,再加一个内部纠偏机制,可能就够了。

这个思路如果能从围棋迁移到更 general 的决策模型,那价值就不只是赢棋了。毕竟现在推理成本太高——少搜几步还不掉精度,这个方向值得试试。

「相关链接」

  • arXiv: https://arxiv.org/abs/2607.26946
  • PDF: https://arxiv.org/pdf/2607.26946