「冰上国际象棋」终于被 AI 盯上了:强化学习自学冰壶战术
Curling 常被叫做「Chess on Ice」,冰上国际象棋。但这么多年,AI 把国际象棋、围棋、星际争霸都扫了一遍,冰壶这块几乎没人认真碰过。
上周 arXiv 挂出来一篇论文,总算有人动手了。苏黎世联邦理工和帕多瓦大学的团队用 DDPG 算法训练了一个冰壶战术决策智能体。在简化四壶规则下,纯自监督学习,没有用任何人类标注数据,打平了手调专家策略。
这事比看起来要难不少。冰壶战术决策有几个特点是 RL 最不喜欢的。状态和动作空间都是连续的,每次投掷结果有随机性——选手不是机器,出手有波动。石头轨迹对微小扰动极其敏感,偏一度落位就差一大截。之前 ML 圈对冰壶的尝试基本停在统计建模,没人真拿强化学习去啃。
这套框架利用冰壶有限回合(finite-horizon)的结构来改造 DDPG 训练。Actor 学策略,Critic 学估值。训练完后,真正有意思的不是策略本身——Critic 网络能对任意连续动作输出一个密集的估值信号。拿它当战术分析工具,可能比拿它当选手用更实用。
论文实验缩在四壶简化版本里,和手调启发式策略打平。作者还专门算了「hammer advantage」(冰壶后手优势的量化值)来校准这个平局,说明他们对「打平」这个结果是认真校准过的。
从四壶到标准八壶、到真实冰面,距离肯定有。但这篇工作真正有价值的地方,是证明了冰壶这类连续、随机、高敏感度的战术决策问题,可以用 RL 在完全无监督的条件下学会。这个信号对做决策智能的人来说,比又刷一个 Atari 基准要解渴。
毕竟不是所有问题都能被 LLM 吞掉——虽然现在也能起个标题叫「冰壶大模型」。有些真实决策问题,状态连续、结果不确定、极度依赖细微扰动理解,反而更适合 RL 这种框架去试。
论文是 arXiv 预印本,2026 年 8 月 3 日提交,CC BY-NC-ND 4.0 许可。代码暂未看到公开链接,后续可以留意。
相关链接:
- 论文 arXiv 页面:https://arxiv.org/abs/2608.02379
- PDF 下载:https://arxiv.org/pdf/2608.02379