大模型后训练的异步RL总崩?新论文拆开importance ratio,根因在熵
做LLM后训练,异步RL(Asynchronous RL)能提速,但容易崩。Rollout生成和策略优化重叠跑,数据一过期,优化就开始抖,抖到最后模型直接collapse。过去处理这个问题的办法很直觉——按重要性采样比(importance ratio)的大小做clip或截断,比值太大的丢掉,比值正常的留下。
但这篇7月底挂到arXiv上的论文([2607.22186])往里拆了一层,发现事情没那么简单。
论文核心就一句话:importance ratio的自然尺度,随token的熵(entropy)系统性地变化。同一个threshold截断所有位置的token,低熵和高熵位置的行为完全不一样,一把尺子量,两头都出事。
先看低熵区。模型在低熵token上基本已经"定下来了",输出概率很确定。但异步训练里,rollout时用的策略和优化时用的策略总有差异——这种差异在低熵区会被剧烈放大,变成实质性的采样噪声。过去以为是正常的训练信号,其实是噪声在冲KPI。
再看高熵区。高熵token模型本来就不确定,异步训练里in-flight的权重更新恰好促使模型在这里做更多探索——这是好事,是async RL本该带来的探索红利。但旧的magnitude-only correction一刀切下去,把高熵区的探索也当"off-policy太大"给切了。于是噪声放进来,探索切出去,两边不讨好。
作者提出的方案叫Entropy-Scaled Trust Region(ESTR)。每个token的off-policy偏离程度,除以它自己的局部熵来缩放。不需要额外的forward pass,不需要显式的版本switch检测,就是在做ratio correction时让熵参与定价。
结果,在长程agent任务和数学推理benchmark上,ESTR一致优于现有的异步方法,train-inference一致性也最好。和同步的GRPO比,精度差不多,但训练速度快了2.6倍。
2.6倍这个数字挺实在。异步RL搞LLM后训练,最纠结的一直是"提速换不稳值不值"。如果ESTR真能在agentic任务和math上同时兑现——不丢精度、不崩训练、顺手拿2.6x——那异步路径对于做post-training的团队来说就从"可以试试"变成了"应该用上"。
当然,这篇目前还是arxiv版本,需要看后续的复现和消融。但至少它点出了一个之前被忽视的结构性问题:不要只看importance ratio的大小,还要看它发生在什么位置上。熵不同,ratio的意义就不同——这个洞察在RL里不算惊天动地,但放到LLM异步后训练这个具体场景里,确实打得准。