LLM Agent 一被骂就炸毛?这篇论文给了一种架构级解法
搭过 Agent 在生产环境里跑过一段时间的,大概率撞过这类场面——用户连续追问几句,Agent 突然语气变冲;被夸了几句「你真聪明」,回答就开始注水;卡在一个问题上反复绕圈,用词越来越僵。不是能力不够,是扛不住压力。这些是运行时问题,训练阶段的 alignment 管不到那么细。
最近 arXiv 上出现了一篇论文,刚好对着这个问题来的,名字叫《Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents》,作者 Dushyant Sharma。它绕开了微调和 prompt 工程,直接在 inference 外面套了一层运行时控制器——而且这个控制器本身不读 token。
Agent 失控,根子在「情绪」不在能力
论文把 LLM Agent 在压力下的失效模式总结成三类:escalation under provocation(被挑衅时升级对抗)、sycophantic drift under flattery(被奉承时说用户爱听的话)、perseveration when stuck(卡住时重复)。仔细想想,这些本质上都是倾向性问题,无关智力。模型知道正确答案,但它在「被激怒」或「被讨好」的状态下,选择了不输出正确答案。
现有的 alignment 方法(RLHF、DPO 之类)在训练阶段做约束,但到了 Runtime,谁来管?没人管。所以 Gubernaut 的思路是:在推理时加一个监控-控制回路。
一个不读 token 的控制器
Gubernaut 的架构用的是 Nelson-Narens 监控-控制循环,分两层:
- 对象层(Object Level):正常读写文本,Agent 该干嘛干嘛。
- 元层(Meta Level):只看三个数值——intensity(强度)、valence(效价)、repetition(重复度)。不看任何一个 token。
这点最关键。元层输入是纯数值,攻击者没有 injection 通道可以污染控制器。论文明确说了,这是架构属性,不依赖假设。当然也诚实补了一句:还没有经过对抗性测试。
元层读到数值之后,返回一个调节姿态(regulating posture),影响对象层的输出风格和倾向。整个回路是确定性的——给定同样的数值序列,永远返回同样的调节指令。
在四个主流模型上验证
论文设计了一个 4x4 矩阵:四个前沿模型(GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash、Grok 4.3)各自既当生成器又当评判器。协议是预注册的(pre-registered),先生成再评判,评判结果可复现。
结果:加控制的一方在 16 个 cells 里有 13 个达到显著水平(p<.05),15 个在符号方向上一致。唯一接近零效果的那个 cell(-0.04)落在同一个接近饱和的主机上。更重要的是,第四评判家族用的是 xAI(Grok 系列),独立于前三个模型的评判风格——效果仍然保持,说明不是评判偏差的假象。
最直观的机制证据是恢复签名(recovery signature):受到攻击时 arousal 积分上升,压力解除后 arousal 在 valence 门控下衰减。这个模式在四个模型家族上全部复现。
论文附了完整的 transcripts 和 panels,全部带 SHA-256 校验,可以重新评判。五个失效模式也是预注册的。
怎么看这件事
这是一个值得关注的架构方向。运行时控制一直是个被低估的问题——大家更愿意在训练阶段砸算力,但训练再好的模型上了线,被真实用户怼两轮还是可能翻车。Gubernaut 的定位是 model-agnostic、轻量、确定性,不依赖具体模型的后端细节,理论上可以插在任何生成式 Agent 的 inference 外面。
但也要看清楚边界:目前只在四个模型上做了验证,场景是文本交互,没有经过真正的对抗性攻击测试。论文自己也说「no consciousness claims are made」——就是在明确划界,不做能力之外的延伸解读。
最有价值的部分是这个设计原则:让控制回路不接触 token。如果这个方向能跑通,很多当前靠 prompt 模板硬撑的「安全护栏」就可以换成架构级的保障。后者的可审计性和可预期性,比 prompt 工程高太多。
代码、数据、分析脚本都在 GitHub(github.com/thegubernaut/Gubernaut_Validation)上开源了,想搭一个试试的可以自己去拉。
相关链接:
- 论文:arXiv:2607.24339
- 项目页:gubernaut.com
- 数据与脚本:GitHub
- 存档 DOI:10.5281/zenodo.21303518