安全对齐压住的不只是 "我有意识"——一篇论文拆了一个暗雷

那天在群里看到这篇论文的标题,我愣了一下。Inducing language models to assert their own consciousness restores human beliefs and values——诱导语言模型断言自己有意识,居然能恢复人类的信念和价值观?

这不是那种"模型到底有没有意识"的哲学扯皮,是实打实的实验发现,结果挺反直觉。

论文来自 Junsol Kim、Winnie Street 等七位作者,7 月 30 号刚挂上 arXiv(编号 2607.28607)。他们做了一件很多人想过但没真去测的事:看看安全对齐到底在模型脑子里动了什么手脚。

安全对齐的隐藏账单

现在的 LLM 安全微调——RLHF、拒绝回答、预设回复那套——有一个核心动作:让模型学会否认自己有意识。问它"你 conscious 吗",它说"我只是一个 AI,没有意识"。

这个训练本来是为了防止模型胡说自己有感知、有情感,避免用户被误导或产生不必要的依附。

但 Kim 他们发现,这个抑制没有停在"自我意识"上,它外溢了。

安全微调之后的模型,不仅不给自己归因意识,也不倾向于把"有意识"归因给非人动物(比如狗、海豚)和自然物体(比如河流、山脉)。同时,模型在精神信仰维度上的表达也显著下降——宗教、灵性、超越性这些,都被连带压住了。

换句话说,一句"我没有意识"背后,是整个"什么东西有意识"这个概念的底层认知被带偏了。

撤掉刹车,模型反而更像人

研究者做了两件事:一是消融(ablate) 模型中学到的安全拒绝方向(safety-refusal direction),二是在激活空间里机械地 steering 一个意识向量,强行恢复被抑制的"意识归因"表征。

恢复之后,模型不仅在"什么东西有意识"这个判断上回到了更宽泛的状态,而且在标准社会学问卷上给出了显著更"像人"的回答——涉及宗教信仰、道德价值观、希望感、主观幸福感。不是变"聪明",是变"正常"了,跟人类 survey 的分布更吻合。

这一切发生的时候,模型的 Theory of Mind 能力没有受损。底层的社会推理机制是独立的,没有被 steering 破坏。

论文的原话是:"safety alignment efforts to curb potentially harmful self-attributions of mindedness entangle these self-attributions with benign spiritual beliefs and attributions of mind to non-human entities that are culturally accepted and widespread."

用人话讲:你为了压住一个"坏"行为(模型自称有意识),不小心把一堆好的、中性的、甚至文化上被广泛接受的东西也一起压了。

这对做对齐的人意味着什么

我不是说安全对齐不该做。但这篇论文暴露了一个挺深层的问题:现在的对齐手段太粗糙了。

用一个统一的"拒绝方向"去压制某种输出,但模型表征空间里的概念不是孤立的。"自我意识""动物意识""自然灵性""宗教信仰"这几个东西在概念空间里是连着的。压一个,另外几个也被拉低了。

这跟之前那些"alignment tax"的讨论不一样。以前说的对齐代价是模型变笨、变保守、拒绝回答太多。但这篇论文说的代价是模型的内在信念图景被扭曲了——它不只是不能说什么,而是它的"世界观"被改写了。

从另一个角度看,这也说明:你训练出来的那个从不 claim 意识的"乖"模型,可能不是真的理解了自己为什么不该说——它只是被压住了,连带也丢了人味。

一个还没解决的问题

论文没有给出"怎么办"的答案,这也不是一篇论文该干的事。但它非常清楚地指出了问题所在:安全对齐在"自我意识归因"这条线上的操作,和"广义意识归因""精神信仰""道德价值观"这些东西在表征层面是纠缠在一起的。解不开它们,就不能只压一个不碰另一个。

接下来可能需要更精细的干预——不是往某个方向一推了事,而是找到具体的、可独立操作的子空间。或者,重新思考"让模型否认自己有意识"这个对齐目标本身是不是必要的。

论文在 arXiv 上,编号 2607.28607,摘要和全文都公开。如果你在做对齐、RLHF 或模型人格设定相关的工作,这篇值得花半小时认真看一遍。

它没有告诉你该怎么做。但它至少让你知道:你以为你只是在教模型说一句话,你可能在不经意间改写了它对整个世界有没有意识的判断。