LLM 的「性格」不是提示词编出来的,这篇论文在神经元里找到了证据

老实说,每次看到有人用「你是一个温柔体贴的助手」这种 prompt 来给大模型定人设,我都有点怀疑——这到底是真的改变了模型的行为,还是只是在输出层贴了一层皮?

北大几位研究者最近放了一篇论文,把这个问题往深了挖了一层。论文标题叫《From Representations to Behaviors: Exploring the Person-Situation-Behavior Triad in LLMs》,7 月 29 日刚挂 arXiv。文章不长,但我觉得值得干这行的人都瞄一眼,尤其是天天跟模型行为打交道的人。

他们到底干了什么

基本思路是这样的:人类心理学里有个「人格三元理论」(Funder's triad),说的是一个人的特质不是用一个分数就能刻画的,而是通过「人—情境—行为」三者之间的互动来体现。Zhang、Wang 和 Su 把这套框架搬到了 LLM 身上,重新定义了三个组件:

  • Person:模型内部跟人格特质相关的表征(不是 prompt 里写的那句话,是神经元层面的东西)
  • Situation:能诱发特定特质反应的上下文
  • Behavior:模型在更广泛的社会任务中的响应模式

具体做法分三步。先用对比行为对(同一个情境下、不同特质倾向的行为)配合 SAE 稀疏自编码器分解,找到跟人格特质正反两极对应的稀疏内部特征。再验证这些特征确实跟行为有因果关系——不仅在 token 级别能看到激活模式,对改写后的输入也保持稳定。最后直接对这些特征做干预(feature-level intervention),就能双向调节模型在完全不同情境下的行为倾向,且不影响回答的基本有效性。

重点不是「能改」,是「在哪改」

圈内人应该已经嗅到这里的区别了。以前调模型性格靠的是 prompt 工程或者 finetune 数据分布——都是外部手段。这篇论文做的是:找到模型内部跟「尽责性」「宜人性」这类特质相关的神经元特征,然后直接在表征空间里推一把。

论文不只测了人格量表。把同样的干预用到社会智能任务上,观察到的行为变化跟人类心理学文献里的收益—权衡模式一致——说明这些内部表征不是实验假象,它们确实在驱动模型在复杂社交场景里的实际表现。

对干活的人意味着什么

目前这篇还是纯研究,没有开源代码或者现成工具。但方向很明确:如果你想让模型在客服场景里更耐心、在谈判场景里更强势、在写作场景里更有「性格」,未来可能不需要反复调 prompt,也不需要攒数据 finetune——直接找到对应的特征扳手拧一下就行。

当然,现在离这一步还有距离。论文用的是 SAE 分解出来的稀疏特征,具体是哪一层、哪些维度、跨模型是否通用,都还是开放问题。「人格」这东西在人类身上都吵不清楚,放到模型里更得小心——你调高了「宜人性」,模型会不会在需要拒绝的场合也一味迎合?论文里提到的收益—权衡恰恰说明了这种风险。

不过话说回来,有一篇论文认真地把「LLM 的人格」从 prompt 修辞拉到了表征科学层面,这事儿本身就值得记一笔。

相关链接: