LLM 扫几行字就能判性格?LEX-EC 拆开给你看它到底信了什么
LLM 读一段文字就能给出性格判断,这事看着挺玄,用起来更玄。一段自我介绍丢进去问「这人外向还是内向」,它会吐出一个标签,回答得跟真看懂了似的。但没人知道它是真做了性格分析,还是只扫到了「喜欢聚会」「热爱社交」这类关键词就交了卷。
Georgia Tech 的 Brittany Harbison 和 Ashok K. Goel 刚在 arXiv 挂出来的 LEX-EC 框架,就是冲这个解释性缺口去的。它在黑盒条件下干了一件事:拆开 LLM 打出性格分的依据,看清楚模型到底依赖什么信号。
方法不花哨但很对症。文本送进模型拿到标签,然后反向操作——一轮一轮遮掉特定类别的词汇,先遮话题词和人口统计线索,再只保留功能词、情感词和认知风格类词,看模型的判断还能不能站住。如果「外向」分数在遮掉某类词之后明显跳水,那模型大概率不是在分析性格,只是在蹭相关词。
这套审计跑了三组文本。自由作文里的信号范围最宽但整体偏弱;研究生自我介绍里的外向性关联在被遮词之后明显弱化;单人 Facebook 状态——哪怕样本已经做了性格标签均衡——几乎留不下稳定证据。短文本、碎片化内容丢给模型,打出来的性格分可能跟随机猜差不太多。
遮掉话题和人口内容之后,部分性格关联仍然能被检测到,靠的是功能词、情感词和认知风格类词汇。模型确实能捕捉一些「跟说什么无关、跟怎么说有关」的信号——用词偏积极还是消极、句式偏复杂还是简单。但这些信号整体很薄,能不能撑起实际决策是另一回事。
LEX-EC 不提升分类精度,也不提新的性格模型。它是一套审计流程,评估的是几件更底层的事:分类 prevalence(样本里到底有多少被标了某类)、条目级关联(单条文本跟标签的对位关系)、机会修正一致性(去掉运气成分之后稳不稳定)、词汇限制下的判断变化(遮掉哪些词之后判断变了),以及 prompt 敏感性。它能回答一个很实际的问题:手头这批性格标签,有几成是真读出来的,几成是蹭出来的?
做简历筛选、用户画像或人机交互研究时如果用过 LLM 的性格判断能力,这篇论文值得翻。它不会让分类突然变准,但能让人知道自己拿到的那堆标签,边界到底在哪。
论文已在 arXiv 放出 PDF 和 HTML,框架 reusable,实验材料按论文描述可以获取。