GenUI 评估新解法:用社会人格陪审团替代单一 LLM 裁判,相关性从 0.716 拉到 0.922
做生成式 UI(GenUI)的人大概都遇到过这个困境:让 LLM 评价自己生成的界面,它打分稳不稳?稳。但它真的懂不同用户怎么看这个界面吗?多半不懂。一个模型只有一个隐式视角,而真实用户是学生、是上班族、是视障使用者、是急性子——他们看到的是完全不同的界面。
这几乎是一个每天都在发生的评估失真问题。最近 arXiv 上有一篇论文直接捅破了这层窗户纸,而且给了一套解法。
为什么单一裁判不够用
目前的 GenUI 评估主要两条路:人工评,贵、慢、评分员之间差异大;LLM-as-a-judge,可扩展、一致性强,但只反映单一视角。问题是,一个界面在不同人群眼里好坏的判断标准可能完全不同——排版紧凑对信息密度敏感的用户是加分,对老年用户就是减分。单一大模型裁判不会告诉你这些,它只会给你一个不偏不倚但掩盖了所有分歧的平均分。
这篇论文来自 Zheng Wu、Yibo Luo 等人,提出的方法叫 ESPP(Evidence-Grounded, Social-Weighted Persona Panel),说白了就是:不再让一个 LLM 当裁判,而是模拟一组有心理学多样性、有具体证据支撑的虚拟人格,让他们独立评分、互相讨论,最后通过类似德尔菲法的社会加权机制汇出一个总分。
三步流程,比想象中更务实
ESPP 的流程分三段。第一段,构建一个有心理学多样性的人格小组——这些人格不是随便写的 prompt 角色,而是基于证据(比如大五人格特质、使用习惯、认知能力差异)生成的。每个 persona 会先看界面截图,给出自己的评分和理由。
第二段是有意思的部分:这些人格之间要交换意见,但不是无限制地聊到共识。论文设计了一个「特质驱动、语义门控的有限置信机制」——直白说就是,每个人格有自己的信念强度,讨论时只会在一定范围内调整自己的判断,不会轻易被带偏。这模拟的是真实用户小组讨论时那种「我有我的看法,但你讲得有道理我可以改一点」的状态。
第三段,用类似德尔菲法的社会加权把所有人的评分汇总。权重不平均,信源可靠、立场坚定的人格更有分量。
效果提升不止一点点
论文报告的核心数据很直接。与人类评分的 Pearson 相关系数,从单一大模型裁判的 0.716 提升到了 ESPP 的 0.922。为了确认这个提升不是单纯因为用了多个 prompt 做 ensemble 造成的,他们做了一个 prompt-ensemble 对照实验——结果只追回了大约三分之一的差距。这说明真正的增益来源是人格多样性和证据支撑,不是简单的多次采样取平均。
还有一个很值得展开的发现:保留每个 panelist 的评分之后,研究者发现不同子群在模型整体排名上意见一致,但在具体的评分维度上分歧非常大。老年人格对字体大小和对比度的打分方差显著,高信息密度人格对内容充裕度的评价路径完全不同。这是一个单一同质裁判会系统性抹掉的结构性分歧。
换句话说,如果你只用一个大模型给 UI 打分,你不仅打不准,你还不知道自己漏掉了什么。
不是只有 GenUI 才用得上的思路
虽然论文的落地场景是生成式 UI 评估,但这个思路完全可以外溢——产品反馈分析、对话系统评估、内容审核中的多方视角引入,本质上都面临同一个问题:一个模型不等于所有用户。GitHub 上已经开源了代码(github.com/Wuzheng02/ESPP),跑起来门槛不高。
这类方法当前能覆盖到什么程度?论文里用的是截图输入,人格小组的构建依赖心理学框架的预设,对于完全动态的交互流程或者长周期使用体验,目前的版本还没覆盖到。但对于一个每天要出几十版 UI、只能靠 LLM 快速打分的团队来说,用一群人格替代一个裁判,相关性拉到 0.92,这个性价比已经足够让人动心了。