FriendBench 发了一篇论文,说多模态模型已经能「看人下菜碟」了——但方式跟人不一样

前两天刷到一篇新论文,题目叫 FriendBench,看了一遍摘要,觉得这事值得单独拎出来说。

一群人设计了一个测试——给模型看一段 20 秒的对话视频,判断画面里的两个人是已经认识的朋友,还是第一次见面的陌生人。每对参与者聊的是同一个话题,所以答案只能从互动方式里找,不能靠内容猜。

他们拿这个测试跑了 7 家公司的 26 个多模态模型,同时拉了人类对照组做同样的题。一共 96 组配对。结果最有意思的是:最好的模型和人类在准确率上已经没有统计显著差异了——模型追平了人类。

但要是据此认为「模型已经和人一样会看人眼色了」,就把结论说早了。

论文里有个细节我看了好几遍。准确率虽然拉平了,但模型和人类的犯错方式完全不一样。人类在判断时「朋友」和「陌生人」两个答案分布很均衡,而表现最好的模型明显偏向「陌生人」。模型遇到不确定的时候更倾向于认为这两人不认识——这个偏差出在先验倾向,不是辨别能力。

输入渠道越丰富,两边获益并不对等。到了视频模态(画面+语音+文本),人类的准确率有明显提升,但模型的提升幅度小得多。视频里那些微表情、肢体语言、目光接触——这些人类几百万年进化出来的社交雷达,模型暂时还转化不成同等的信号增益。

不过话说回来,能在 20 秒的片段里做到和人类无统计差异,这事本身就挺吓人。判断两个人熟不熟悉,很多时候依赖的是那种「说不上来但就是感觉」的东西——语气里的松弛度、接话的节奏、沉默时的舒适感。这些东西很难被显式地写进训练数据,但模型硬是从多模态信号里自己摸出来了。

这篇论文的实验条件还算温和:96 对样本、结构化破冰对话、已标注的真值。真实的社交感知比这复杂得多——熟人也有尴尬的时候,陌生人也能一见如故。但 FriendBench 的价值正在于此:不是在吹嘘模型有多强,而是在建立一个可复现、可比较的能力边界。

论文没有下什么宏大结论,反而花了不少篇幅讨论局限——样本量、文化背景单一、对话类型固定。他们还把全部刺激材料、人类评分和模型预测都开源了,想接着做的人可以直接拿。

我觉得这件事对做 AI 产品的人有直接意义。产品里涉及多模态社交理解的团队——比如面试辅助、销售陪练、社交机器人——FriendBench 这个任务就是模型早晚得过的一道真实关卡。重要的是搞清楚它在什么信号上靠谱、什么信号上会偏。

最好的那句话留在论文开头附近:「Reading a social situation often depends on behavior, not words alone.」模型学会了看行为,但还没学会看全。人类在这条赛道上还能再领先一阵子,但窗口期不会太长。