Qwen2.5-7B 零样本读难民口述,比分词和 Embedding 更接近人的判断
SIGDIAL 2026 上有一篇论文,任务很具体但问题很底层:让模型判断两段移民叙述是否在讲同一种经历。它在检测「经验的互文性」(Experiential Intertextuality)——撒哈拉走廊和巴尔干走廊地理路线完全不同,但口述里反复出现警察暴力、蛇头剥削、危险过境、家庭分离。论文问了一个做 NLP 落地迟早会撞上的问题:Embedding 和表面匹配,到底能抓住多少这种深层相似?答案是抓不住多少。
这篇工作拿了 108 篇法语移民口述文本,分别来自两条迁移路线(撒哈拉和巴尔干),人工标注了 816 对句子级的互文性判断。标注者之间的一致性 Krippendorff's α = 0.27——说明这任务本身就很不确定,专家之间也在打折扣。他们轮番试了一堆免标注方法:词法基线、句子嵌入、词性结构特征、迁移主题词典、上下文叙事特征,以及 Qwen2.5-7B 和 Mistral-7B 在三种提示策略下的零样本打分。
所有基于表层相似的方法——包括现在几乎被默认塞进 RAG pipeline 的句子嵌入——跟专家判断的相关性都 ≤ 0.30。这意味着拿当前最好的 Embedding 模型去比这两条路线的难民叙述,基本只能抓到字面重叠,抓不到那些「明明写的是不同路线但处境完全一样」的瞬间。
零样本 LLM 走得更远一点。Qwen2.5-7B 在零样本下达到了 r = 0.38,是所有单一方法里最高的——而且是 7B 参数,不是 70B。Mistral-7B 零样本稍弱,但有个反常现象:加了 few-shot 示例后 Qwen 反而下降,Mistral 却大幅提升。这种「few-shot 帮倒忙」的情况在实际部署里不少团队都遇到过——示例和格式稍微不对路,模型不仅不学,反而被带偏。
论文还发现了一个跟叙事结构直接相关的信号:叙述里「出发阶段」的句子配对,经验互文性最高。这个位置信号单独就能做一定预测,最终被收进了那个 31 维特征的混合模型。混合模型跑到 r = 0.45,比最好的单一方法(Qwen 零样本)提升了 21%。
纯 Embedding pipeline 在需要识别「经历上的相似」时大概率不够用。Embedding 在语义搜索、文档去重、推荐召回这些场景里仍然可靠,但对叙事经验这种层面几乎是盲的。零样本 LLM 能摸到一点边,但离人类判断还有不小距离。把 LLM 评分、结构特征、主题先验、叙事位置全捏在一起,才勉强跑到一个可参考的水平。
不少做 Agent 日志分析、客服对话挖掘、用户反馈归因的团队,慢慢开始放弃纯 Embedding pipeline,转而在召回后面加一层 LLM 做「经验层面的粗聚类」——哪怕慢一点、贵一点,至少不会把「银行卡被吞」和「忘记密码」归成一类。
论文一作 Sakayo Toadoum Sari,合作单位包括法国多个大学和研究机构,被 SIGDIAL 2026 接收。数据是法语移民口述,方向是计算语言学里比较冷门的经验互文性检测。
相关链接:
- arXiv: https://arxiv.org/abs/2607.29188