论文速读|语言模型的「语义空间」里,关系几何长什么样?
做 NLP 或者跟向量打交道的人,心里多半都有这么个模糊的信念:一个好的语义空间里,词跟词之间的几何关系,应该能反映出它们之间的语义关系。「国王」减「男人」加「女人」约等于「女王」——这句话都快被念成咒语了。
但问题在于,这种关系几何到底稳不稳定?不同模型学出来的空间,对「对称」「不对称」「传递性」这些关系性质的编码能力,是不是一样的?最近 arXiv 上的一篇新论文(2607.26762)就在抠这个问题。
作者来自日本几个研究机构,包括 Zhihan Cao、Hiroaki Yamada、Simone Teufel 那些人。他们拿因果语言模型(比如 GPT)、掩码语言模型(比如 BERT)和扩散语言模型,在六种语义关系上做了一组实验。核心提问是三个:
- 跟同一个目标词有特定关系的词,在空间里是不是聚在同一片区域?不同关系的区域之间边界清晰吗?
- 语义空间的几何结构,在多大程度上能反映出关系本身的数学性质,比如对称性、不对称性、传递性?
- 对关系几何影响更大的,是词的表层形式(lexical),还是词的上下文(contextual)?
结果挺有意思,但不意外。论文的结论是:不对称关系的 relata 在空间里确实有相对清晰的区域划分,做得比对称关系好。但哪怕是表现最好的情况,这些性质也只是「中等程度」地被编码进空间了,谈不上完美。向量空间能抓到的语义关系,并没我们想的那么干净。
第三个问题可能是对搞模型选型的人最实用的:在不同的架构里,影响关系几何的信息来源不一样。因果 LM 更依赖词汇层面的信息,掩码 LM 和扩散 LM 则更依赖上下文。用 causal 模型做 embedding 跟用 masked 模型做,底层的关系编码逻辑可能就不一样,这会直接影响选模型做语义检索或者关系抽取时的效果。
论文整体是个实证报告,没有提出新模型或者新方法,更像是一次系统性的「摸底」。分布语义假设(distributional semantics)能学到的东西是有边界的,不是所有语义关系都能靠共现统计自然浮现出来,尤其对称关系那些。
正在用 embedding 做知识图谱补全、关系推理或者语义匹配的话,这篇论文给的提示是:别假设向量空间已经把关系结构编码好了。它在某些关系上靠谱,在某些关系上没那么靠谱。
论文目前还在审稿阶段(Manuscript under review),PDF 和 TeX 源码都在 arXiv 上可以拿。