古拉丁文和希腊文的语义搜索,几十秒的笔记本GPU训练就够了
前两天刷 arXiv,翻到一篇挺有意思的论文,发在 cs.CL 下面,讲的是怎么用无监督方法给古语言做语义分析——就是拉丁文、古希腊文这些,大部分人已经不用了的语言。
数字人文这几年积攒了大量由自动文本识别(ATR)产出的古籍语料,量大、杂、噪声多。问题是下游的语义分析——比如文本复用识别、对齐、语义搜索——全都依赖句子嵌入,而这些嵌入方法搬到古语言上基本失灵。通用的多语言编码器效果差,专门语言模型表征空间是各向异性的,而且根本找不到标注好的相似度数据来微调。数字人文学者手里有文本,但没法做语义层面的检索和比对。
这篇论文的作者——Théotime de la Selle,隶属 CNRS 的两个实验室——试了两套完全无监督的策略:TSDAE 和对比句子嵌入(CSE)。思路是用原始句子直接适配一个专门的分词级语言模型,做成面向特定语料的句子编码器。不需要任何标注数据。
测试用例选得很硬核:教父文献中的圣经复用——就是 Augustine、Jerome、Athanasius 这些教父在著作里引用或化用圣经段落的情况。数据量不小,2,935 条专家校验过的平行语料,拉丁文和古希腊文都有。作者把复用识别拆成两个子任务(二分类检测 + 对应段落检索),跟多语言编码器、专门模型、蒸馏模型甚至是有监督微调模型做了对比。
结果挺有意思。两套无监督编码器在所有基线之上全面胜出,而且各有侧重:TSDAE 在领域语料充足时检测最强,CSE 则在检索任务上领先,而且它在只需要 4–8k 条领域内原始句子就能达到最优——换算到训练时间,"在笔记本GPU上几十秒"。
论文里还给了一个实操层面的东西:整个流程——分词、微调、跨语料语义搜索——被打包进了在线工具 Paraphrasis。也就是说,一个文史研究者不需要自己写训练脚本,也能直接上手做古语料的语义检索和文本复用发现了。
我看完的感受是,这个工作踩准了两个痛点。第一个是古语言 NLP 的数据稀缺问题——没有标注对,没人手标也标不动。第二个是数字人文的实际部署门槛:跑一个 CSE 只要几十秒的笔记本 GPU 和几千条原始句子,这意味着古典学系、档案馆或者小型研究团队,不需要申请算力资源,自己就能做。
当然论文没有把话说满。它的评测集中在教父文献一个领域,扩展性还需要更多验证。无监督嵌入在语义粒度上有没有天花板,也要打。但至少这个方向给出了一条很务实的路:不需要标注、不需要大算力、不需要等到哪个大模型覆盖了拉丁文,而是直接拿手里的语料自己适配。
论文链接在 arXiv: 2607.24542。工具叫 Paraphrasis,翻一下论文应该能找到入口。