用 GPT-4.1 和 Mistral 搭法国法律知识图谱,这篇论文把流程摊开了
最近读到一篇法国 INRIA 的论文,讲怎么用 LLM 辅助本体工程和知识图谱构建,目标对象是法国法律里的维护保养法规。读下来就觉得,这活儿又具体又实用。
大多数人用 LLM 还是聊天、摘要、翻译。一线开发者更常面对的难题,是把一堆结构松散、术语混乱的领域文档变成可查询、可推理的结构化数据。法国这组研究人员遇到的就是这个问题——维护保养法规写得很复杂,单个案件要查半天,想集成到业务系统里更是噩梦。他们的做法分两步:先让 LLM 搭出本体结构,再用这个本体去驱动大规模知识图谱构建。整个过程是一个两阶段流水线,模型用的是 GPT-4.1 和 mistral-large-2512。
第一阶段是 open extraction,不预设模式,让 LLM 从分层采样的语料里自由抽取实体和三元组。抽完之后用 embedding 做融合,把意思相近但写法不同的标签归一化——这一步很关键,法律文本里同义表达太多,不归一后面没法用。然后从规整好的数据里归纳出候选属性,带上 domain 和 range 签名。
这个阶段相当于让 LLM 先替你摸一遍这个领域。不是把类目都定义好让模型去填空,而是让模型先暴露这个领域有什么概念、什么关系,人工再介入判断。这种半自动的本体工程思路,对很多垂直领域都适用——医疗条款、合规文档、合同审查,都可以用同样的思路。
第二阶段就务实多了。用第一阶段产出的本体去指导 full corpus 上的 closed extraction——不再是乱挖,而是对着本体定义好的类和关系去提三元组,然后直接生成 RDF 图。
论文用 GPT-4.1 和 mistral-large-2512 做了实验。类对齐几乎完整,融合后重复实体大幅减少;不到 20% 的三元组引入了未见过的属性,说明大部分抽取被本体约束住了。但 domain 和 range 签名的精确匹配率不算高——这意味着有些三元组虽然用了已定义的属性,但 domain 或 range 是新的组合。论文自己也指出,谓词归一化和新关系签名的验证,是下一步在工业场景里必须加固的环节。这套 pipeline 不完美,但在降低领域知识图谱构建成本上,方向是对的。
这篇论文对需要把大量领域文档变成结构化数据的团队最有用,法律科技、合规科技、工业文档管理,都属于这一类。两阶段流水线的设计思路本身就有工程参考价值——先用 LLM 做探索性抽取来理清领域结构,再用结构化知识去约束第二轮抽取,形成正向循环。
依赖 GPT-4.1 和 Mistral Large 意味着 API 成本不低,论文也基本没有讨论小模型或本地部署的方案。数据敏感度高、不能外传法律文档的场景,这个缺口还挺明显的。但作为方法论验证,这个工作把 LLM 在知识图谱工程里的角色讲得很清楚——降低本体工程的启动成本,而非替代本体工程师。
正在处理格式混乱的行业文档、想试试把它变成知识图谱的团队,这篇论文的 pipeline 可以翻一翻。
相关链接
- 论文地址:https://arxiv.org/abs/2607.24551
- SEMANTiCS 2026:https://2026.semantics.cc