MCP 服务器新用法:给数学知识库装个 LLM 聊天入口

arXiv 上刚挂了一篇论文,讲的事情很具体也很实用:怎么让 LLM 对数学模型少「胡说八道」,同时让数学家不用背 SPARQL 语法就能查数据库。

说的是一个叫 MathModDB 的数学模型知识库——Mathematical Model Database,底层是 Wikibase,跟 Wikidata 同一套开源基础设施。它的问题和所有语义网知识库一样:数据是结构化、带语义关系、经过人工策展的,算力价值很高,但入口太窄。你要么啃复杂的前端界面,要么手写 SPARQL,要么调 Wikibase API。对大多数研究者来说,这个门槛基本等于「知道有,但没用过」。

论文作者的做法是在知识库和 LLM 之间架一层 MCP(Model Context Protocol)服务器。MCP 这个词在 Agent 工具链讨论里越来越常见,但这篇的用法方向不同——不是让 LLM 调外部工具去完成任务,而是让它通过 MCP 服务器接入一个带向量索引的 schema 检索系统,外加一个 Steiner-tree-based join planner,把自然语言问题翻译成结构化的数据库查询。

操作流程大致是:你问「帮我查一下连续介质力学里描述某某过程的数学模型」,LLM 先去 vector index 里找到对应的 schema 片段,join planner 再把几个 schema 按数学关系拼成可执行的查询结构,去 MathModDB 里拉数据,最后 LLM 用自然语言回答。

论文重点强调了两个词:explainabilityepistemic safety。意思很直白——纯靠 LLM 训出来的知识是模糊的、有幻觉风险的;但把它接在一个策展知识库上,LLM 的角色就从「记忆体」变成了「翻译器」和「路由层」。它不负责记住数学模型的细节,只负责理解问题、找到正确的地方去取答案、再把答案翻回人话。

论文给了两个具体用例,一个来自连续介质力学,一个来自酶动力学。两种模型在数学表达和参数结构上差别很大,同一个架构都能处理。

这个架构不是绑死在 MathModDB 上的——它用的是 Wikibase 协议,凡是架在 Wikibase 上的知识库理论上都能适配。维基媒体生态里 Wikibase 实例覆盖了不少垂直领域——生物学、材料科学、文化遗产都有。这篇论文等于给这些知识库指了一条路:不用重构底层,加一层 MCP 服务器就能接上 LLM 交互。

论文目前是 preprint,提交给了 6th Wikidata Workshop @ ISWC,CC BY 4.0 开源。PDF 和 HTML 版都挂在 arXiv 上。

我读下来觉得最有意思的不是技术本身,而是它体现了 LLM 落地的一个真实趋势:模型越来越不靠自己记住事实,而是靠协议层去接靠谱的数据源。MCP 在这篇论文里的用法,本质上是把这个「协议层」做细了——schema 检索、查询规划、语义匹配都嵌进了服务器端,不只是简单调 API。这条路如果能跑通,对知识密集型领域的工具链设计会是一个有参考意义的案例。

这只是 preprint,还没看到真实用户反馈和延迟数据。但方向是对的:严谨的部分保持严谨,灵活的部分保持灵活,中间用协议层切开。