MORFES 发布|你的模型在 MMLU 上高分,但能搞定希腊语名词变格吗?
希腊语是一种高度屈折的语言。一个名词有四个格,动词有一整套人称、时态、语态和体貌变化,形容词还得跟着名词变性变格变数。这堆规则如果靠死记硬背,工作量非常大,但如果靠规则推导,得真正理解语法。现在的大模型在这方面到底行不行?
大部分 LLM 评测都在测事实知识——MMLU、GPQA、各种 QA 数据集。模型答对一道题,可能是因为它记住了维基百科里的句子,不一定是它理解了背后的语法规则。尤其对于低频率词汇——那些在训练语料里出现不多的词——模型还能不能正确变形,才是真正检验「它懂语法」还是「它见过答案」的分水岭。
最近 arXiv 上有一篇论文(2607.28274),几位研究者搞了一个叫 MORFES 的基准测试,全称是 Morphological Open-class Recognition-and-Formation Evaluation Suite。它由 500 道专家验证的题目组成,专门测试模型对现代希腊语屈折形态的识别和生成能力。设计上刻意偏向低频词条——如果模型答对了,大概率是因为掌握了规则,而非碰巧记住了常见形式。
项目已开源:基准测试放在 Hugging Face Datasets,他们还一并发布了在形态测试上领先的模型 Sophea-Genesis-1 的权重。
为什么专盯希腊语
现代希腊语的屈折系统相当完整且规则性强,但又远比英语复杂。名词分三性四数格,动词的变位体系覆盖多种时态、语气和体。如果一个模型能够处理好希腊语的屈折形态,说明它对类似语言(俄语、阿拉伯语、芬兰语、土耳其语等)也有更高概率迁移过去。
反过来,如果模型在 MORFES 上表现不佳,说明它对屈折丰富的语言更多是「猜」出来的,谈不上按规则推导。这对任何在非英语市场上做产品的团队都是一个信号:模型的所谓「多语言能力」,在语法层面可能远没有想象的那么深。
测试里放了哪些模型
论文评测了一系列开放模型,覆盖从 Qwen3、DeepSeek-R1、Magistral 到 Kimi K2 等主流开源权重模型。这些模型在 MORFES 上的表现并不差,但彼此之间的差距不小。
表现最好的是他们自己训练的 Sophea-Genesis-1。论文的说法是,这个模型在屈折形态上领先,同时在通用能力上与同类规模的模型持平。这是一次有针对性的改进,并非用通用能力换来的。
对开发者的参考价值
面向希腊语用户的 AI 产品中,MORFES 的题目就是生产环境里会真实出现的问题——用户输入一个名词,系统需要正确理解它的格和数;或者写作助手需要给一个生僻动词配上正确的变位。如果模型在这些底层规则上出错,上层应用再聪明也补不回来。
开源模型越做越大,各家都在强调多语言覆盖的提升,但「能读」和「懂语法」之间隔着一层屈折形态。MORFES 这种针对性测试提醒我们,多语言评测不能只停留在 QA 准确率上。还需要知道模型是不是只在高频词上管用,低频词一来就露馅。
论文本身只有 12 页、8 张表格,数据直接开源,模型权重也可以下载。如果想给自己的模型或者选型做个摸底测试,把 MORFES 跑一遍,可能比再刷一遍 MMLU 更有信息量。