SINT-Flow:用 5 个 LLM 操作符把 Schema 整合做成自动化,Qwen 也能跑
要在数据工程里挑一个最烦人又绕不过的活儿,schema 整合应该排前三。两张表字段对不上、同一个东西叫法不一样、更糟的是源表里客户、订单和产品信息全塞在同一行——传统工具到这步基本废了,得先人肉拆一遍才能继续。
论文里把这个叫 denormalized tables,一张表描述多个实体类型。现实世界里这种表才是常态——CRM 导出的、财务给的、第三方接进来的,没有一张是按第三范式设计的。现有的自动化 schema 整合工具基本都不处理这个:它们假设数据已经拆好、标注好、归拢好才喂进来。等于说脏活还是落到人头上,工具只管最后那步对齐。
Keti Korini 和 Christian Bizer 新出的 SINT-Flow 专门处理这个问题。
框架用 5 个 LLM 操作符 搭了一条全自动流水线:输入任意多张源表,输出一个统一的全局 schema。流程大致是:先做实体类型检测,把混在一起的多实体拆成单独的 relation;然后做属性检测和 schema 映射,把不同源的字段对齐到同一个语义下;最后加一个 review loop,让 LLM 把映射结果再过一遍,自己审自己。论文还加了 self-consistency 策略——同一操作多次采样、取多数结果——用来压幻觉。
为了测评,作者同时出了 SINT-Bench:10 个整合任务、93 张关系表,专门覆盖了传统方法头疼的 denormalized 场景。结果用 GPT-5.2 和开源模型 Qwen-3.6-27B 都跑了,实体类型检测 F1 不低于 96%,属性检测不低于 85%,schema 映射不低于 83%。开源模型的成绩跟 GPT-5.2 差距不算大。不想走闭源 API 或有数据合规要求的,Qwen 版本也能顶上。
消融实验显示,self-consistency 和 review loop 这两层不是装饰。去掉之后映射精度掉得明显,尤其在表多、实体杂的场景下。靠一次生成就想把 schema 整合做对,还是不太放心——得多跑几遍、再自己审一遍才算稳。
如果这套流程能稳定落地,最直接受益的是那些天天跟跨部门报表、历史数据库、合并数据源打交道的人。以前一个字段一个字段对的活儿,现在 LLM 拆好、对好、审好,你只需要在最后看一眼 diff。
这篇目前还是 arXiv 预印本,SINT-Bench 和代码暂未看到公开仓库链接。框架跑在 GPT-5.2 和 Qwen-3.6-27B 上,算力开销得自己掂量。自动化程度越高,review 环节越关键——LLM 自己审自己能不能审出真问题,还是个 open question。思路没问题,但离当成一个「跑完就信」的生产工具还有距离。等代码和 benchmark 放出来,上手跑一遍才知道有没有论文写的那么稳。