OpenRTAG:面向文本属性图鲁棒学习的综合基准测试
OpenRTAG:为低质量文本属性图学习提供统一鲁棒性评估基准
在现实世界的图数据中,文本属性图(Text-Attributed Graphs, TAGs) 是一种将关系结构与丰富的节点文本相结合的重要数据形式。然而,真实场景下的 TAGs 往往并不完美,其质量问题通常表现为文本、结构和标签三个维度的稀疏性、噪声和失衡。这些退化现象构成了九种典型的退化场景,对 TAG 的学习效果产生显著影响。
针对现有研究在退化类型、数据集、任务和模型家族方面证据碎片化、导致 TAG 鲁棒性理解不足的问题,Yuze Dai 等人提出并发布了 OpenRTAG。这是一个专为文本属性图学习设计的鲁棒性基准测试框架。
OpenRTAG 的核心架构与功能
OpenRTAG 将 TAG 的质量问题组织为一个统一的 3 × 3 分类体系,并支持跨九个 TAG 数据集和三个下游任务的标准化评估。该基准测试旨在提供一个标准化的测试平台,以理解在现实低质量设置下 TAG 学习的鲁棒性。
具体而言,OpenRTAG 执行了以下系统性评估:
- 场景有效性与模型敏感性分析:验证不同退化场景对模型的影响及模型对这些场景的敏感程度。
- 多模型家族对比:比较传统 GNN(图神经网络)、LLM-GNN(大语言模型与图神经网络结合)以及代表性 GFM(通用图模型)的表现。
- 基线方法评估:调查与特定场景匹配的基线方法的有效性、效率和鲁棒性。
- 复合场景研究:进一步考察模型在复合退化场景下的行为特征。
关键事实与数据
- 论文标题:OpenRTAG: A Comprehensive Benchmark for Robust Text-Attributed Graph Learning under Data Quality Degradation
- 作者团队:Yuze Dai, Zhihan Zhang, Yan Zhao, Ruoyu Wu, Xunkai Li, Zekai Chen, Qiangqiang Dai, Hongchao Qin, Ronghua Li
- 发布平台:arXiv (cs.AI)
- 提交日期:2026年7月21日
- arXiv ID:2607.19108
- 论文篇幅:9页,包含10张图表和3个表格
- 访问链接:
- arXiv 摘要页:https://arxiv.org/abs/2607.19108
- PDF 下载:https://arxiv.org/pdf/2607.19108
- 实验性 HTML 版本:https://arxiv.org/html/2607.19108v1
- DOI:https://doi.org/10.48550/arXiv.2607.19108
行业意义
随着图数据与大语言模型的融合应用日益广泛,数据质量成为影响模型性能的关键瓶颈。OpenRTAG 的出现填补了该领域缺乏统一鲁棒性评估标准的空白。对于 AI 从业者和开发者而言,该基准测试不仅提供了评估现有模型在低质量数据下表现的工具,也为设计更具鲁棒性的新型图学习算法指明了方向。通过标准化评估九个数据集和三种下游任务,OpenRTAG 有助于推动 TAG 学习在现实复杂环境中的落地与应用。