news-crawler-LM:用小型长上下文模型解决新闻抓取结构化难题
在当前的互联网信息生态中,从网页中提取高质量、结构化的新闻内容始终是一项极具挑战性的任务。面对异构的 HTML 布局、不一致的标记方式以及大量的导航栏和广告等“样板”干扰,传统的抓取技术往往显得力不从心。
近日,Pascal Stolzenburg、Jonas Golde、Max Dallabetta 和 Alan Akbik 四位研究人员提出了一种名为 news-crawler-LM 的小型长上下文语言模型。该模型专为高质量新闻爬取设计,旨在平衡提取精度与计算成本之间的矛盾。相关论文已作为 KONVENS 2026 的议题提交至 arXiv (arXiv:2607.21284),并于 2026 年 7 月 23 日公开。
痛点:规则太死,大模型太贵
目前,新闻抓取领域主要存在两种主流方案,但各有局限:
-
基于规则的爬虫(Rule-based crawlers):
这类方法通过编码特定网站的结构来实现高精度的内容提取。然而,它们的泛化能力较差,面对新的发布者或网站改版时,通常需要人工编写和配置特定的规则,维护成本高昂。 -
大型语言模型(LLMs):
LLM 提供了更灵活的替代方案,能够显著减少对人工编写规则的需求。但是,由于其高昂的计算成本,限制了其在实际生产环境中的大规模部署和应用。
解决方案:news-crawler-LM
针对上述痛点,研究团队推出了 news-crawler-LM。这是一个经过微调的小型长上下文语言模型,其核心特点如下:
- 训练数据: 基于 Fundus 新闻抓取库中高质量且经过人工验证的提取数据进行微调。
- 功能目标: 将原始 HTML 直接转换为纯文本(Plaintext)和结构化 JSON。
- 结构化输出: 模型能够精准提取 headline(标题)、author(作者)、publication date(发布日期)以及 article body(正文)等关键字段。
这种“小型化”的设计使得模型在保持灵活性的同时,大幅降低了计算资源的消耗,使其更具实际部署的可行性。
实验结果:在结构化提取上表现优异
研究人员对 news-crawler-LM 进行了全面的实验评估,主要对比了其在 HTML-to-Markdown(HTML 转 Markdown)和 HTML-to-JSON 任务上的表现:
- HTML-to-Markdown 任务:
相比强基线模型,news-crawler-LM 的性能提升了 +4.8 BLEU 和 +6.1 METEOR。 - HTML-to-JSON 任务:
性能提升了 +2.2 BLEU 和 +4.1 METEOR。
这些数据表明,该模型在将非结构化的 HTML 转化为机器可读的结构化数据方面,具有显著优势。
局限性发现:
尽管在转换任务上表现出色,但研究团队也观察到一个值得注意的现象:在针对之前未见过的发布者进行的 HTML-to-plaintext(HTML 转纯文本)任务评估中,news-crawler-LM 的表现仅比其他的基于规则的解析库略好一些。这意味着在泛化到完全陌生的网站布局时,纯模型驱动的方法可能仍需结合其他策略。
开源与社区贡献
为了推动研究社区的发展,研究团队决定公开所有模型及相关工件(artifacts)。
对于 AI 从业者、开发者以及致力于构建数据采集基础设施的创业者来说,news-crawler-LM 提供了一个在“低成本”与“高精度”之间寻找平衡的新思路。它证明了针对特定垂直领域(如新闻抓取)微调小型长上下文模型,依然是一个极具价值的技术路线。
相关链接:
* arXiv 论文地址: https://arxiv.org/abs/2607.21284
* 实验性 HTML 版本: https://arxiv.org/html/2607.21284v1
* DOI 链接: https://doi.org/10.48550/arXiv.2607.21284
随着 Web 数据的日益复杂,像 news-crawler-LM 这样专注于解决具体工程痛点的专用模型,或许会比通用大模型在数据采集层发挥更直接的作用。