把一条新闻压缩成「利好/利空」,到底浪费了多少信息
做量化的朋友应该都有过这种直觉:一条新闻丢进 sentiment 模型,出来一个 0.7 或者 -0.3,然后就没了。这个分数拿去跟股价回归一下,效果时好时坏,但总感觉浪费了很多东西——消息里明明说了是谁被调查、影响多大、多久落地、有多确定,结果一个情绪分全给揉碎了。
最近 arXiv 上有一篇来自国内团队的论文,标题很直白:Beyond Sentiment: Structured Information Extraction from Financial News。作者用 LLaMA-3.1-70B 从金融新闻里抽了六个语义维度,然后跟传统 sentiment 特征做了一遍严格的对比实验。结论不算意外,但数字很实在:光用 FinBERT 做情感分析,非线性模型下 F1 能到 0.576,但换成线性模型直接掉到 0.230——说明 sentiment 和收益之间的关系高度非线性,拿线性回归去拟合它,基本是白给。而 LLM 抽出来的结构化特征,虽然单独看每个维度都不如 FinBERT 强,但它们和 sentiment 之间有一条关键的性质:正交。
论文给了一个很直观的数字:两种信号来源的系统性分歧率高达 53.5%——一半还多的情况里,sentiment 说好的时候结构化特征其实在说「不确定」或「负面影响」,反过来也一样。这个分歧率不是噪声,是真信息。
两者合并,F1 提到了 0.600,而且这个提升在全部七类事件类型上一致显著(p < 0.0001)。消融实验进一步证实,非情感的结构化维度——事件类型、影响主体、时间范围、置信度——单独贡献了 ΔF1 = +0.019。单看这个增量不大,但问题在于它来自 sentiment 模型本身完全没覆盖的方向。
特征重要性分析显示,六个维度(包括事件类型、影响范围、时间跨度、置信度,加上情感相关的维度)的重要性分布在 14% 到 21% 之间,非常均匀。换句话说,每条新闻里的信息是六等份的,传统 sentiment 模型只拿到了其中一份左右的信号,剩下的全扔了。
把新闻压成一个利空/利好再去做预测,本质上是信息的有损压缩,而且损失率比想象的高得多。这篇论文没讲多复杂的故事,它只是用 LLaMA 把本来就在新闻里的结构化信息显式地拆了出来,然后用数据告诉你这些维度不可替代。
对做金融 NLP 或量化信息流的团队,实操含义很清楚:别只盯着 sentiment 模型刷 F1 了,花点功夫建一条结构化信息抽取的管线,哪怕只用它做特征拼接,收益也很扎实。而且 LLaMA-3.1-70B 跑 inference 的性价比现在也在快速下降,这条路已经不是什么大厂才能走的事了。
论文用的数据集是 FNSPID,41,618 条新闻-股票配对,实验设计很干净。如果非要说一个保留意见,那就是这个工作依赖 LLM 做 extraction,LLM 本身在金融实体和事件抽取上还有幻觉问题,论文没有详细讨论错误传播。但从信号发现的角度看,这个方向值得跟一跟。
最后说句实话:每次看到这类工作我都会想,那些靠「AI 分析市场情绪」收钱的 SaaS 产品,到底有多少其实只是把一个六维信号压缩成了一维,然后卖给了客户。