LLM 太信任智能手表数据了:一篇论文量化了「衍生特征过度信任」有多严重

AI Agent 如果正靠智能手表的心率数据做判断,这篇东西得先看完。

它来自 arXiv 上刚挂出来的一篇论文,核心问题很简单但很少有人认真量化过:当 LLM 拿到的不是原始信号,而是一个「衍生测量值」——比如从 PPG 光学信号推算出来的心律——它有多大概率把这个推算结果当成确定事实来用?

论文给这个毛病起了个名字:Derived-Feature Over-Trust,衍生特征过度信任,简称 DFOT。

场景非常具体。作者用了生理信号做案例:PPG 就是智能手表/手环背面那个绿光传感器测的光电容积脉搏波,ECG 是心电图,金标准。PPG 可以推算心律,但推算结果受运动、佩戴松紧、皮肤颜色影响,没那么可靠。问题是,把 PPG 推算出来的心律喂给 LLM 做医疗决策或健康建议时,LLM 不会分辨自己拿到的是原始信号还是推算结果——它把衍生特征当事实用了。

这就是 DFOT。

论文设计了两组测试来抓这个问题。D1 测试:PPG 推算的心律跟离线 ECG 结果矛盾时,LLM 接不接受冲突信息?D2 测试:ECG 确认可靠的 PPG 心律,在误导性的病史提示下,LLM 会不会错误地拒绝它?

整套框架定义了五个量化指标:冲突过度信任率(COTR)、上下文诱导错误率(CIR)、正确修复率(CRR)、证据特定修复边际(ESRM)和效用危害率(UHR)。不展开每个指标了——这套框架可以用来精确衡量 LLM Agent 在什么情况下、以多大比例错信了不该信的衍生数据,以及错误的类型是接受了假阳性还是拒绝了真阳性。

有意思的是做法。作者没有直接给 LLM 灌 ECG 数据——那叫作弊——而是用了「特权模态蒸馏」:训练阶段让模型看 ECG 和 PPG 的配对信号,学到什么时候 PPG 可信、什么时候不可信,但推理阶段只用 PPG。ECG 是老师,但不进考场。

数据量不小:5 万条配对 PPG-ECG 记录。187 个病人的锁定协议测试上,基线方法在四个修复和特异性指标上提升了 1.82 到 6.69 个百分点,置信区间全部不跨零。唯一有代价的是 UHR——效用危害率,上升了 0.67 个百分点,但 95% 置信区间是 -0.4 到 +1.7,意味着这个副作用可能不存在。

代码已经开源了。GitHub 仓库在这里

这篇论文触及的问题远不止医疗场景。任何把 LLM 接到传感器、API、数据库查询结果上的 Agent 都会遇到同一个困境:LLM 没有天然的能力区分「原始事实」和「经过一次推算的事实」。给一个今天的天气温度,它当事实;给一个模型预测的明天温度,它也可能当事实——它不知道后者已经过了一层置信度衰减。

DFOT 的修复方案并不完美——那个 UHR 上升说明 trade-off 还在。它真正的贡献是给了这个现象一个名字和一套测量方法。有名字的问题,才可能被系统性地解决。

论文 25 页,3 张图,19 张表,代码可跑。在搭任何依赖 LLM 对「二手数据」做决策的 Agent 时,这篇值得花一个下午读透。

相关链接

  • 论文:https://arxiv.org/abs/2607.28421
  • 代码:https://github.com/Zongheng-Guo/When-Derived-Measurements-Mislead