teLLMe Why:用因果推断回答城市交通的“为什么”
teLLMe Why:用因果推断回答城市交通的"为什么"
核心事件
2026年7月16日,Qiwei Li 与 Jorge Ortiz 向 arXiv 提交了一篇题为 teLLMe Why (Ain't Nothing but a Jam): Exploratory Causal Analysis of Urban Driving Data 的论文(arXiv:2607.15254),并已被 NeurIPS 2025 Workshop on UrbanAI 录用。
背景:城市交通数据多,但因果问题难答
如今,交通机构可以获取大量源自视频的观测数据,用于研究交通安全与拥堵。然而,这些数据大多是在没有人为干预的情况下收集的——也就是说,它们是观察性数据。
这就带来了一个根本性的难题:如何回答因果性问题?
例如:
- "下雨会如何改变交通密度?"
- "高峰时段对事故率的影响有多大?"
这类问题无法通过简单的统计分析来回答,因为缺少对因果结构的显式建模。
系统方案:teLLMe 是什么?
作者提出了 teLLMe——一个面向城市驾驶数据集的探索性因果分析系统。
该系统的工作流程如下:
- 结构化事件表:从行车记录仪(dashcam)标注构建结构化事件表。
- 因果结构学习:结合 PC 算法、基于 Bootstrap 的稳定性检验,学习变量间的因果图(DAG)。
- 效应估计:使用线性回归和 DoWhy 框架进行查询特定的因果效应估计。
- 自然语言接口:用户提出自然语言问题,系统通过模式感知的 LLM 将其映射为结构化因果查询,允许用户指定处理变量(treatments)、结果变量(outcomes)和子群体(subpopulations)。
- 因果卡片(Causal Card):系统返回一张"因果卡片",汇总效应估计值、调整集、DAG 支持证据和假设说明,并附有一段简短的自然语言解释。
技术亮点
| 模块 | 方法 |
|---|---|
| 因果结构学习 | PC 算法 + Bootstrap 稳定性检查 |
| 效应估计 | 线性回归 + DoWhy 框架 |
| 自然语言理解 | 模式感知 LLM(schema-aware LLM) |
| 输出形式 | Causal Card + 自然语言解释 |
这套组合使得非因果学专家的用户也能以自然语言提问,并获得带有不确定性和建模选择透明展示的因果分析结果。
应用场景:以 BDD 数据集为例
作者在 BDD(Baidu Datasets)衍生的交通事件数据集 上进行了案例研究,teLLMe 成功揭示了以下因素之间合理的因果关系:
- 天气条件
- 高峰时段
- 交通密度
这些发现并非作为"最终结论"呈现,而是作为假设生成工具和专家推理辅助,帮助研究人员和决策者更深入地理解城市交通系统中的复杂互动。
定位与意义
论文作者明确指出:teLLMe 的设计目标是作为假设生成和专家推理的工具,而非提供确定性因果声明的来源。
这一立场在当前 AI 与数据分析领域具有重要参考价值:
- 因果推断的可及性:将复杂的因果结构学习与效应估计封装为用户友好的自然语言接口,降低了使用门槛。
- 不确定性透明化:系统显式展示建模选择和不确定性,避免了"黑箱"分析可能带来的误导。
- 探索性而非决定性:定位为"探索性"分析工具,鼓励用户在真实决策中结合领域知识进行交叉验证。
资源链接
- arXiv 页面:https://arxiv.org/abs/2607.15254
- DOI:https://doi.org/10.48550/arXiv.2607.15254
- PDF:https://arxiv.org/pdf/2607.15254
- HTML(实验版):https://arxiv.org/html/2607.15254v1
本文仅基于材料中可核对的事实编写,未引入任何外部信息。