TikStance:首个面向TikTok政治对话的多目标立场检测多模态数据集
在短视频平台日益成为政治话语主阵地的背景下,计算社会科学领域面临着一个关键挑战:缺乏能够同时保留视听信息与层级对话结构的标注数据集。
2026年7月16日,Yazhi Zhang、Fuqiang Niu 和 Bowen Zhang 三位研究者向 arXiv 提交了题为 《TikStance: A Multimodal and Hierarchical Dataset for Multi-target Stance Analysis in TikTok Political Conversations》(arXiv: 2607.15240)的论文,正式发布了 TikStance——一个专为 TikTok 政治讨论设计的多模态、上下文感知的层级数据集。
一、数据集概况:161 个视频与近 1.4 万条评论
TikStance 的核心规模如下:
| 指标 | 数值 |
|---|---|
| 视频数量 | 161 |
| 评论数量 | 13,876 |
| 数据采集时间 | 2023年9月 – 2025年1月 |
| 覆盖对象 | Donald Trump、Joe Biden、Kamala Harris |
该数据集聚焦于 2024 年美国大选周期中的三大政治人物,覆盖了短视频平台中政治传播的典型场景。
数据结构设计
每个数据单元将 宿主视频及其元数据 与 父级链接的评论树 关联起来,形成"视频–评论–嵌套回复"的层级结构。这种设计使得模型能够在 视听上下文 与 对话上下文 双重维度中进行立场分析。
研究者的描述性分析显示,嵌套回复占所有评论的 23.3%,说明 TikTok 政治讨论中存在显著的层级对话特征。
二、标注方法与质量控制
标注方案
每个数据项使用 三分类体系 进行标注:
- Favor(支持)
- Against(反对)
- None(无明确立场)
标注覆盖两个层级:
1. 视频 → 目标人物 的立场
2. 评论 → 目标人物 的立场
标注者一致性
- 每项数据由 三名标注员独立标注
- 存在分歧的数据项会重新标注
- 最终 Krippendorff's α 达到:
| 政治人物 | Krippendorff's α |
|---|---|
| Donald Trump | 0.743 |
| Joe Biden | 0.723 |
| Kamala Harris | 0.722 |
α 值均超过 0.7,表明标注质量达到了可接受的较高一致性水平。
三、研究发现:目标依赖的立场分布差异
通过描述性分析,研究者在数据中发现了一些值得关注的现象:
- 立场分布具有目标依赖性——不同政治人物对应的视频中,支持与反对的比例存在显著差异;
- 对话深度存在差异——围绕不同政治人物的讨论,其评论树的层级结构和嵌套程度各不相同。
这些发现提示:在构建立场检测模型时,不能假设所有政治目标的讨论模式是统一的,模型需要具备对目标特征的敏感性。
四、应用场景与学术价值
TikStance 的发布为以下研究方向提供了高质量的数据基础:
- 多模态立场检测:结合视频内容与文本评论进行联合建模
- 政治传播研究:量化分析短视频平台上的政治话语生态
- 计算社会科学:研究层级对话结构中的意见形成与传播
- 上下文感知 NLP:利用父子评论关系提升语义理解能力
五、资源获取
- 论文 arXiv ID:2607.15240
- PDF 全文:View PDF
- 实验性 HTML 版本:HTML (experimental)
- DOI:10.48550/arXiv.2607.15240
本文基于 arXiv 论文 2607.15240 公开信息编写,所有数据与结论均来自材料原文,未引入外部信息。