TikStance:首个面向TikTok政治对话的多目标立场检测多模态数据集

TikStance:首个面向TikTok政治对话的多目标立场检测多模态数据集

在短视频平台日益成为政治话语主阵地的背景下,计算社会科学领域面临着一个关键挑战:缺乏能够同时保留视听信息与层级对话结构的标注数据集

2026年7月16日,Yazhi Zhang、Fuqiang Niu 和 Bowen Zhang 三位研究者向 arXiv 提交了题为 《TikStance: A Multimodal and Hierarchical Dataset for Multi-target Stance Analysis in TikTok Political Conversations》(arXiv: 2607.15240)的论文,正式发布了 TikStance——一个专为 TikTok 政治讨论设计的多模态、上下文感知的层级数据集。


一、数据集概况:161 个视频与近 1.4 万条评论

TikStance 的核心规模如下:

指标 数值
视频数量 161
评论数量 13,876
数据采集时间 2023年9月 – 2025年1月
覆盖对象 Donald Trump、Joe Biden、Kamala Harris

该数据集聚焦于 2024 年美国大选周期中的三大政治人物,覆盖了短视频平台中政治传播的典型场景。

数据结构设计

每个数据单元将 宿主视频及其元数据父级链接的评论树 关联起来,形成"视频–评论–嵌套回复"的层级结构。这种设计使得模型能够在 视听上下文对话上下文 双重维度中进行立场分析。

研究者的描述性分析显示,嵌套回复占所有评论的 23.3%,说明 TikTok 政治讨论中存在显著的层级对话特征。


二、标注方法与质量控制

标注方案

每个数据项使用 三分类体系 进行标注:

  • Favor(支持)
  • Against(反对)
  • None(无明确立场)

标注覆盖两个层级:
1. 视频 → 目标人物 的立场
2. 评论 → 目标人物 的立场

标注者一致性

  • 每项数据由 三名标注员独立标注
  • 存在分歧的数据项会重新标注
  • 最终 Krippendorff's α 达到:
政治人物 Krippendorff's α
Donald Trump 0.743
Joe Biden 0.723
Kamala Harris 0.722

α 值均超过 0.7,表明标注质量达到了可接受的较高一致性水平。


三、研究发现:目标依赖的立场分布差异

通过描述性分析,研究者在数据中发现了一些值得关注的现象:

  1. 立场分布具有目标依赖性——不同政治人物对应的视频中,支持与反对的比例存在显著差异;
  2. 对话深度存在差异——围绕不同政治人物的讨论,其评论树的层级结构和嵌套程度各不相同。

这些发现提示:在构建立场检测模型时,不能假设所有政治目标的讨论模式是统一的,模型需要具备对目标特征的敏感性。


四、应用场景与学术价值

TikStance 的发布为以下研究方向提供了高质量的数据基础:

  • 多模态立场检测:结合视频内容与文本评论进行联合建模
  • 政治传播研究:量化分析短视频平台上的政治话语生态
  • 计算社会科学:研究层级对话结构中的意见形成与传播
  • 上下文感知 NLP:利用父子评论关系提升语义理解能力

五、资源获取


本文基于 arXiv 论文 2607.15240 公开信息编写,所有数据与结论均来自材料原文,未引入外部信息。