遇见数据集

TSN4PI Datasets

收藏
arXiv2026-08-19 更新2026-08-20 收录
数据链接:
官方服务:

资源简介:

TSN4PI Datasets是由香港科技大学(广州)、中国科学技术大学和香港科技大学联合构建的两个大规模政治意识形态数据集,旨在解决社交媒体政治话语分析中的数据稀缺问题。其中,新闻数据集包含约23万篇来自AllSides的新闻文章,覆盖2017至2022年,并附有连续意识形态评分;社交媒体数据集包含来自X(Twitter)平台约7700万条帖子,涉及4545名用户,时间跨度从2007至2022年。数据集通过爬取和弱监督标注方式创建,新闻文章继承来源的意识形态标签,社交媒体帖子则通过用户互动和内容分析进行标注。该数据集主要用于训练和评估政治意识形态检测与演化预测模型,助力研究政治极化、回声室效应及意识形态动态,为非商业研究提供公开资源。

TSN4PI Datasets are two large-scale political ideology datasets jointly constructed by The Hong Kong University of Science and Technology (Guangzhou), University of Science and Technology of China, and The Hong Kong University of Science and Technology, aiming to address the data scarcity issue in political discourse analysis on social media. The news dataset contains approximately 230,000 news articles from AllSides, spanning from 2017 to 2022, with continuous ideological scores attached. The social media dataset includes around 77 million posts from the X (formerly Twitter) platform, involving 4545 users, with a time span from 2007 to 2022. The datasets were created through web crawling and weakly-supervised annotation: news articles inherit the ideological tags from their original source, while social media posts are annotated via user interaction and content analysis. These datasets are primarily used for training and evaluating models for political ideology detection and evolution prediction, facilitating research on political polarization, echo chamber effects, and ideological dynamics, and serving as an open resource for non-commercial research.

创建时间:
2026-08-19
搜集汇总
数据集介绍
构建方式
TSN4PI数据集是针对社交媒体政治意识形态追踪研究而构建的大规模语料库,涵盖三个子集:新闻政治意识形态数据集、用户中心推特数据集和Truth Social数据集。新闻数据集基于AllSides的媒体偏见评分,抓取约23万篇新闻文章,覆盖2017至2022年,按来源评分映射至五级意识形态标签。推特数据集通过关键词种子查询识别4,545位用户,检索其2007至2022年间完整推文历史,共约7,672万条推文,包含丰富的元数据(如转帖、点赞、引用)。Truth Social数据集包含超过45万用户和82万条'Truths',以及最活跃65,536用户的完整历史。所有数据均经脱敏处理,以脱水形式发布,用户可通过平台API重新水化文本。
特点
TSN4PI数据集具有显著的大规模性、时间跨度和用户中心性。推特数据集提供16年的用户完整时间线,支持长期纵向分析,这是多数现有数据集所缺乏的。数据覆盖不同意识形态群体,且包含每日生活推文作为非政治内容,有助于区分政治与非政治信号。新闻数据集具备平衡的意识形态分布,支持弱监督学习。Truth Social数据集提供了右倾平台的独特样本,便于跨平台对比。所有数据集均包含用户交互特征(如转帖、提及),为构建时序图网络提供基础。
使用方法
TSN4PI数据集支持多种研究用途。新闻数据集可作为源域数据,用于训练意识形态检测模型,结合风格迁移和域适应技术提升对社交媒体噪声数据的鲁棒性。推特和Truth Social数据集可构建时序交互图,用于分析用户意识形态的演变和预测未来倾向。研究者可利用PIDN检测模型获取用户及帖子的意识形态分数,再通过PIPN模型(如TGN、JODIE)预测用户未来意识形态轨迹。数据集以脱水形式发布,提供ID和派生标注(如相关性标签、意识形态分数),用户需遵循平台API条款进行数据重新水化,以获取原始文本。
背景与挑战
背景概述
随着社交媒体在政治话语中的核心地位日益凸显,个体意识形态的表达与传播对社会极化现象产生了深远影响。为深入剖析这一动态过程,香港科技大学(广州)、中国科学技术大学等机构的研究人员于2026年构建了TSN4PI数据集,旨在系统追踪社交媒体上政治意识形态的演化轨迹。该数据集涵盖约23万篇来自AllSides新闻源的意识形态标注文章、近7700万条来自4,545名X(原Twitter)用户自2007年至2022年的完整推文历史,以及超82万条Truth Social平台帖子,为政治意识形态检测与预测研究提供了大规模、长时序、多平台的数据支撑。TSN4PI的发布填补了该领域数据稀缺的空白,为研究政治极化、回声室效应及意识形态演变提供了坚实基础,其影响力已延伸至计算社会科学与自然语言处理的交叉方向。
当前挑战
在政治意识形态追踪领域,TSN4PI数据集的构建与应用面临着多重挑战。领域内,数据获取受限,平台政策导致大规模高质量标注数据匮乏;社交媒体内容嘈杂,大量无关日常帖子与政治话语交织,需有效过滤;意识形态具有动态时变性,传统静态模型难以捕捉用户立场随时间的演变。构建中,需克服跨域差异,将结构化的新闻文本风格迁移至非正式社交媒体语言,并利用无监督域适应技术弥合分布鸿沟;大规模数据处理对计算资源提出极高要求,超千万级推文的采集、清洗与存储需精细工程化;同时,标注偏差与隐私保护亦是不可回避的难题,需在保证数据质量与伦理合规间寻求平衡。
常用场景
经典使用场景
TSN4PI数据集为政治意识形态的检测与追踪研究提供了丰富的数据基础。其核心使用场景在于构建和评估政治意识形态检测与预测模型,具体包括利用大规模新闻语料进行跨领域的情感与立场迁移学习,以及基于用户历史发帖数据训练时序图神经网络以预测意识形态的动态演变。该数据集覆盖多个平台(如X与Truth Social),支持跨平台对比分析,为政治传播学、计算社会学等领域提供了宝贵的实证素材。
衍生相关工作
围绕该数据集,已衍生出多项极具影响力的研究。研究者基于其新闻语料,结合大语言模型进行文体迁移与无监督域适应,显著提升了跨领域意识形态检测的精度。另有工作利用其用户交互图结构,开发了时序图神经网络模型(如TGN、JODIE)用于预测意识形态演变,并揭示了“高度波动用户趋向中心”的反直觉现象。此外,该数据集还催生了跨平台对比研究,为理解不同社交媒体生态下的极化差异提供了新的实证视角。
数据集最近研究
最新研究方向
社交媒体政治意识形态追踪是当前计算社会科学与自然语言处理交叉领域的前沿热点,其研究焦点正从静态的立场分类转向对个体意识形态动态演化轨迹的精细建模。TSN4PI数据集通过整合超过7600万条Twitter推文、Truth Social平台数据以及AllSides新闻语料,为这一方向提供了独特的大规模、长时序、跨平台支撑。其研究意义在于,一方面利用大语言模型的风格迁移与无监督域适应技术,解决了社交媒体非正式文本与新闻语体之间的分布偏移问题,实现了高精度的政治相关性过滤与意识形态强度打分;另一方面借助时序图神经网络捕捉用户交互的演化模式,实现了对用户未来意识形态倾向的预测。该数据集的价值还体现在对经典‘回音室’假说的实证挑战上——研究发现意识形态波动最大的用户并非日益极化,而是趋向中间立场,这一结论为理解网络政治生态的复杂性提供了新视角,也推动了政治传播学与动态图学习方法的深度融合。
相关研究论文
  • 1
    Against Political Polarization: A Unified Framework for Tracing Evolving Political Ideologies on Social Media香港科技大学(广州); 中国科学技术大学; 香港科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务