遇见数据集

awesome-twitter-data

收藏
github2026-05-31 更新2026-06-04 收录
官方服务:

资源简介:

这是一个Twitter数据集和相关资源的合集,涵盖Twitter数据的多个方面,包括推文文本、完整内容数据集、推文ID数据集等,并提供了许可证、大小和可用性信息。合集主题围绕Twitter数据收集,领域涉及社交媒体分析、新闻、事件(如COVID-19、阿拉伯之春)等,组织方式按数据类型分类,并包含资源描述和访问指南。

This is a curated collection of Twitter datasets and associated resources, covering multiple aspects of Twitter data including tweet texts, full-content datasets, tweet ID datasets, and more. It provides relevant information such as licenses, dataset sizes, and accessibility. The collection focuses on Twitter data collection, covering fields like social media analysis, journalism, and major events (e.g., COVID-19, the Arab Spring), is categorized by data type, and includes resource descriptions and access guides.

创建时间:
2018-08-19
原始信息汇总

数据集资源总览

该页面是一个精选的 Twitter 数据集和相关资源列表,遵循 CC0 公共领域许可。列表按数据类型分类,每个条目通常包含名称、许可证、规模和可用性描述。

数据集分类

  • 推文文本与完整内容数据集:提供完整的推文文本或 JSON 数据。示例包括 3 million Russian troll tweets、ArchiveTeam JSON Download of Twitter Stream (2011-2022)、Chirps 等。
  • 推文 ID 数据集:仅提供推文 ID,需要用户自行从 Twitter API 获取完整内容。示例包括 COVID-19 Twitter Dataset、COVID-19-TweetIDs、CrisisLexT26 等。
  • 标注与基准数据集:提供具有注释或任务标签的数据集。示例包括 Hate Speech and Offensive Language、Sentiment140、TweetEval、Twitter US Airline Sentiment 等。
  • 元数据、评分与用户数据集:提供用户资料、评分、注释或衍生元数据。示例包括 MovieTweetings、Twitter User Sample (Tweets Loud and Quiet)。
  • 图与网络数据集:提供用户、关注、提及、转发等网络数据。示例包括 ego-twitter、Higgs Twitter Dataset、The SNAP 2010 Dataset 等。
  • 丢失或不可用的数据集:此类别列出已无法从已知来源获取的数据集,如 burger2011、calufa2011、twitter7 等。

其他列表与工具

  • 其他列表:提供其他 Tweet ID 数据集目录 (DocNow Catalog)、免费 Twitter 数据集 (followthehashtag)、网络数据集目录 (Netzschleuder, KONECT) 以及数据平台上的搜索页面 (data.world, Kaggle, opendata.stackexchange)。
  • 工具:分为数据收集工具 (如 twitter-dataset-collector、TwitterAPI.io、Xquik) 和分析工具 (如 OSU Twitter NLP Tools、sentimentstwitter)。

学术论文与文章

  • 学术论文:列出了关于用户多视图嵌入学习、人口统计学预测等主题的论文。
  • 文章与博客:包含 Twitter 情感分析、数据收集、#Gamergate 事件分析等实用指南和观点文章。
搜集汇总
数据集介绍
awesome-twitter-data 数据集图片
构建方式
在社交网络数据研究日益蓬勃的背景下,awesome-twitter-data 作为一个精心编撰的 Twitter 数据集资源索引应运而生。该数据集并非由单一来源采集,而是由维护者通过社区协作的方式,系统性地收集、整理并归类了来自学术机构、研究项目以及开放数据平台的各类 Twitter 相关数据集。每个收录的条目均遵循统一的格式规范,清晰标注了数据集名称、许可证类型、数据规模以及可用性状态,例如完整文本、仅推文ID、标注数据、元数据或图结构数据等。这种结构化的构建方式,使得研究者能够根据自身需求快速定位并评估适用的数据资源。
使用方法
使用 awesome-twitter-data 的方法直观而高效。研究者首先可根据自身的任务需求,在诸如‘推文文本与完整内容数据集’或‘标注与基准数据集’等分类中浏览。每个条目的描述中均包含了数据集的可用性信息,例如是提供‘完整文本’、‘推文ID’还是‘图结构’数据。对于仅提供推文ID的数据集,用户需利用配套的工具(如列表中的 twitter-dataset-collector)通过 Twitter API 进行水合(hydrate)操作以获取完整内容。此外,该列表还提供了数据收集、分析工具以及相关学术论文的链接,形成了一个从数据发现、获取到分析的一站式参考体系,有效降低了研究者的入门门槛。
背景与挑战
背景概述
社交媒体数据,尤其是Twitter(现称X)平台上的海量用户生成内容,已成为自然语言处理、社会计算及舆情分析等领域不可或缺的研究资源。由Shay Palachy于CC0许可下维护的awesome-twitter-data项目,自创建以来系统性地收录了涵盖推文文本、用户元数据、社交网络图及标注基准等多元类型的公开数据集。该资源库通过结构化分类(如完整文本、推文ID、标注数据等)为研究者提供了便捷的数据发现途径,其引用的数据集广泛涉及虚假信息检测、情感分析、危机响应及人口统计学预测等核心研究问题,对推动社交媒体计算方法的演进具有重要的支撑作用。
当前挑战
该领域面临的核心挑战在于数据可用性与研究可复现性的矛盾。一方面,Twitter API政策收紧与平台数据访问限制导致大量历史数据集(如burger2011、twitter7)永久丢失,部分数据集仅保留推文ID需额外水化处理,增加了使用门槛。另一方面,数据构建过程中存在标注一致性难题,例如情感分析数据集Sentiment140采用自动表情符号标注,其噪声可能影响下游任务性能;危机事件数据集(如CrisisLexT26)的灾难类型覆盖有限,难以泛化至新场景。此外,社交网络图数据的规模与隐私合规要求(如GDPR)之间的张力,以及多语言、多模态数据的整合需求,持续考验着数据集的时效性与生态可持续性。
常用场景
经典使用场景
awesome-twitter-data 作为 Twitter 数据集的综合索引库,其最经典的使用场景是为社会科学与计算语言学研究提供一站式的数据资源导航。研究者可通过该库快速定位到涵盖灾难应对、政治舆情、公共卫生等领域的标注数据集,例如 CrisisLexT26 用于危机事件分析、COVID-19 Twitter Dataset 用于疫情传播研究,以及 SemEval 系列基准数据集用于情感与立场检测任务。该索引库通过结构化分类(如全文文本、推文 ID、标注数据、网络图等)降低了数据发现门槛,使学者能高效复用已有资源,避免重复采集,从而聚焦于核心研究假设的验证。
解决学术问题
该数据集索引库解决了学术研究中长期存在的 Twitter 数据分散、格式不一与访问困难等关键问题。通过系统化整理超过 60 个高质量数据集及其许可协议、大小与可用性信息,它消除了研究者因数据碎片化而耗费的大量筛选成本。例如,Sentiment140 与 TweetEval 为情感分析提供了标准化基准,PHEME 系列则推动了谣言检测与真实性分类领域的进展。这些资源使自然语言处理、社会网络分析与计算社会科学领域的研究者能够开展可重复、可比较的实验,显著提升了学术成果的严谨性与跨研究可比性。
实际应用
在实际应用中,awesome-twitter-data 索引的数据集被广泛部署于舆情监控、品牌管理与公共安全等场景。例如,Twitter US Airline Sentiment 数据集被企业用于客户满意度分析,通过情感分类模型实时追踪航班服务反馈;CrisisNLP 与 CrisisLexT26 则被应急管理机构用于灾害期间的信息抽取与态势感知,辅助决策者快速识别关键事件。此外,基于 GeoCoV19 等地理标记数据集的工具已应用于公共卫生部门追踪疫情热点,而 MovieTweetings 等元数据集则为推荐系统研究提供了真实的用户评分行为数据。
数据集最近研究
最新研究方向
在社交媒体与自然语言处理交叉领域,awesome-twitter-data所汇聚的数据集正推动着前沿研究的纵深发展。当前,围绕COVID-19大流行衍生的推特语料库(如COVID-19 Twitter Dataset、CoVaxxy)成为公共卫生舆情监测与疫苗话语分析的核心资源,研究者借此追踪 misinformation 的传播模式与公众情绪演化。同时,针对仇恨言论、谣言检测与立场分类的标注数据集(如Hate Speech and Offensive Language、PHEME系列)在虚假信息治理与社交网络鲁棒性研究中扮演关键角色,与近年来全球范围内的选举干预、网络暴力等热点事件紧密呼应。此外,大规模图数据集(如SNAP 2010)支撑着社交影响力建模与信息级联预测,而TweetEval等基准测试集则统一了多任务评估范式,加速了预训练语言模型在推特领域的适配与优化。这些资源不仅夯实了计算社会科学的实证基础,也为实时危机响应、个性化推荐等应用场景提供了可复现的数据基石,其开放共享精神更深刻影响了学术生态的协作方式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务