awesome-twitter-data
收藏资源简介:
这是一个Twitter数据集和相关资源的合集,涵盖Twitter数据的多个方面,包括推文文本、完整内容数据集、推文ID数据集等,并提供了许可证、大小和可用性信息。合集主题围绕Twitter数据收集,领域涉及社交媒体分析、新闻、事件(如COVID-19、阿拉伯之春)等,组织方式按数据类型分类,并包含资源描述和访问指南。
This is a curated collection of Twitter datasets and associated resources, covering multiple aspects of Twitter data including tweet texts, full-content datasets, tweet ID datasets, and more. It provides relevant information such as licenses, dataset sizes, and accessibility. The collection focuses on Twitter data collection, covering fields like social media analysis, journalism, and major events (e.g., COVID-19, the Arab Spring), is categorized by data type, and includes resource descriptions and access guides.
数据集资源总览
该页面是一个精选的 Twitter 数据集和相关资源列表,遵循 CC0 公共领域许可。列表按数据类型分类,每个条目通常包含名称、许可证、规模和可用性描述。
数据集分类
- 推文文本与完整内容数据集:提供完整的推文文本或 JSON 数据。示例包括 3 million Russian troll tweets、ArchiveTeam JSON Download of Twitter Stream (2011-2022)、Chirps 等。
- 推文 ID 数据集:仅提供推文 ID,需要用户自行从 Twitter API 获取完整内容。示例包括 COVID-19 Twitter Dataset、COVID-19-TweetIDs、CrisisLexT26 等。
- 标注与基准数据集:提供具有注释或任务标签的数据集。示例包括 Hate Speech and Offensive Language、Sentiment140、TweetEval、Twitter US Airline Sentiment 等。
- 元数据、评分与用户数据集:提供用户资料、评分、注释或衍生元数据。示例包括 MovieTweetings、Twitter User Sample (Tweets Loud and Quiet)。
- 图与网络数据集:提供用户、关注、提及、转发等网络数据。示例包括 ego-twitter、Higgs Twitter Dataset、The SNAP 2010 Dataset 等。
- 丢失或不可用的数据集:此类别列出已无法从已知来源获取的数据集,如 burger2011、calufa2011、twitter7 等。
其他列表与工具
- 其他列表:提供其他 Tweet ID 数据集目录 (DocNow Catalog)、免费 Twitter 数据集 (followthehashtag)、网络数据集目录 (Netzschleuder, KONECT) 以及数据平台上的搜索页面 (data.world, Kaggle, opendata.stackexchange)。
- 工具:分为数据收集工具 (如 twitter-dataset-collector、TwitterAPI.io、Xquik) 和分析工具 (如 OSU Twitter NLP Tools、sentimentstwitter)。
学术论文与文章
- 学术论文:列出了关于用户多视图嵌入学习、人口统计学预测等主题的论文。
- 文章与博客:包含 Twitter 情感分析、数据收集、#Gamergate 事件分析等实用指南和观点文章。




