TikTok-10M
收藏资源简介:
TikTok-10M是一个大规模数据集,包含1000万条来自TikTok的短格式帖子,用于视频理解、多模态学习和社交媒体内容分析。该数据集旨在为研究人员提供现代短视频内容的真实特征和模式,帮助弥合学术视频数据集与实际用户生成内容之间的差距。
TikTok-10M is a large-scale dataset containing 10 million short-form posts sourced from TikTok, designed for video understanding, multimodal learning and social media content analysis. This dataset aims to provide researchers with realistic characteristics and patterns of modern short-form video content, helping to bridge the gap between academic video datasets and real-world user-generated content.
TikTok-10M数据集概述
数据集描述
- TikTok-10M是一个包含1000万条TikTok短视频的大规模数据集,专为视频理解、多模态学习和社交媒体内容分析设计。
- 旨在填补学术视频数据集与实际用户生成内容之间的差距,提供现代短视频内容的真实模式和特征。
数据集结构
- 数据实例:每个实例包含以下信息:
- 帖子元数据(
id,url,desc,challenges,create_time等) - 帖子统计信息(
digg_count,comment_count,play_count等) - 兴趣点数据(
poi_name,address,poi_category等) - 音乐数据(
music_name,music_album等) - 视频数据(
vq_score,duration等)
- 帖子元数据(
数据集统计
- 总视频数:10,000,000
- 总时长:待计算
- 平均视频长度:待计算
- 类别分布:待计算
数据访问
- 通过Hugging Face datasets库提供。
- 建议根据需求使用流式传输或下载特定部分。
局限性及偏差
- 时间偏差:反映2025年春季的TikTok热门内容。
- 地理偏差:仅包含基于美国兴趣点的内容。
- 内容偏差:专注于热门内容。
- 质量差异:用户生成内容的生产质量差异显著。
伦理考虑
- 仅公开数据:仅包含公开可用数据。
- 隐私保护:不包含超出公开分享范围的个人身份信息。
- 内容审核:用户应根据用例实施适当的内容过滤。
- 负责任使用:应遵守TikTok的服务条款和适用法律。
引用
bibtex @dataset{tiktok_10m_2025, title={TikTok-10M: A Large-Scale Short Video Dataset for Video Understanding}, author={The Data Company}, year={2025}, url={https://huggingface.co/datasets/The-data-company/TikTok-10M}, note={A dataset of 10 million TikTok posts for multimodal learning and social media analysis} }




