social-assistent-synthetic-data
收藏资源简介:
该数据集包含10,000条合成的TikTok视频元数据记录,旨在模拟视频内容(文本描述、标签)与病毒式传播表现(观看次数)之间的复杂关系。数据集设计用于病毒性预测(训练回归模型预测观看次数)、内容优化(分析哪些关键词和钩子驱动参与度)以及社交媒体分析(理解不同领域(健身、科技、食品等)的趋势)。数据包括视频描述、观看次数、类别、情感、持续时间、发布时间、创作者粉丝数、年龄、性别等特征。数据集通过复杂的逻辑管道生成,包括使用Qwen-2.5-3B-Instruct进行文本生成、病毒性评分、分层视图分配和噪声注入,以模拟现实世界的病毒性模式。
This dataset contains 10,000 synthetic TikTok video metadata records, designed to simulate the complex relationship between video content (text descriptions and hashtags) and viral propagation performance (view counts). It is intended for three core applications: viral prediction (training regression models to forecast view counts), content optimization (analyzing which keywords and hooks drive audience engagement), and social media analysis (understanding trends across diverse domains such as fitness, technology, food, and other categories). The dataset includes comprehensive features including video descriptions, view counts, content categories, sentiment labels, video duration, publish time, creator's follower count, creator age, and creator gender. It is generated via a sophisticated logical pipeline that encompasses text generation using Qwen-2.5-3B-Instruct, viral scoring, hierarchical view allocation, and noise injection to replicate real-world viral propagation patterns.
数据集概述:Synthetic TikTok Virality Dataset
1. 数据集基本信息
- 名称:Synthetic TikTok Virality Dataset
- 托管地址:https://huggingface.co/datasets/MatanKriel/social-assistent-synthetic-data
- 许可证:mit
- 任务类别:表格回归
- 语言:英语
- 标签:社交媒体、TikTok、病毒式传播预测、合成数据
- 规模:10k<n<100k
- 配置:默认配置
- 数据文件:
- 分割:训练集
- 路径:data/train-*
- 下载大小:877009 字节
- 数据集大小:2300078 字节
2. 数据内容与结构
- 记录数量:10,000 条
- 数据格式:表格文件(synthetic_tiktok_data.csv)
- 特征列(14列):
first_name:字符串,创作者名。last_name:字符串,创作者姓。age:整数,创作者年龄(经后处理转换为数值)。gender:字符串,创作者性别。followers:整数,创作者粉丝数。category:字符串,内容类别。sentiment:字符串,描述的情感基调。duration:整数,视频时长(秒)。hour_of_day:整数,发布小时(0-23)。day_of_week:字符串,发布星期几。description:字符串,视频完整描述(包括钩子、表情符号和标签)。views:整数,模拟的观看次数(预测目标变量)。viral_class:字符串,生成时使用的病毒性等级(内部/可选)。
3. 数据生成与处理
- 性质:完全合成的TikTok视频元数据记录,非爬取数据。
- 生成方法:使用复杂逻辑管道(
data_generator.py)合成,包含“病毒性引擎”逻辑。 - 文本生成:使用 Qwen-2.5-3B-Instruct 模型及自定义“角色提示”生成模仿真实TikTok俚语的描述。
- 病毒性模拟:
- 病毒性评分(0-100):基于钩子强度和情感触发等因素。
- 分层观看量分配:
- 病毒层(约33%):1M - 100M 观看量。
- 中层(约33%):100k - 2.5M 观看量。
- 低层(约33%):1k - 150k 观看量。
- 噪声注入:添加“有机抖动”(+/- 5%)和随机噪声。
- 后处理:
- 年龄修复:将原始分类年龄范围(如“16-20”)转换为整数平均值(如18)。
- 偏差校正与异常值注入(通过
fix_bias.py):- 日期交换:将10%的“高病毒性”视频移至工作日发布。
- 小时交换:将10%的“高病毒性”视频移至非高峰时段发布。
- 沉睡爆款:将5%的“低病毒性”视频观看量提升至>1M。
4. 数据集用途
- 病毒性预测:训练回归模型以预测观看次数。
- 内容优化:分析驱动参与度的关键词和钩子。
- 社交媒体分析:理解不同细分领域(健身、科技、美食等)的趋势。
5. 探索性数据分析(EDA)关键发现
- 特征分布:数据集在类别上平衡,但观看量遵循长尾分布(类似真实社交媒体)。
- 文本与情感分析:描述中普遍存在网络俚语。
- 语义嵌入空间:视频描述在PCA和t-SNE投影中显示出按类别的明显聚类。
- 类别与情感:某些类别(如旅行、美食)偏向积极情感,其他类别(如恶作剧)情感更混合/消极。
- 特征相关性:粉丝数和视频时长与观看次数常存在相关性。
- 时间与类别交互:分析了发布时间对不同类别观看量的影响。
- 标签使用:顶级标签与类别分布一致。
6. 使用方式
python from datasets import load_dataset dataset = load_dataset("MatanKriel/social-assistent-synthetic-data") df = dataset[train].to_pandas() df.head()




