mental_health_social_media_dataset.csv
收藏资源简介:
该数据集包含10,000个合成的社交媒体帖子,具有真实的结构和噪声。特征包括:post_id(每个帖子的唯一标识符)、text(模拟的社交媒体帖子文本)、label(0表示正常,1表示心理困扰)、date(帖子的时间戳,时间序列格式)、likes(模拟的参与度指标)、shares(模拟的参与度指标)。数据集特点包括:真实的情绪语言(压力、焦虑、快乐等)、表情符号和标签以增强真实性、基于时间的分布(120天窗口)、参与度偏差(正常帖子平均获得更高参与度)。
This dataset contains 10,000 synthetic social media posts with realistic structures and inherent noise. The included features are as follows: post_id (unique identifier for each individual post), text (simulated text content of social media posts), label (0 stands for normal posts, 1 represents posts related to psychological distress), date (timestamp of the post in time-series format), likes (simulated engagement metric), shares (simulated engagement metric). The characteristics of this dataset are: authentic emotional language covering emotions such as stress, anxiety, joy, etc., emojis and hashtags added to enhance realism, a time-based distribution spanning a 120-day window, and engagement bias where normal posts achieve higher average engagement levels.
数据集概述
该数据集名为 Mental Health Trend Detection from Social Media,是一个用于从社交媒体帖子中检测和分析心理健康趋势的合成数据集。
数据集规模与形式
- 包含 10,000 条合成的社交媒体帖子数据,存储在文件
mental_health_social_media_dataset.csv中。 - 数据为结构化表格,涵盖时间序列信息,模拟了 120 天的时间窗口。
数据字段与标签
| 字段 | 描述 |
|---|---|
| post_id | 帖子的唯一标识符 |
| text | 模拟的社交媒体帖子文本内容 |
| label | 分类标签:0 表示正常心理状态,1 表示心理困扰迹象 |
| date | 帖子的时间戳(时间序列格式) |
| likes | 模拟的点赞数(互动指标) |
| shares | 模拟的分享数(互动指标) |
数据特点
- 包含真实感的情感语言(如压力、焦虑、快乐等)。
- 为增加真实性,融入表情符号和话题标签。
- 带有互动偏差:正常帖子的平均互动量更高。
项目用途与技术方法
- 任务类型:二分类文本分类。
- 核心算法:逻辑回归,使用 TF-IDF 向量化进行特征工程。
- 处理流程:数据生成 → 文本预处理(小写化、去噪、清除URL和符号) → 特征提取 → 模型训练 → 评估(精确率、召回率、F1分数) → 趋势检测(按日聚合预测结果)。
- 输出:模型分类报告、趋势分析表格、时间序列可视化图(展示120天内心理困扰率的变化)。
重要说明
- 数据集为完全合成,不涉及真实用户数据,仅用于教育、研究原型和作品集展示。
- 项目未来计划包括:替换为BERT等Transformer模型、引入情感评分、部署为Streamlit仪表盘等。




