Hysterical Literature Data
收藏资源简介:
该数据集包含了从Douyin平台抓取的关于Hysterical Literature(发疯文学)的数据,包括用户名、用户位置、评论文本、评论点赞等,用于分析和分类Hysterical Literature文本。
This dataset comprises data scraped from the Douyin platform pertaining to Hysterical Literature, encompassing user names, user locations, comment texts, and comment likes, intended for the analysis and classification of Hysterical Literature texts.
数据集概述
本数据集项目名为“Data-Mining”,专注于挖掘“Hysterical Literature”(发疯文学)的数据。项目内容包括数据抓取、文本分类、关联规则挖掘、API集成及模型微调等多个方面。
数据集内容
-
数据抓取:从抖音平台抓取与“Hysterical Literature”相关的数据,包括用户名、用户位置、评论文本、评论点赞数等。
-
卷积神经网络分类器:构建CNN分类器,用于区分“Hysterical Literature”文本与其他类型文本。
-
关联规则挖掘:应用关联规则挖掘技术,揭示“Hysterical Literature”文本中的模式和关系。
-
ChatGLM3 API集成:调用ChatGLM3 API对“Hysterical Literature”文本进行分类,包括场景识别、情感分类、情感评分及发疯程度评分。
-
ChatGLM3微调:使用第四项任务生成的提示进行ChatGLM3模型的全面微调,以生成准确且上下文相关的“Hysterical Literature”文本。
数据集应用
- Web爬虫:通过修改
crawler.py中的视频ID,运行脚本抓取评论数据,并存储为CSV文件。 - 生成词云:运行
wordcloud.py,基于抓取的数据生成词云图片。 - 情感分析:运行
emotion_analysis.py,分析文本情感。 - CNN分类器:在
opinion_analysis/demo.py中替换CSV数据,运行脚本进行文本分类。 - 关联规则挖掘:运行
fpgrowth.py,使用FP-Growth算法挖掘频繁项集。 - ChatGLM3 API调用:运行
chatglm3-api&finetune/demo_crazy.py,使用API对文本进行分类。 - ChatGLM3全面微调:准备数据,运行相关脚本进行模型微调,以提高生成文本的准确性和稳定性。
数据集结果
- 微调结果:展示了微调前后ChatGLM3模型生成“Hysterical Literature”文本的效果对比,包括简单提示和分类提示的微调结果。
- 泛化能力:展示了微调后的ChatGLM3模型将普通文本转换为“Hysterical Literature”版本的能力。
数据集依赖
- 软件要求:需安装Python及相关库,如wordcloud、jieba、jiagu、keras、numpy等。
- 文件要求:需下载并放置
chromedriver.exe、cn_stopwords.txt、font.ttf等文件。 - ChatGLM3部署:需确保ChatGLM3成功部署,并参考相关文档进行操作。
数据集贡献
本项目为团队合作成果,上传部分代表个人贡献。未来将上传更多团队成员贡献的内容,包括使用K-means聚类、层次聚类、多元线性回归分析以及ARIMA方法预测“Hysterical Literature”的未来流行趋势。




