B站视频评论区对话数据集
收藏资源简介:
本数据集是通过爬取B站视频评论区的对话构建而成,用于大语言模型的训练。数据集包含了多样的对话内容,反映了用户在B站视频下的真实交流情况。
This dataset is constructed by scraping dialogues from the comment sections of Bilibili videos, intended for the training of large language models. It encompasses a diverse range of conversational content, accurately reflecting the genuine interactions among users beneath Bilibili videos.
基于B站视频评论区构建对话数据集概述
数据集内容
本数据集由B站视频评论区中的对话构成,样例如下:
json [ [ { "from": "龙末", "value": "上学的时候,寝室六个人,蚊子只爱我, 宁可趴在我蚊帐上对我垂涎三尺望眼欲穿,都不会去叮其他人趴其他人的蚊帐," }, { "from": "雾川鹤", "value": "我一样,宿舍四个人,只叮我,b型血" }, { "from": "心琪爱糖", "value": "b血加一,一个屋里人家能骑着被子我得从头到脚裹严实" }, { "from": "带个蓬箍会头疼", "value": "和血型无关,和糖分有关,一般胖人,或者懒人身上没肌肉都是那种软肉,糖分会高点,肌肉男运动型人不怎么招蚊子" }, { "from": "龙末", "value": "我是176cm,55kg的肌肉女" }, { "from": "带个蓬箍会头疼", "value": "55的176很瘦了,不过血糖也不是看体重,如果甜食吃的多血糖也多。我才163,体重50,血糖就体检有点多,皮和骨头直接没有肉,只有脂肪,不运动原因," }, { "from": "龙末", "value": "我特讨厌吃甜食,爱喝水不喝饮料,不吃肉,只吃鱼和蔬菜,血糖正常。[OK]" } ] ]
数据集构建方法
数据集的构建方法涉及以下步骤:
- 数据爬取:使用爬虫程序从B站视频评论区爬取数据。
- 数据处理:将爬取的评论数据按照对话关系组织成树状结构。
- 对话提取:从树状结构中提取完整的对话链。
- 数据筛选:根据对话长度等条件筛选有效对话。
数据集使用
本数据集格式符合Aquila微调需求,具体格式可参考Aquila的Github仓库。数据集可用于微调大语言模型或其他对话生成任务。




