MNBVC
收藏资源简介:
MNBVC数据集是一个超大规模的中文语料集,包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。
The MNBVC dataset is an extensive collection of Chinese text corpora, encompassing a wide variety of content such as news articles, essays, novels, books, magazines, academic papers, scripts, forum posts, wiki entries, classical poetry, song lyrics, product descriptions, jokes, embarrassing stories, and chat logs. This dataset not only covers mainstream culture but also includes data from various niche cultures and even internet slang.
MNBVC超大规模中文语料集概述
数据集描述
- 名称: MNBVC(Massive Never-ending BT Vast Chinese corpus)
- 内容: 包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
- 数据来源: 互联网收集。
数据集特点
- 多样性: 涵盖主流文化及小众文化,甚至包括火星文。
- 数据量: 目前总数据量33091GB,目标达到chatGPT3.5的40T数据,目前进度83%。
- 数据格式: 压缩包内中文语料清洗为txt和json(包括jsonl)格式。
- 数据脱敏: 收录的数据将去掉大于等于8位的数字串。
- 数据加工: 只做粗加工,如html&xml转txt、csv&tsv转json等。
数据集使用
- 下载方式:
- 通过p2p微力同步全部压缩包并接收更新。
- 通过百度网盘下载。
- 版权声明: 数据集不提供压缩包内数据的索引和分类,以避免版权争议。
数据集贡献
- 贡献方式: 通过参加语料元气弹项目,上传语料文档。
- 技术支持: 提供多种清洗工具和爬虫工具,以优化数据处理效率。
引用信息
- 引用格式:
@misc{mnbvc, author = {{MOP-LIWU Community} and {MNBVC Team}}, title = {MNBVC: Massive Never-ending BT Vast Chinese corpus}, year = {2023}, publisher = {GitHub}, journal = {GitHub repository}, howpublished = {url{https://github.com/esbatmop/MNBVC}}, }




