thu-coai/lccc
收藏资源简介:
LCCC: Large-scale Cleaned Chinese Conversation corpus (LCCC) 是一套来自于中文社交媒体的对话数据,我们设计了一套严格的数据过滤流程来确保该数据集中对话数据的质量。 这一数据过滤流程中包括一系列手工规则以及若干基于机器学习算法所构建的分类器。 我们所过滤掉的噪声包括:脏字脏词、特殊字符、颜表情、语法不通的语句、上下文不相关的对话等。
LCCC: Large-scale Cleaned Chinese Conversation corpus (LCCC) 是一套来自于中文社交媒体的对话数据,我们设计了一套严格的数据过滤流程来确保该数据集中对话数据的质量。 这一数据过滤流程中包括一系列手工规则以及若干基于机器学习算法所构建的分类器。 我们所过滤掉的噪声包括:脏字脏词、特殊字符、颜表情、语法不通的语句、上下文不相关的对话等。
数据集概述
数据集名称: LCCC: Large-scale Cleaned Chinese Conversation corpus
数据集简介: LCCC是一个大规模的中文对话语料库,源自中文社交媒体。通过一套严格的数据清洗流程,确保了语料库的质量。该流程包括一系列手工规则和多个基于机器学习算法的分类器,用于过滤掉脏字脏词、特殊字符、颜表情、语法不通的语句、上下文不相关的对话等噪声。
语言: 中文
许可: MIT License
多语言性: 单语种
任务类别: 对话生成
数据集大小:
- LCCC-large: 1530827965字节,12007759个实例
- LCCC-base: 937055849字节,包含6820506个训练实例,20000个验证实例和10000个测试实例
数据集结构:
- 数据字段:
dialog(列表,字符串类型),包含对话中的多个语句。 - 数据分割: LCCC-base提供官方分割,包括训练集、验证集和测试集。
使用许可:
- 该数据集根据MIT许可证发布,允许自由使用、复制、修改、合并、出版、分发、转授和/或出售软件副本,但需包含版权声明和许可声明。
引用信息: bibtex @inproceedings{wang2020chinese, title={A Large-Scale Chinese Short-Text Conversation Dataset}, author={Wang, Yida and Ke, Pei and Zheng, Yinhe and Huang, Kaili and Jiang, Yong and Zhu, Xiaoyan and Huang, Minlie}, booktitle={NLPCC}, year={2020}, url={https://arxiv.org/abs/2008.03946} }




