遇见数据集

BAAI/IndustryCorpus_computer

收藏
Hugging Face2024-07-26 更新2024-12-14 收录
官方服务:

资源简介:

该数据集是通过对超过100TB的开源数据集进行清洗和过滤得到的,最终生成了3.4TB的高质量多行业分类中英文预训练数据集。数据集包含1TB的中文数据和2.4TB的英文数据,并对中文数据进行了12种类型的标注。为了验证数据集的性能,作者在医疗行业示范模型上进行了预训练、SFT和DPO训练,结果显示客观性能提升了20%,主观胜率为82%。数据集涵盖了18个行业类别,包括医疗、教育、文学、金融、旅游、法律、体育、汽车、新闻等,并提供了每个行业的数据量。为了方便用户使用,数据集被分割为18个子数据集,当前提供的是计算机行业的子数据集。

The dataset contains 3.4TB of high-quality multi-industry classified Chinese and English pre-training data, which has been cleaned and filtered through 22 industry data processing operators, resulting in 1TB of Chinese data and 2.4TB of English data. The dataset covers 18 industry categories and includes 12 types of labels for Chinese data, such as alphanumeric ratio, average line length, language confidence score, maximum line length, and perplexity. The performance of the dataset was validated through continued pre-training, SFT, and DPO training on a medical industry demonstration model, showing a 20% improvement in objective performance and an 82% subjective win rate.

提供机构:
BAAI
搜集汇总
数据集介绍
构建方式
在产业智能化转型与创新发展的浪潮中,高质量领域数据成为提升大模型性能与实现行业应用落地的关键瓶颈。为突破现有产业模型训练数据普遍存在的规模不足、质量低下与领域专业性缺失等困境,研究团队从WuDaoCorpora、BAAI-CCI、redpajama、SkyPile-150B等逾100TB的开源语料中,构建并应用了22项行业数据处理算子,经清洗与筛选后获得3.4TB的高质量多行业分类中英文语言预训练数据集。其中,中文数据约1TB,英文数据约2.4TB。为便于用户使用,团队对中文数据标注了12类标签,涵盖字母数字比、平均行长度、语言置信度分数、最大行长度与困惑度等特征。
特点
该数据集涵盖医疗、教育、法律、金融、旅游、体育、汽车、新闻等18个行业类别,具有显著的领域多样性与层次化特征。数据构建过程融合了多重过滤机制,包括繁简体中文转换、邮箱与IP地址移除、链接清理及Unicode修复等规则化处理,并借助准确率达80%的行业分类语言模型进行基于模型的筛选。此外,采用MinHash文档级去重技术确保数据冗余最小化。每个子数据集均附有丰富的质量标签,便于用户根据具体需求灵活筛选。
使用方法
用户可通过HuggingFace平台便捷地按行业子数据集进行下载与使用,当前提供的为计算机行业子集。该数据集适用于大语言模型的继续预训练、指令微调(SFT)与基于人类反馈的强化学习(DPO)等训练范式。以医疗行业示范模型为例,应用该数据集后客观性能提升20%,主观胜率达82%。用户可根据任务需求,依据数据标签(如困惑度、毒性字符比等)对数据进行二次过滤,或直接加载全量数据进行下游任务适配。
背景与挑战
背景概述
在人工智能与产业深度融合的浪潮中,行业大模型已成为驱动企业智能化转型与创新发展的核心引擎,而高质量、大规模、多领域的行业语料则是提升大模型性能、实现落地应用的关键基石。然而,现有面向行业模型训练的数据集普遍面临数据规模不足、质量参差不齐以及领域知识匮乏等严峻挑战。为攻克这些瓶颈,BAAI研究团队于近年系统性地构建了IndustryCorpus_computer数据集,该数据集从WuDaoCorpora、BAAI-CCI、redpajama、SkyPile-150B等超过100TB的开源语料中,通过自主研发的22个行业数据处理算子进行清洗与筛选,最终产出3.4TB的高质量多行业分类中英文预训练语料,其中包含1TB中文数据与2.4TB英文数据。该工作不仅为计算机等行业提供了大规模、高纯净度的预训练资源,还通过12种标签(如字母数字比、平均行长度、语言置信度等)对中文数据进行精细标注,显著提升了数据的可解释性与可用性,在医疗行业示范模型上实现了20%的客观性能提升与82%的主观胜率,有力推动了行业大模型从实验室走向实际应用。
当前挑战
IndustryCorpus_computer数据集致力于解决的核心领域问题在于,通用预训练语料难以满足特定行业(如计算机、医疗、法律等)对领域知识与术语的深度需求,导致大模型在垂直场景中表现欠佳,亟需构建兼具大规模与高专业性的行业分类语料。构建过程中面临多重挑战:首先,从超100TB的异构开源数据中高效筛选出行业相关内容,需设计高精度的行业分类语言模型(准确率达80%),并平衡计算资源与处理时效;其次,数据清洗环节需应对繁体中文转换、邮箱与链接去除、Unicode修复等规则性噪声,同时通过MinHash文档级去重消除冗余,确保数据独特性;最后,对中文数据标注12种质量标签(如毒性字符比、困惑度等)以支持下游任务筛选,但标注体系的全面性与自动化程度仍需持续优化,以应对多行业语料中隐含的语义歧义与标注偏差。
常用场景
经典使用场景
在工业大模型研发的浪潮中,高质量领域数据是驱动模型性能跃升的核心燃料。BAAI/IndustryCorpus_computer 作为面向计算机行业的子数据集,其经典使用场景聚焦于对通用大模型进行领域适配的持续预训练(Continued Pre-training)。研究者通过注入该数据集中的计算机科学、编程、技术等细分语料,使预训练语言模型在代码生成、技术文档理解、算法推理等任务上获得显著的领域知识增强,从而弥合通用模型与专业场景之间的语义鸿沟。该数据集还常被用于监督微调(SFT)与基于人类反馈的强化学习(DPO)等训练范式,以构建具备深层次计算机领域认知的对话式智能体。
实际应用
在产业智能化转型的实践中,该数据集为计算机领域的企业级应用提供了坚实的数据底座。实际场景覆盖智能编程助手(如自动代码补全与Bug修复)、技术文档自动化生成、计算机科学教育中的自适应学习系统,以及金融、法律等垂直行业中对计算机相关文本的语义解析。例如,基于该数据集微调的模型可高效处理技术论坛问答、API文档检索、算法竞赛题目理解等任务,显著降低企业构建专属领域大模型的数据获取成本。此外,其多标签标注体系(如困惑度、毒性字符比)为数据质量监控与模型安全部署提供了可量化的评估依据,助力工业级应用的合规落地。
衍生相关工作
该数据集的发布催生了一系列富有影响力的后续研究。首先,其开创的“通用语料→行业分类→领域精调”三级数据处理范式,被后续多个行业数据集构建工作所借鉴,如法律、金融领域的专用预训练语料库。其次,研究者基于该数据集中的计算机子集,探索了跨任务迁移学习与少样本学习的新范式,衍生出如CodeBERT-Industry、TechGPT等面向代码与技术的专用模型。此外,数据集中嵌入的12类质量标签体系,推动了数据清洗与噪声检测技术的进步,相关成果被应用于大模型预训练的数据治理框架中,如DataComp与Dolma等项目的标签策略设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务