遇见数据集

pretrain-data-clean-delete-only

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集包含约300万条文本数据,语言涵盖中文和英文,领域覆盖通用领域和金融领域。每条数据由原始文本(raw_text)经Qwen3.5-9B模型进行“删减式”清洗后得到清洗文本(text)。清洗过程旨在删除广告、乱码以及无意义格式性文本,从而提升文本质量,使其更适合用于预训练语言模型。该数据集的主要用途是作为训练数据,用于训练体积更小、专门用于数据清洗的模型。

This dataset contains approximately 3 million text data entries, covering both Chinese and English languages, and spanning general and financial domains. Each entry consists of a raw text (raw_text) that has been cleaned via a deletion-style process using the Qwen3.5-9B model to produce a cleaned text (text). The cleaning process aims to remove advertisements, garbled characters, and meaningless formatting text, thereby improving text quality and making it more suitable for pre-training language models. The primary use of this dataset is as training data for training smaller, specialized models for data cleaning.

创建时间:
2026-08-13
原始信息汇总

数据集概述

基本信息

  • 数据集名称:pretrain-data-clean-delete-only
  • 许可证:Apache 2.0
  • 语言:中文、英文
  • 数据规模:约300万条数据(1M < n < 10M)

数据内容

  • 覆盖领域:通用领域与金融领域
  • 数据构成:包含原始文本(raw_text)及清洗后文本(text

数据清洗方式

  • 使用 Qwen3.5-9B 模型对 raw_text 进行“删减式”清洗,生成 text 字段
  • 清洗内容:删除广告、乱码、无意义格式性文本,使文本数据更符合预训练要求

数据集用途

  • 用于训练体积更小、专门用于数据清洗的模型
搜集汇总
数据集介绍
pretrain-data-clean-delete-only 数据集图片
构建方式
本数据集构建了一条基于大语言模型的自动化数据清洗路径。研究者利用Qwen3.5-9B模型对原始语料中的raw_text字段执行了‘删减式’清洗操作,即通过智能识别并移除广告、乱码及无意义的格式性文本,保留下具有语义完整性和预训练价值的内容,最终生成清洗后的text字段。该过程覆盖了约300万条中英文数据,横跨通用领域与金融领域,旨在提升语料质量,使其更契合大模型预训练的要求。
特点
数据集的核心特色在于其‘删减式’清洗策略,有别于常见的改写或重写,它精准聚焦于剔除噪声信息,最大程度保留原始文本的语义结构和知识密度。数据规模约300万条,语言分布涵盖中英文,领域覆盖通用与金融,体现了良好的多样性与均衡性。更为独特的是,该数据集本身即作为训练‘数据清洗专用模型’的语料,具有高度的自指涉性和工具价值,为构建更高效、更专业的数据处理管线提供了宝贵资源。
使用方法
该数据集主要用途在于训练轻量级的数据清洗模型。使用者可以直接利用其中的raw_text作为输入,text作为目标输出,通过监督学习方式训练一个专司文本清理的模型,从而替代或辅助人工清洗流程。鉴于其清洗结果由Qwen3.5-9B生成,所训练的模型有望继承其强大的语义理解能力,实现精准的噪声识别与移除。使用时需注意数据集规模适中(1M-10M),可配合预训练语言模型进行微调,以适应特定领域的清洗任务。
背景与挑战
背景概述
随着大规模语言模型预训练技术的迅猛发展,数据质量对模型性能的制约作用日益凸显。为应对低质文本对训练效率与泛化能力的负面影响,本研究团队于2025年构建了名为“pretrain-data-clean-delete-only”的数据集,由约300万条中英文混合语料构成,覆盖通用领域与金融领域。该数据集创新性地采用Qwen3.5-9B模型,对原始文本执行“删减式”清洗策略,精准去除广告、乱码及无意义格式性文本,从而获得符合预训练要求的高质量语料。该数据集的发布为数据清洗领域提供了可复用的训练资源,其核心价值在于通过删除冗余信息而非重写内容,保持原始文本的语义完整性,为小型数据清洗模型的训练奠定了坚实基础。
当前挑战
该数据集所应对的核心领域挑战在于,传统基于规则或简单统计的文本清洗方法难以兼顾删除效率与语义保真,尤其在金融等专业领域中,噪声与有效信息交织,过度删除可能造成关键实体或逻辑关系丢失。构建过程中的主要挑战包括:其一,设计适配Qwen3.5-9B的删减式清洗指令,需精细界定何种文本成分构成“冗余”,以避免模型主观性误删;其二,在约300万条多领域、多语言混合数据中,平衡清洗一致性并抑制模型在长尾噪声模式下的误判;其三,确保清洗后的文本在词频分布、句长结构及语义连贯性上符合预训练数据要求,这对质量评估体系提出了更高标准。
常用场景
经典使用场景
该数据集汇聚了约3百万条中英文双语、涵盖通用与金融两大领域的语料,经由Qwen3.5-9B模型以‘删减式’策略精细清洗,产出了纯净的`text`字段。其经典应用在于作为大规模语言模型预训练阶段的语料基础,尤其适用于需要高效剔除噪声、保留核心语义的文本预处理环节。研究者可将其作为基准数据,训练轻量级的数据清洗专用模型,从而在保证语料质量的同时,显著降低计算开销,提升预训练效率。
解决学术问题
此数据集直面大规模文本预训练中普遍存在的噪声干扰问题,如广告插入、字符乱码及冗余格式等,这类非语义噪声会严重损害模型学习到的表征质量。通过提供高质量的清洗后语料,它解决了如何自动化、规模化地净化训练数据这一关键挑战,并为数据驱动型AI的可靠性提供了保障。其意义在于推动构建更鲁棒的预训练流程,减少人工干预成本,为后续研究树立了数据清洗的新范式。
衍生相关工作
此数据集衍生了多项相关研究,包括开发基于Qwen架构的数据清洗专用模型,并探索其在不同语料规模上的泛化能力。此外,它催生了数据质量评估框架,用以量化清洗前后文本对下游任务性能的影响。更进一步,研究者借鉴其‘删减式’策略,构建自动化数据净化流水线,并应用于多语言、多领域预训练中,从而推动了数据为中心AI方法论的深入发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务