遇见数据集

opencsg/Fineweb-Edu-Chinese-V2.3

收藏
Hugging Face2026-06-29 更新2026-07-22 收录
官方服务:

资源简介:

Chinese Fineweb Edu Dataset V2.3 是 OpenCSG 面向中文教育、知识问答、指令微调和文本生成场景构建的高质量中文教育 SFT 数据集。该版本包含 23.04 万条高质量中文教育 QA pairs,并将同一批问答对发布为 Alpaca、Messages、Messages-no-system 三种训练格式。V2.3 是在 V2.2 基础上的质量升级版本,提高了源文本进入生成环节的门槛,并优化了问答生成与过滤逻辑。数据构建从约 2.3T Parquet / raw corpus 中进行高召回候选筛选,通过 GPT-4.1 mini 标注获得监督信号,基于 IEITYuan/Yuan-embedding-2.0-zh 训练中文源文本分类打分器进行排序与选择,最终由 GPT-4.1 mini 完成问答生成,并进行证据对齐、质量过滤和多格式导出。数据集旨在提供更适合直接进入监督微调流程的中文教育问答数据,提升中文教育回答能力、SFT训练输入纯度和训练格式接入便利性。

Chinese Fineweb Edu Dataset V2.3 is a high-quality Chinese educational SFT (Supervised Fine-Tuning) dataset developed by OpenCSG for Chinese education, knowledge question answering, instruction fine-tuning and text generation scenarios. This version includes 230,400 high-quality Chinese educational QA pairs, and releases the same set of Q&A pairs in three training formats: Alpaca, Messages, and Messages-no-system. V2.3 is a quality-upgraded iteration based on V2.2, which raises the threshold for source texts to enter the generation stage, and optimizes the Q&A generation and filtering logic. The dataset construction conducts high-recall candidate screening from approximately 2.3T Parquet/raw corpus, obtains supervision signals via GPT-4.1 mini annotation, trains a Chinese source text classification scorer based on IEITYuan/Yuan-embedding-2.0-zh for ranking and selection, and finally uses GPT-4.1 mini to complete Q&A generation, followed by evidence alignment, quality filtering and multi-format export. The dataset aims to provide Chinese educational Q&A data that is more suitable for direct integration into supervised fine-tuning workflows, and improve the performance of Chinese educational answering capabilities, the purity of SFT training inputs, and the convenience of accessing various training formats.

提供机构:
opencsg
搜集汇总
数据集介绍
opencsg/Fineweb-Edu-Chinese-V2.3 数据集图片
构建方式
Fineweb-Edu-Chinese-V2.3的构建始于对约2.3T原始语料库的高召回候选筛选,随后利用GPT-4.1 mini进行小范围标注,获取关于候选文本是否适合生成高质量SFT样本的0/1监督信号。基于此信号,项目团队以在中文embedding检索与排序公开榜单中位列第一的IEITYuan/Yuan-embedding-2.0-zh为底座,训练了一个中文源文本分类打分器,对候选文本进行可生成性排序与优选。最终入选的文本进入FineWeb-Edu-Ultra数据构建链路,由GPT-4.1 mini完成问答对的生成,并历经证据对齐、质量过滤及多格式导出等工序,最终产出23.04万条高质量中文教育问答对。
特点
该数据集的核心特点在于其高纯度与强针对性,专注于提供便于直接进入监督微调流程的中文教育问答数据。相较于前序版本,V2.3显著提升了对长段回答重复、异常中英文混入、噪声片段及弱证据支撑等问题的控制能力。数据集覆盖概念解释、事实问答、结构化总结与步骤推理等多元能力,并将源文本筛选标准从“是否具有教育属性”升级为“是否适合生成可回答、可追溯、可训练的SFT样本”,确保了数据的高知识密度与低模板噪声。
使用方法
使用者可通过Hugging Face的datasets库便捷加载数据,数据集提供Alpaca、Messages及Messages-no-system三种训练格式,对应同一批问答对的不同导出视图。建议根据所采用模型的模板与训练框架选择其中一种格式使用,避免将不同格式简单叠加。例如,Alpaca格式适用于LLaMA-Factory等经典SFT流程,Messages格式则适合带系统提示的对话风格训练。数据集的适用场景涵盖中文教育问答模型训练、大模型监督微调及知识服务类模型构建等领域。
背景与挑战
背景概述
Fineweb-Edu-Chinese-V2.3 是由 OpenCSG 社区于 2026 年发布的高质量中文教育监督微调(SFT)数据集,旨在弥合大规模中文网页语料与可训练问答格式之间的鸿沟。该数据集聚焦于教育场景下的文本生成、知识问答与指令微调,通过从约 2.3T 原始语料中高召回筛选,结合 GPT-4.1 mini 标注与 Yuan-embedding-2.0-zh 排序,构建了 23.04 万条高质量中文教育问答对。作为 Fineweb-Edu-Chinese 系列的第五个版本,V2.3 通过迭代升级源文本筛选逻辑与生成流程,显著提升了数据的纯净度与训练可用性,为中文大模型在教育领域的后训练阶段提供了可靠的数据底座,对推动中文教育 NLP 研究具有重要影响力。
当前挑战
该数据集面临的核心挑战源于中文教育 SFT 数据的先天困境:高质量公开数据极度稀缺,网页内容与可训练格式之间存在结构性断层,而现有合成数据常出现重复、空泛与不可验证的伪样本。为此,V2.3 需解决多重难题:在构建过程中,需要从海量、噪声密集的原始语料中甄别出具有教育价值且自洽的源文本,避免乱码、模板化内容与弱证据支撑的问答;同时,需设计严密的 0/1 分类打分器,将标注目标从传统文本质量转向“是否适合生成可追溯的 SFT 样本”。此外,还需控制长回答中的循环句式、异常中英文混入以及幻觉式输出,在保留知识密度的同时,确保每一条问答对都能稳定支持模型微调、降低下游部署风险。
常用场景
经典使用场景
Fineweb-Edu-Chinese-V2.3数据集最经典的使用场景在于中文教育领域的大语言模型监督微调(SFT)。该数据集精心构建了23.04万条高质量的中文教育问答对,覆盖概念解释、事实问答、结构化总结和步骤推理等多种知识形态。研究者常将其直接接入Alpaca、Messages等多种训练格式,用于提升模型在中文教育场景下的回答稳定性与知识准确性。该数据集特别适用于需要高质量、可追溯、低噪声训练样本的教育助手模型开发,为中文教育NLP提供了坚实的数据基础。
解决学术问题
该数据集有效解决了中文教育SFT数据长期面临的三大学术难题:高质量公开数据稀缺、教育网页内容与可训练问答格式之间的断层,以及合成数据易出现的重复、空泛和不可验证问题。通过构建从2.3T原始语料中高召回筛选候选文本,再经由GPT-4.1 mini标注和Yuan-embedding-2.0-zh分类器排序的闭环流程,该数据集显著提升了源文本选择与问答生成的质量门槛。这一方法为中文教育NLP领域提供了可复现的高质量数据构建范式,推动了监督微调数据的标准化研究。
衍生相关工作
该数据集是Fineweb-Edu-Chinese系列从预训练语料迈向SFT问答数据的关键演进版本,衍生了多项具有影响力的相关工作。其前序版本V2.2为大规栐中文教育SFT奠定了基础,而V2.3在此基础上进一步强化了证据对齐、质量过滤和多格式导出等创新方法。这些技术实践为后续研究提供了重要的参照基准,例如基于Yuan-embedding-2.0-zh的训练策略和0/1分类打分器设计思路,已被广泛借鉴于中文教育数据的自动化筛选与合成工作中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务