遇见数据集

Fineweb-Edu-Chinese-V2.3

收藏
OpenCSG2026-06-28 更新2026-07-08 收录
官方服务:

资源简介:

Chinese Fineweb Edu Dataset V2.3 是 OpenCSG 面向中文教育、知识问答、指令微调和文本生成场景构建的高质量中文教育 SFT 数据集。该版本包含 23.04 万条高质量中文教育 QA pairs,并将同一批问答对导出为 Alpaca、Messages、Messages-no-system 三种训练格式,便于用户按模型模板和训练框架选择使用。 V2.3 是在 Fineweb-Edu-Chinese 系列和 V2.2 基础上的质量升级版本。该版本从约 2.3T Parquet / raw corpus 中进行高召回候选筛选,再结合小范围 GPT-4.1 mini teacher judge labels 训练得到的 0/1 分类打分器,对候选文本进行 SFT 可生成性排序与选择。该打分器基于 IEITYuan/Yuan-embedding-2.0-zh 适配训练,底座模型在选型时的中文 embedding 检索与排序公开榜单中取得 Rank 1 表现。最终,selected source text 会进入 FineWeb-Edu-Ultra Data Construction Pipeline,由 GPT-4.1 mini 完成问答生成,并经过证据对齐、质量过滤与多格式导出。 相比 V2.2,V2.3 进一步提高了源文本进入生成环节的质量门槛,重点减少重复模式、异常中英文混入、网页噪声片段、弱证据支撑回答和低质量合成输出。虽然保留下来的样本规模更小,但数据纯度和训练稳定性更适合中文教育 SFT 阶段使用。 本数据集遵循 OpenCSG 数据集许可协议。仓库 metadata 中的 license: other 表示本数据集采用平台预设列表之外的许可协议,实际许可条款以仓库中的许可文件为准。商业使用本数据集,或使用基于本数据集训练、增强的模型、系统、Agent、API 服务和商业产品,请发送邮件至 lorraineg@opencsg.com 获取许可。

提供机构:
OpenCSG
创建时间:
2026-06-29
二维码
社区交流群
二维码
科研交流群
商业服务