遇见数据集

JiRack-Pretrain-Dataset

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

Multi-Domain High-Quality Corpus(多领域高质量语料库)是一个精心策划的高质量多语言数据集,主要用于预训练JiRack模型。该数据集的创建背景聚焦于企业AI应用,旨在帮助银行、金融科技公司及其他企业保护敏感数据,并确保符合美国严格的隐私法规,从而避免使用受限制的公共在线或云端AI服务。数据集内容涵盖多个领域,具体包括:FineWeb-Edu、DCML、所有语言的维基百科、大型世界文学语料库、政府报告以及NexCoder Conversational对话数据。其核心目的是构建一个强大的基础模型,使其在编程代码生成、复杂推理以及多语言理解方面具备卓越能力。数据集规模庞大,适用于文本生成和掩码填充等预训练任务,并特别针对高质量、多语言和编码相关场景进行了优化。数据集采用Apache-2.0许可证,并配套有专门优化的分词器(如JiRack-Pro-Tokenizer和JiRack-Router-Tokenizer)以及一系列用于监督微调(SFT)的高质量下游数据集,这些SFT数据集需格式化为ChatML格式以充分发挥效能。整个数据集生态旨在通过SFT+DPO等技术,高效训练出高性能的企业级模型(如JiRackTernary系列)。

The Multi-Domain High-Quality Corpus is a meticulously curated high-quality multilingual dataset primarily used for pre-training the JiRack model. Its creation background focuses on enterprise AI applications, aiming to help banks, fintech companies, and other businesses protect sensitive data and ensure compliance with strict U.S. privacy regulations, thereby avoiding the use of restricted public online or cloud-based AI services. The dataset content spans multiple domains, specifically including: FineWeb-Edu, DCML, Wikipedia in all languages, a large world literature corpus, government reports, and NexCoder Conversational dialogue data. Its core purpose is to build a robust foundational model with exceptional capabilities in programming code generation, complex reasoning, and multilingual understanding. The dataset is large-scale and suitable for pre-training tasks such as text generation and masked filling, optimized specifically for high-quality, multilingual, and coding-related scenarios. It is licensed under Apache-2.0 and comes with specially optimized tokenizers (e.g., JiRack-Pro-Tokenizer and JiRack-Router-Tokenizer) and a series of high-quality downstream datasets for supervised fine-tuning (SFT), which need to be formatted in ChatML format for optimal performance. The entire dataset ecosystem aims to efficiently train high-performance enterprise-level models (such as the JiRackTernary series) through techniques like SFT+DPO.

创建时间:
2026-06-14
原始信息汇总

数据集概述

数据集名称:Multi-Domain High-Quality Corpus(JiRack 预训练数据集)

数据集地址https://huggingface.co/datasets/CMSManhattan/JiRack-Pretrain-Dataset

许可证:Apache-2.0

语言:多语言(multilingual)

任务类别:文本生成(text-generation)、掩码填充(fill-mask)

数据集规模:巨大(huge)

标签:预训练、高质量、多语言、编程


主要用途

  • 用于预训练 JiRack 模型,提供现代高质量的多领域、多语言数据。
  • 专为企业级 AI(如银行、金融科技公司)设计,帮助保护敏感数据并遵守美国隐私法律,避免使用公共在线和云端 AI 服务。

数据集构成

该数据集由以下子集组成:

  • FineWeb-Edu
  • DCML
  • Wikipedia(所有语言)
  • 世界文学大语料库
  • 政府报告
  • NexCoder 对话数据

构建目标

  • 创建具备强大编程推理多语言理解能力的稳健基础模型。

相关资源

搜集汇总
数据集介绍
JiRack-Pretrain-Dataset 数据集图片
构建方式
JiRack-Pretrain-Dataset是一个专为企业级人工智能场景打造的高质量多语言预训练语料库,其构建旨在满足银行、金融科技及各类企业对敏感数据保护与严格隐私合规的需求。该数据集通过整合FineWeb-Edu、DCML、多语种Wikipedia、世界文学巨著、政府报告以及NexCoder对话数据等多元来源,精心筛选与融合而成。数据集以Apache-2.0许可证开放,为大规模预训练任务提供了坚实的数据基础。
特点
该数据集最显著的特征在于其卓越的高质量与多领域覆盖能力,不仅包含丰富的编码与推理数据,还兼顾了多语言理解与文学素养的平衡。其设计紧密围绕JiRack模型生态,支持与JiRack-Pro-Tokenizer及JiRack-Router-Tokenizer的高效协同,从而在预训练阶段显著提升模型性能。此外,数据集体量庞大且经过严格筛选,有效保障了训练数据的纯净度与代表性。
使用方法
使用该数据集时,建议将其应用于JiRackTernary系列模型(如3B与7B版本)的预训练阶段,通过结合SFT与DPO技术实现快速收敛与高质量产出。所有下游监督微调数据集需转换为ChatML格式以适配JiRack专用分词器,从而确保数据与模型架构的无缝衔接。用户可直接从HuggingFace仓库下载,并参照JiRack开源架构的推荐流程进行训练实践。
背景与挑战
背景概述
JiRack-Pretrain-Dataset是专为企业级人工智能模型预训练而构建的高质量多语种语料库,由CMSManhattan团队于近期发布。该数据集的核心研究问题在于如何为金融机构、金融科技公司及其他企业提供合规且安全的预训练数据来源,规避因使用公共在线或云端AI服务而触犯美国隐私法律的风险。数据集融合了FineWeb-Edu、DCML、多语种维基百科、世界文学著作、政府报告以及NexCoder对话等多种高质量来源,旨在强化模型的编码、推理与多语种理解能力。作为JiRack生态系统的基石,该数据集推动了企业级模型的高效训练,在保护敏感数据的同时显著提升了模型性能,对银行与金融领域的AI部署产生了深远影响。
当前挑战
JiRack-Pretrain-Dataset面临的首要挑战是解决企业AI在数据合规与隐私保护方面的核心难题,即在严格的法律限制下,仍需构建具备强大编码、推理与多语种能力的通用预训练模型,同时确保数据来源的纯净性与安全性。在构建过程中,数据集面临了多源异构数据的高效清洗与融合难题,需从FineWeb-Edu、政府报告等差异极大的语料中提取高质量内容,并保证多语种覆盖的均衡性。此外,为适配JiRack三元模型架构与SFT+DPO训练流程,所有数据集必须经ChatML格式重排,这一标准化过程对数据管道设计与处理效率提出了严苛要求,尤其是在处理海量数据时需避免信息损失与偏差引入。
常用场景
经典使用场景
JiRack-Pretrain-Dataset作为一个精心筛选的多语种、高质量预训练语料库,其经典使用场景在于为大型语言模型提供基础预训练阶段的数据支撑。该数据集融合了FineWeb-Edu、维基百科、世界文学、政府报告及代码对话等多种来源,特别适合用于训练具备强大编码能力、推理能力和多语言理解能力的基座模型。得益于其高质量与多样性,研究人员可将其作为初始训练语料,以构建企业级或学术级的基础语言模型,进而在下游任务中展现出卓越的泛化性能。
解决学术问题
该数据集在学术研究领域解决了几个关键问题:首先,它缓解了多语种高质量预训练数据稀缺的困境,为跨语言自然语言处理研究提供了统一且丰富的资源。其次,通过纳入FinWeb-Edu和NexCoder等高质量编码与教育类数据,它有效提升了模型在代码生成和复杂推理任务上的基础能力,为相关研究方向奠定了数据基础。此外,该数据集强调数据的纯净性与合规性,为探讨数据质量对模型性能影响的实证研究提供了可靠素材,推动了预训练数据筛选方法论的发展。
衍生相关工作
该数据集驱动了一系列相关工作的诞生,其中最核心的是JiRackTernary系列模型,包括7B和3B参数版本,它们在仅需极少量训练周期(2-3轮或1-2轮)的情况下即达到优异性能,验证了数据质量对模型效率的显著提升作用。此外,围绕该数据集衍生出多个有监督微调(SFT)数据集,如JiRack-SmallTalk、JiRack-Magpie-Pro-MT-300K及JiRack-No_Robots等,这些数据集针对对话、多语言指令及推理任务进行了专门优化,共同构成了完整的预训练至微调流水线,为后续研究提供了可复现的基准与范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务