遇见数据集

MimanusM1_v1_Dataset

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

Mimans 1B Token Pretraining Mixture 是一个高质量、精心配比的预训练数据集混合体,专为参数规模在0.5B至3B之间的中小型语言模型设计。数据集包含约10亿个token,共819,493个文档,文件大小为2.03 GB,格式为Apache Parquet(snappy压缩)。其token混合比例经过精心设计:自然文本(从网络爬取中提取,已清除碎片化代码和数学公式)占72%,代码(包括Python、JavaScript、TypeScript、Java、C)共占18%,数学内容(LaTeX公式、证明和方程)占10%。每个样本包含三个字段:text(文档文本)、source_type(类别标识,如text、code_python、maths等)和token_count(token数量估计)。该数据集可直接用于语言模型的预训练任务,提供丰富的自然语言、编程语言和数学推理数据。

Mimans 1B Token Pretraining Mixture is a high-quality, carefully proportioned pretraining dataset mixture designed for small to medium-sized language models with parameter sizes between 0.5B and 3B. The dataset contains approximately 1 billion tokens, 819,493 documents, and a file size of 2.03 GB in Apache Parquet format (snappy compressed). Its token mixing ratio is carefully designed: natural text (extracted from web crawls, cleaned of fragmented code and mathematical formulas) accounts for 72%, code (including Python, JavaScript, TypeScript, Java, C) accounts for 18%, and mathematical content (LaTeX formulas, proofs, and equations) accounts for 10%. Each sample includes three fields: text (document text), source_type (category identifier, such as text, code_python, maths, etc.), and token_count (estimated token count). This dataset can be directly used for pretraining tasks of language models, providing rich natural language, programming language, and mathematical reasoning data.

创建时间:
2026-08-18
原始信息汇总

Mimans 1B Token Pretraining Mixture 数据集概述

基本信息

  • 数据集名称:Mimans 1B Token Pretraining Mixture
  • 语言:英语(en)
  • 许可证:Apache 2.0
  • 标签:预训练、数据集混合、代码、数学、大语言模型
  • 数据规模:1B-10B tokens
  • 任务类型:文本生成

核心指标

项目 数值
文件名称 train-00000-of-00001.parquet
文件大小 2076.95 MB(约2.03 GB)
文档总数 819,493
总Token数 约10亿(1,000,000,000)
数据格式 Apache Parquet(snappy压缩)

Token混合比例

类别 来源 Token占比 Token数量 描述
自然文本 网页抓取 72.0% ~720,000,000 已清除碎片化代码和数学公式的干净文本
Python 专门代码 5.04% ~50,400,000 高质量Python源代码
JavaScript 专门代码 4.33% ~43,200,000 高质量JavaScript源代码
TypeScript 专门代码 3.60% ~36,000,000 高质量TypeScript源代码
Java 专门代码 2.88% ~28,800,000 高质量Java源代码
C 专门代码 2.16% ~21,600,000 高质量C源代码
数学 公式与推理 10.00% ~100,000,000 LaTeX数学公式、证明和方程

数据集Schema

  • text(string):文档文本
  • source_type(string):类别标识符,取值包括:textcode_pythoncode_javascriptcode_typescriptcode_javacode_cmaths
  • token_count(int64):Token数量估算值

用途说明

该数据集是针对0.5B至3B参数规模的小型到中型语言模型预训练而专门策划的高质量数据集混合,涵盖自然语言、多种编程语言代码以及数学内容,适合用于预训练阶段的文本生成任务。

搜集汇总
数据集介绍
MimanusM1_v1_Dataset 数据集图片
构建方式
该数据集名为MimanusM1_v1_Dataset,是一个专为中小型语言模型(0.5B至3B参数)预训练精心构建的混合语料库,总规模约10亿Token,涵盖819,493篇文档,以Apache Parquet格式存储并采用snappy压缩,文件体积约2.03GB。其构建策略融合了多源异构数据的配比优化,其中自然文本占比高达72%,源自网络爬取并经过严格清洗,剔除碎片化代码与数学公式,确保文本纯净度;编程代码类数据合计占比约18%,覆盖Python、JavaScript、TypeScript、Java及C语言,每类均精选高质量源代码,以增强模型的代码理解与生成能力;数学数据占比10%,包含LaTeX公式、证明与推理过程,旨在强化模型在数学领域的逻辑演绎能力。各数据源按Token比例精确调配,最终形成平衡且多元的训练语料。
特点
数据集的核心特点在于其精细的类别标注与多维度信息记录。每条样本均包含三个字段:'text'字段存储文档文本内容,'source_type'字段标注所属类别(如'text'、'code_python'、'maths'等),便于研究者进行针对性分析与过滤;'token_count'字段提供Token数量估算,有利于批处理时的负载均衡与效率优化。此外,数据集的规模设计兼顾了计算资源与训练效果,10亿Token的体量对于中小型模型而言既能提供足够的语义多样性,又避免了过大的算力开销。其混合比例的合理性体现在自然语言与代码、数学的平衡上,既保持了语言模型的通用性,又增强了在专业领域的表现力,适合作为预训练或继续训练的种子数据集。
使用方法
数据集的使用方法便捷灵活,支持两种主流加载方式。其一,通过Hugging Face的datasets库直接加载本地或远程的Parquet文件,示例代码展示了如何使用load_dataset函数读取数据并查看样本结构,输出为DatasetDict对象,包含819,493行训练数据。其二,借助PyArrow库进行零拷贝内存映射批处理,通过read_table读取文件后,利用to_batches方法按指定批次大小(如2048)迭代数据,将文本批量转换为张量供PyTorch等框架训练使用。该设计兼容NanoGPT、Llama等常见模型架构,用户可无缝集成至现有训练流程。同时,schema中的source_type字段支持按需筛选子集,例如仅训练代码或数学数据,以实现领域适配或课程学习策略。
背景与挑战
背景概述
MimanusM1_v1_Dataset是一个专为预训练中小型语言模型(0.5B至3B参数规模)而精心设计的高质量混合数据集,由Mimans团队于近期构建并发布,其核心目标在于为参数规模有限的模型提供高效且涵盖广泛知识领域的预训练语料。该数据集包含约10亿个Token,融合了自然语言文本(占比72%)与多种编程语言代码(Python、JavaScript等)以及数学公式和推理内容,旨在平衡语言理解、代码生成与数学推理能力的发展。其设计理念契合当前大语言模型研究领域对数据质量和多样性的追求,尤其针对资源受限场景下的模型预训练,为相关研究提供了有力的数据支撑,在该领域内具有积极的影响力。
当前挑战
该数据集所面临的挑战主要体现在两个维度。在领域问题层面,构建一个均衡且全面的预训练语料库需应对自然语言、代码和数学知识在分布与难度上的显著差异,确保模型不会偏向某一特定模态,同时需兼顾数据规模与模型容量之间的匹配,避免数据冗余或不足。在构建过程层面,数据清洗与去重成为关键难点,需从网络爬取文本中精确剔除碎片化代码和数学公式残留,并保证代码数据的高质量来源,这要求精细的过滤算法和大量的计算资源。此外,Token比例的科学分配(如各类别占比的确定)以及元数据标注的一致性,也都是确保数据集可靠性和可复现性的重要技术挑战。
常用场景
经典使用场景
作为面向中小规模语言模型的预训练语料混合集,MimanusM1_v1_Dataset精心调配了自然文本、多语言代码及数学公式的比例,旨在为0.5B至3B参数量的模型提供均衡且高质量的训练数据。其经典应用在于利用该数据集进行从零开始的预训练,通过其涵盖广泛领域的语料,使模型在学习语言建模的同时,兼顾代码理解与数学推理能力,从而为后续的指令微调或领域适应奠定坚实基础。其构成比例经过优化,能有效促进模型在多种任务上的泛化性能提升。
衍生相关工作
该数据集启发了多项后续研究,包括探索不同领域数据比例对模型能力影响的消融实验,以及开发针对代码与数学混合任务的评估基准。相关衍生工作还涵盖基于该数据集预训练模型的持续学习与领域适配研究,以及将其作为数据增强来源,结合课程学习策略提升训练效率的方法。此外,数据集的发布促进了关于小规模预训练数据组合的公开讨论,为开源社区中低资源语言模型的构建提供了宝贵参考。
数据集最近研究
最新研究方向
该数据集聚焦于为中小规模语言模型(0.5B-3B参数)提供高质量的预训练混合语料,其精心的类别配比反映了当前大模型研究中对数据质量与多样性平衡的深度关注。在自然语言处理的前沿,随着模型规模高效扩展的需求日益增长,研究者愈发重视数据组成的科学性,MimanusM1_v1_Dataset以72%的纯净自然文本辅以多语言代码及数学公式的特定比例,旨在强化模型的推理与代码生成能力,同时规避冗余信息干扰。这一策略与近期兴起的‘数据为中心’的人工智能趋势相呼应,强调了在有限计算资源下通过精细数据工程提升模型性能的可能性。该数据集的发布为参数高效预训练、领域自适应以及多任务泛化等热点议题提供了坚实的数据基础,其1B token的规模亦适合快速迭代实验,有望推动高效小型模型在边缘计算及实时应用中的落地与优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务