遇见数据集

dschauhan08/minicpm5-chatml-mix

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

MiniCPM5-1B ChatML Mix是一个用于监督微调的合并ChatML数据集。该数据集整合了多个来源的数据,包括CodeX-2M-Thinking、OpenCodeReasoning(或其变体)、hermes-agent-reasoning-traces、gpt5.5-terminal、GPT-5.5-Thinking-Max-Distill-25k和Opus-4.7-Reasoning-CoT-4800x。每个数据行包含以下字段:id(唯一标识符)、source_dataset(来源数据集名称)、source_split(来源数据分割)、source_kind(数据种类)、messages(消息内容,通常以ChatML格式组织)和metadata_json(元数据,以JSON格式存储)。该数据集旨在支持自然语言处理任务中的模型微调,特别是基于对话或推理场景的监督学习。

MiniCPM5-1B ChatML Mix is a merged ChatML dataset for supervised fine-tuning. This dataset integrates data from multiple sources, including CodeX-2M-Thinking, OpenCodeReasoning (or its variants), hermes-agent-reasoning-traces, gpt5.5-terminal, GPT-5.5-Thinking-Max-Distill-25k, and Opus-4.7-Reasoning-CoT-4800x. Each data row contains the following fields: id (unique identifier), source_dataset (name of the source dataset), source_split (source data split), source_kind (type of data), messages (message content, usually organized in ChatML format), and metadata_json (metadata stored in JSON format). This dataset aims to support model fine-tuning in natural language processing tasks, especially supervised learning based on dialogue or reasoning scenarios.

提供机构:
dschauhan08
搜集汇总
数据集介绍
dschauhan08/minicpm5-chatml-mix 数据集图片
构建方式
该数据集通过整合多个高质量开源数据集,生成适用于监督微调的混合ChatML格式数据。构建过程精选了来自CodeX-2M-Thinking、OpenCodeReasoning等六个来源的推理与代码相关样本,每行数据包含唯一标识符、来源数据集名称、数据切分类型、数据种类、遵循ChatML格式的多轮对话消息序列及元数据JSON,确保了数据来源的多样性和结构化统一。
特点
数据集核心特色在于其多源融合的推理增强型对话内容,涵盖从代码生成到逻辑推理的广泛场景。通过聚合来自GPT-5.5与Opus-4.7等模型的思维链蒸馏数据,结合Hermes智能体追踪和终端交互数据,形成了兼具深度推理与实用指令遵循能力的高质量监督微调语料,适用于提升小型语言模型在复杂任务上的表现。
使用方法
使用方法上,数据以标准的ChatML格式组织,每条记录均含messages字段,可直接用于HuggingFace Transformers框架的训练流程。用户通过加载数据集后,提取messages键作为输入,结合metadata_json中存储的额外属性进行过滤或增强,即可执行监督微调、指令调优或推理能力蒸馏等下游任务,兼容常见的训练脚本与框架。
背景与挑战
背景概述
随着大型语言模型在复杂推理与多任务泛化能力上的持续突破,如何通过高质量监督微调数据进一步提升模型性能,已成为自然语言处理领域的研究焦点。MiniCPM5-1B ChatML Mix数据集由多个研究团队于2024年联合构建,整合了来自Modotte、NVIDIA、Lambda、Roman1111111及ansulev等机构或个人的多种推理与对话数据源,如CodeX-2M-Thinking和OpenCodeReasoning等。该数据集旨在为轻量级模型Supervised Fine-Tuning提供结构化、多来源的混合ChatML格式样本,以推动小参数量模型在代码生成、逻辑推理与通用对话等任务上的能力边界,其在开源社区中迅速获得关注,为资源受限场景下的模型对齐研究提供了重要基准。
当前挑战
该数据集面临的核心挑战在于如何有效融合异质性显著的多源数据。一方面,不同来源的推理轨迹与对话风格存在格式与质量差异,需统一为ChatML结构并保持语义一致性,避免引入噪声或偏斜;另一方面,构建过程中需解决标签冲突与元数据标准化问题,例如处理来源分割标签的多样性与metadata_json字段的异构性。此外,领域问题方面,如何利用混合数据提升模型在代码推理、逻辑链生成等复杂任务上的泛化性,避免过拟合单一数据分布,仍是后续优化需攻克的关键难题。
常用场景
经典使用场景
在语言模型微调领域,MiniCPM5-1B ChatML Mix数据集被广泛用于监督式微调(Supervised Fine-Tuning),旨在提升小型语言模型在复杂推理和指令遵循方面的能力。通过整合来自多个高质量来源的对话数据,该数据集为1B参数级别的模型提供了丰富的结构化训练样本,尤其适用于代码生成、逻辑推理和多轮对话场景。研究人员通常利用其ChatML格式的消息结构,训练模型在有限的参数量下高效学习代理式推理与任务分解,从而在小模型上实现接近大模型的推理性能。
解决学术问题
该数据集核心解决了小参数语言模型在推理深度与指令遵从性上的瓶颈问题。传统上,小型模型因容量限制难以在复杂推理任务中保持连贯的思维链,而MiniCPM5-1B ChatML Mix通过注入来自代码推理、代理轨迹和蒸馏思维链的混合数据,弥补了模型在结构化推理与任务规划上的先天不足。这推动了轻量级模型在学术研究中成为可复现、低成本的推理基线,减少了大规模计算资源的依赖,同时为研究长尾指令分布下的泛化能力提供了标准化测试基准。
衍生相关工作
该数据集的出现催生了多项经典后续工作。例如,研究者基于其混合数据策略提出了自适应蒸馏框架,通过动态选择不同来源的思维链样本优化小模型训练效率;另有一部分工作借鉴其ChatML格式设计了跨模型指令迁移方法,使多轮对话能力在不同架构间平滑复用。此外,CodeX-2M-Thinking等原始数据源的链接数据集被进一步提炼为专门推理基准,用于评估小模型在数学、编程等领域的思维链忠实度。这些衍生产品共同巩固了该数据集合作为小模型推理微调基石的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务