遇见数据集

mediumish-small-agent-sft-preview-v0.1

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

mediumish-small-agent-sft-preview-v0.1 是一个用于中等/小型模型的程序化生成的ChatML监督微调(SFT)数据集预览版。该数据集专门设计用于训练模型在多个关键领域的表现,包括智能体工具使用、抗幻觉习惯培养、有根据的拒绝能力、多步推理以及相关的认知行为。数据集包含6,976个样本,替代了先前5,000行的预览版本。数据在20个不同的应用领域分层分布,确保覆盖多样性,这些领域包括:可靠性与工具使用、圣经研究、隐藏假设推理、高级数学、基于文档规范的代码修复、规则手册与政策模拟、ARC风格网格谜题、状态机、逻辑网格、引用解析、反事实推理等。为防止单一领域主导训练,数据集的字符分布受到刻意限制,例如代码相关内容的字符占比约为28%,而ARC网格交互领域的字符占比低于5%。数据集包含两个主要列:chatml列存储完整的多轮对话训练示例,涵盖系统消息、用户输入、助手回复以及工具调用等轮次(如适用);difficulty列标识每个样本的难度等级,分为easy(简单)、medium(中等)、hard(困难)和adversarial(对抗性)四个级别。该版本明确标注为预览版,可能存在问题,并非最终的生产发布版本。

mediumish-small-agent-sft-preview-v0.1 is a programmatically generated ChatML supervised fine-tuning (SFT) dataset preview for medium/small models. It is specifically designed to train models in multiple key areas, including agent tool usage, anti-hallucination habit cultivation, grounded refusal capabilities, multi-step reasoning, and related cognitive behaviors. The dataset contains 6,976 samples, replacing the previous 5,000-row preview version. Data is stratified across 20 different application domains to ensure diversity, covering areas such as: reliability and tool usage, biblical studies, hidden assumption reasoning, advanced mathematics, code fixes based on documentation specifications, rulebook and policy simulation, ARC-style grid puzzles, state machines, logic grids, citation resolution, counterfactual reasoning, and more. To prevent any single domain from dominating training, the character distribution is deliberately limited, with code-related content comprising about 28% of characters, while ARC grid interaction domains account for less than 5%. The dataset includes two main columns: the chatml column stores complete multi-turn dialogue training examples, covering system messages, user inputs, assistant responses, and tool calls (if applicable); the difficulty column identifies the difficulty level of each sample, categorized as easy, medium, hard, and adversarial. This version is explicitly labeled as a preview and may have issues, not being the final production release.

创建时间:
2026-07-11
原始信息汇总

数据集概述

  • 名称: mediumish-small-agent-sft-preview-v0.1
  • 许可证: other(未具体说明)
  • 语言: 英语 (en)
  • 任务类别: 文本生成 (text-generation)
  • 数据大小: 1K < n < 10K 行(共 6,976 行)

数据集描述

该数据集是通过程序化生成的 ChatML 格式 SFT 数据,专为中小型模型设计,覆盖以下能力:

  • 代理工具使用(agentic tool use)
  • 反幻觉习惯(anti-hallucination habits)
  • 有依据的拒绝(grounded refusal)
  • 多步推理(multi-step reasoning)
  • 相关认知行为(epistemic behaviors)

领域分布

数据横跨 20 个领域,每个领域字符占比被刻意限制,避免单一领域占据过多 token:

  • 可靠性/工具使用
  • 圣经研究
  • 隐含假设推理
  • 高级数学
  • 符合文档规范的代码修复
  • 规则/政策模拟
  • ARC 风格网格谜题
  • 状态机
  • 逻辑网格
  • 引用消解
  • 反事实推理
  • 及其他更多领域

字符占比示例

  • code 领域约占 28%
  • ARC 网格交互领域低于 5%

数据列

列名 说明
chatml 完整的多轮训练示例(包含 system/user/assistant/tool 轮次)
difficulty 难度级别:easy, medium, hard, adversarial

注意事项

  • 当前版本为 预览版,可能存在缺陷,非最终生产版本。
搜集汇总
数据集介绍
mediumish-small-agent-sft-preview-v0.1 数据集图片
构建方式
该数据集通过程序化生成方式构建,专为中小型语言模型的监督微调(SFT)而设计。其构建过程覆盖20个领域,包括工具使用的可靠性、圣经研究、隐含假设推理、高级数学、基于规范文档的代码修复、规则与政策模拟、ARC风格网格谜题、状态机、逻辑网格、指代消解、反事实推理等。每个领域的字符比例被精心控制,确保无单一领域主导整体token预算,例如代码领域约占28%字符,而ARC网格交互领域则低于5%。最终生成6,976条样本,替代了早期5,000行的预览版本,并包含‘简单’、‘中等’、‘困难’及‘对抗性’四种难度等级。
使用方法
该数据集主要用于中小型语言模型的监督微调(SFT),使用者可直接利用‘chatml’列中的多轮对话样本进行训练。每条样本包含完整的系统、用户、助手及工具调用轮次,格式遵循ChatML规范,便于集成到标准训练管道中。建议用户根据设定的‘difficulty’难度标签(简单、中等、困难、对抗性)进行分层采样或渐进式训练,以优化模型在不同复杂度任务上的学习效果。数据集以预览形式发布,用户需在使用中排查潜在问题,并可作为进一步开发最终版本的基础素材。
背景与挑战
背景概述
在大型语言模型(LLM)的微调领域,提升模型在工具调用、多步推理和抗幻觉等智能体行为上的表现已成为关键研究方向。mediumish-small-agent-sft-preview-v0.1 数据集由研究团队于近期发布,旨在为中小型模型提供程序化生成的聊天标记语言(ChatML)监督微调数据。该数据集包含 6976 条样本,横跨 20 个精心设计的领域,如可靠性工具使用、圣经研究、隐含假设推理、高级数学、代码修复、规则书模拟、ARC 风格网格谜题等,并刻意限制了每个领域的字符占比以防止单一领域主导,展现了其在多维度智能体行为训练中的创新价值。作为预览版本,该数据集为中小规模模型的智能体能力提升提供了重要资源,有望推动相关研究边界。
当前挑战
该数据集聚焦于解决中小型模型在智能体场景下的关键缺陷,包括工具使用的可靠性、抗幻觉能力、基于根据的拒绝回答以及多步推理的连贯性,这些是当前语言模型在复杂任务中普遍存在的瓶颈。构建过程中,数据生成面临领域多样性与平衡性的挑战——需要确保 20 个不同领域(如代码修复仅占字符的 28%,而 ARC 网格互动领域低于 5%)的样本具有足够代表性,同时避免单一领域过度影响模型行为。此外,程序化生成方式需保证数据质量与真实性,防止引入系统性偏差,而预览版本本身可能存在的未知问题也需后续评估与迭代优化。
常用场景
经典使用场景
mediumish-small-agent-sft-preview-v0.1数据集专为中小规模语言模型的指令微调设计,其核心使用场景聚焦于提升模型的智能体工具调用能力。通过包含多步推理、反事实推理、参考消解等复杂认知行为的训练样本,该数据集使模型能够掌握在结构化环境中遵循规则并自主决策的技能。例如,模型可学习如何依据标准化文档修复代码缺陷,或模拟规则手册执行策略推演,从而在受限场景下展现出接近人类水平的逻辑连贯性。这种基于ChatML格式的多轮对话数据,尤其适合训练模型在交互式系统中执行工具调用、记忆维护与上下文敏感回应等行为,为构建可靠的智能体系统奠定数据基础。
解决学术问题
该数据集着力攻克大语言模型在知识边界认知与幻觉抑制方面的学术难题。传统模型常因过度自信而产生事实性错误,而本数据集通过引入基于规则的拒绝回答、隐藏假设推理及对抗性样本,系统性地训练模型在不确定情境下准确识别知识盲区。其涵盖的圣经研究、状态机转换等20个精心划分的领域,每个领域.token预算被刻意控制以避免主导偏差,从而确保模型在多领域任务中保持认知平衡。这种设计为解决‘模型何时应承认无知’这一核心哲学问题提供了实证路径,并推动了可靠性理论在语言模型中的实践应用,显著提升了模型在医疗、法律等高风险场景中的可信赖度。
实际应用
在实际工业部署中,该数据集可助力构建兼具严谨性与灵活性的智能助手系统。例如,在自动化代码审查场景中,模型能够依据技术规范精准定位修复点,而非生成存在逻辑漏洞的代码片段。在客户服务领域,数据集训练的模型可通过状态机逻辑模拟复杂的业务规则,对超出知识范围的客户需求执行优雅的拒绝响应,从而避免错误引导。此外,该数据集的ARC风格网格推理数据可应用于教育机器人的逻辑训练,使其能够解析抽象图形规律并生成可解释的推理链。这些应用显著降低了模型在实际部署中因幻觉导致的经济与声誉风险,加速了AI从‘对话工具’向‘可信赖协作伙伴’的进化。
数据集最近研究
最新研究方向
该数据集聚焦于面向中型及小型语言模型的指令微调数据构建,尤其在智能体工具调用、反幻觉机制、基于规则的多步推理等前沿方向上具有显著研究价值。通过覆盖圣经研究、隐藏假设推理、高级数学证明、ARC风格网格谜题等20个跨学科领域,该数据集在对抗性样本和困难样例的生成上进行了精心设计,旨在提升模型在复杂推理与工具交互场景下的鲁棒性与可控性,为当前语言模型从‘知识回忆’向‘智能协作’转型提供了关键的训练素材与评估基准,与近期热点如可解释AI、幻觉抑制和类人决策链建模形成紧密呼应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务