遇见数据集

pa-warm-start-sft-heavy-25b-mix

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是一个大型多任务对话数据集,包含多个子集(config_name),每个子集具有相同的特征结构。特征包括:消息序列(messages),内含内容(content)、推理内容(reasoning_content)、角色(role)以及工具调用(tool_calls,包含函数名、参数、ID和类型);工具定义(tools)列表,包含函数描述、名称、参数、严格模式等;来源(source)、系统提示ID(system_prompt_id)、推理长度(reasoning_len)、思维链长度统计(cot_lengths_chars及均值、最小值、最大值)、原始文本(raw_text)和令牌数(n_tokens)。每个子集仅包含训练集(train)。子集名称覆盖多种领域:agentic_interactive(代理交互)、agentic_search_v2(搜索)、agentic_tool_calling_v2(工具调用)、arc_agi_reasoning(ARC-AGI推理)、arc_agi_tools(ARC-AGI工具)、chat_multiturn(多轮聊天)、chat_v2_if(指令跟随)、comp_prog_python_00/01(Python编程)、comp_prog_v1_00/01(通用编程)、default(默认,包含570万样本)、finance(金融)、math_proofs(数学证明)、math_v4(数学)、opencode(开放代码)、science_rqa_plain(科学问答)。总样本数约570万(default子集),其余子集样本数从数千到数十万不等。该数据集适用于训练和评估具备推理、工具使用和多轮对话能力的语言模型。

This dataset is a large-scale multi-task dialogue dataset containing multiple subsets (config_name), each with the same feature structure. Features include: message sequences (messages) with content, reasoning_content, role, and tool_calls (including function name, arguments, ID, and type); a list of tool definitions (tools) including function description, name, arguments, strict mode, etc.; source, system_prompt_id, reasoning_len, chain-of-thought length statistics (cot_lengths_chars with mean, min, max), raw_text, and n_tokens. Each subset only contains a training set (train). Subset names cover various domains: agentic_interactive, agentic_search_v2, agentic_tool_calling_v2, arc_agi_reasoning, arc_agi_tools, chat_multiturn, chat_v2_if, comp_prog_python_00/01, comp_prog_v1_00/01, default (with 5.7 million samples), finance, math_proofs, math_v4, opencode, science_rqa_plain. The total sample count is about 5.7 million (default subset), while other subsets range from thousands to hundreds of thousands. This dataset is suitable for training and evaluating language models with reasoning, tool use, and multi-turn dialogue capabilities.

创建时间:
2026-08-19
原始信息汇总

数据集概览:pa-warm-start-sft-heavy-25b-mix

基本信息

  • 数据集地址:https://huggingface.co/datasets/geodesic-research/pa-warm-start-sft-heavy-25b-mix
  • 数据集用途:用于25B参数模型的预热启动监督微调(SFT),包含多种任务类型的混合数据

数据集配置与规模

该数据集包含17个配置(config),各配置的规模如下:

配置名称 训练样本数 数据集大小(字节) 下载大小(字节)
agentic_interactive 113,486 4,957,291,098 2,696,305,490
agentic_search_v2 3,365 630,306,219 368,388,247
agentic_tool_calling_v2 417,960 16,742,441,902 7,466,947,433
arc_agi_reasoning 49,917 6,785,437,092 2,102,018,861
arc_agi_tools 28,001 4,299,313,461 1,135,112,239
chat_multiturn 161,376 3,966,465,348 2,194,450,980
chat_v2_if 829,290 17,474,115,116 11,969,241,270
comp_prog_python_00 63,048 11,229,300,441 1,649,706,231
comp_prog_python_01 49,598 10,940,752,598 2,619,657,950
comp_prog_v1_00 620,987 59,122,901,496 25,026,537,086
comp_prog_v1_01 622,932 58,947,433,222 25,011,683,544
default 5,702,903 172,402,992,431 122,065,778,334
finance 36,498 7,059,493,033 3,889,158,890
math_proofs 9,497 2,847,721,278 1,121,735,853
math_v4 243,184 18,758,134,787 7,540,174,095
opencode 36,779 4,763,239,317 3,202,822,445
science_rqa_plain - - -

数据结构与特征

所有配置共享统一的数据特征结构,包含以下字段:

核心字段

  • messages:对话消息列表,每条包含:
    • content(字符串):消息内容
    • reasoning_content(字符串):推理内容
    • role(字符串):角色标识
    • tool_calls(列表):工具调用信息,包含函数名称、参数、ID和类型
  • tools:工具定义列表,包含函数描述、名称、参数及严格模式标志
  • source(字符串):数据来源
  • system_prompt_id(int64):系统提示词标识符
  • reasoning_len(int64):推理长度

思维链统计字段

  • cot_lengths_chars(int64列表):思维链字符长度列表
  • cot_chars_mean(float64):思维链字符均值
  • cot_chars_min(int64):思维链字符最小值
  • cot_chars_max(int64):思维链字符最大值
  • raw_text(字符串):原始文本
  • n_tokens(int64):Token数量

数据覆盖领域

数据集涵盖以下任务类型:

  • 智能体交互:包括交互式智能体、智能体搜索、工具调用场景
  • 编程竞赛:Python编程竞赛、通用编程竞赛
  • 数学推理:数学证明、数学问题求解
  • 通用对话:多轮对话、指令跟随
  • 金融:金融领域数据
  • 科学问答:科学研究问答
  • ARC-AGI:抽象推理挑战任务
  • 开放编码:开源编码相关数据
搜集汇总
数据集介绍
pa-warm-start-sft-heavy-25b-mix 数据集图片
构建方式
该数据集名为 pa-warm-start-sft-heavy-25b-mix,是从大规模多源数据中精心筛选并混合而成,旨在为大型语言模型的监督微调提供高质量的训练语料。其构建方式涉及多配置融合,包括 agentic_interactive、agentic_search_v2、agentic_tool_calling_v2、arc_agi_reasoning、arc_agi_tools、chat_multiturn、chat_v2_if、comp_prog_python_00、comp_prog_python_01、comp_prog_v1_00、comp_prog_v1_01、finance、math_proofs、math_v4、opencode、science_rqa_plain 等多个子集,每个子集均包含完整的对话记录、工具调用信息及推理过程。数据以 messages、tools、source、system_prompt_id 等字段结构化存储,并附带 reasoning_len、cot_lengths_chars、cot_chars_mean 等统计特征,用以刻画推理链的长度与复杂度。整体数据集规模宏大,train 分割包含超过 570 万条样本,数据字节数超过 172 GB,涵盖了代码生成、数学推理、金融分析、科学问答、工具使用等多元化任务场景,体现了构建者对数据多样性与全面性的深度考量。
特点
该数据集的核心特征在于其融合了推理与工具调用的双重视角,每个样本不仅包含常规的对话内容,还明确标注了 reasoning_content 字段,记录了模型的内部推理过程,这对于训练具有可解释性和逻辑连贯性的模型至关重要。数据集中还包含了工具定义(tools)及调用序列(tool_calls),使其能够有效支撑基于代理(agent)的交互式任务,如搜索、代码执行等。此外,每个子配置都提供了丰富的元数据,如源信息(source)、系统提示标识(system_prompt_id)以及量化推理长度的指标(reasoning_len、cot_lengths_chars 等),便于研究者分析推理模式与输出质量的关系。数据规模庞大且覆盖领域广泛,从数学证明到金融分析,从 Python 编程到科学问答,为模型提供了多学科、多任务的训练基础,有助于提升模型的泛化能力与专业适应性。
使用方法
该数据集适用于对大型语言模型进行监督微调,尤以强化模型在复杂任务中的推理与工具使用能力为佳。使用者可根据具体需求选择相应的配置子集,例如针对代码生成任务可选用 comp_prog_python_00 或 comp_prog_v1_00,针对数学推理可选用 math_proofs 或 arc_agi_reasoning,针对通用对话可选用 chat_multiturn 或 default 配置。在加载时,需注意各配置的样本量和存储大小差异,合理安排算力资源。数据集提供了标准化 HuggingFace 格式,可通过 datasets 库直接加载,每个样本已按对话序列(messages)组织,并包含工具架构定义,便于直接用于模型的训练脚本。建议在微调前对元数据字段(如 reasoning_len、n_tokens)进行统计分析,以平衡不同推理复杂度的样本分布,从而优化训练效果。
背景与挑战
背景概述
该数据集名为pa-warm-start-sft-heavy-25b-mix,是用于大语言模型监督微调(SFT)的复合型数据集,涵盖多任务、多领域对话与推理样本。其创建于2025年,由某研究团队基于实际应用需求构建,旨在提升模型在代理交互、工具调用、代码生成及数学推理等复杂任务上的能力。数据集包含多个子集,如agentic_interactive、comp_prog_python、math_v4等,总样本量超过五百万条,规模庞大且覆盖广泛。该数据集对相关领域的影响在于为模型训练提供了高质量的监督信号,尤其强化了模型在工具使用和长链推理方面的表现。
当前挑战
该数据集面临的挑战主要集中在两方面。在领域问题层面,它需应对多任务统一训练中任务冲突与知识迁移的难题,确保模型在不同任务间保持性能平衡;同时,高质量推理轨迹的构建成本极高,需兼顾正确性与多样性。在数据构建层面,挑战包括大规模数据的清洗与去重、各子集之间分布差异的协调,以及为每一条数据标注系统提示词和工具定义,确保格式一致性与标注准确性,此外还需平衡计算资源与数据量,保证训练效率。
常用场景
经典使用场景
该数据集名为'pa-warm-start-sft-heavy-25b-mix',是专为大型语言模型监督微调设计的高质量指令数据集合,其内容涵盖多轮对话、工具调用、智能体交互、编程、数学推理及金融问答等多元领域。其经典使用场景在于利用这些混合数据对预训练模型进行监督微调,使模型在遵循指令、调用外部工具及执行复杂任务方面获得显著提升。通过融合来自不同来源并带有详细推理链(reasoning_content)的样本,该数据集旨在强化模型的结构化思维与执行能力,是构建agentic AI系统不可或缺的基石。
实际应用
在实际应用层面,该数据集助力构建智能体导向的AI系统,可广泛应用于智能客服、代码自动生成、科研辅助与金融分析等场景。基于其训练的模型能理解并调用API、搜索数据库或操作软件,实现从简单问答到复杂任务自动化的跨越。例如,在金融领域,模型借助数据集中的专业对话可精准执行数据分析;在编程场景,它能够生成函数并调用测试工具,极大提升了开发效率。数据集覆盖多行业多样性数据,使其成为驱动现实世界智能应用落地的关键资源。
衍生相关工作
该数据集衍生了一系列相关研究与实践,尤其在强化学习与模型对齐方面。基于其丰富的监督微调样本,研究者们开发了针对agentic行为的奖励模型,训练用于偏好优化的策略模型,并探索了上下文强化学习等技术。此外,它促进了工具增强型语言模型的评估基准构建,催生了关于提示工程、思维链设计及模型自我纠错机制等多篇论文。在工程领域,它启发了众多开源项目,实现了参数高效微调与持续预训练的高效融合,推动了LLM在复杂交互场景中的性能跃升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务