遇见数据集

open-thoughts/OpenThoughts-Agent-v1-SFT

收藏
Hugging Face2026-01-27 更新2025-12-20 收录
官方服务:

资源简介:

OpenThinker-Agent-v1是一个开源项目,旨在为训练智能体(agents)提供最佳数据集。该项目的第一版包括了数据集、模型和研究代码库。OpenThinker-Agent-v1模型专为智能体任务设计,如Terminal-Bench 2.0和SWE-Bench。该模型基于Qwen/Qwen3-8B进行后训练,首先在OpenThoughts-Agent-v1-SFT数据集上进行监督微调(SFT),然后在OpenThoughts-Agent-v1-RL数据集上进行强化学习(RL)。OpenThoughts-Agent-v1-SFT数据集包含约15,200条轨迹,来源于两个数据源:nl2bash(简单合成生成的格式化shell命令任务)和InferredBugs(由微软收集的C#和Java中的bug集合)。OpenThoughts-Agent-v1-RL数据集包含约720个任务,来源于nl2bash验证数据集。项目还包括了训练超参数和框架版本的详细信息。

OpenThinker-Agent-v1 is an open-source effort to curate the best datasets for training agents. The first release includes datasets, models, and the research codebase. The OpenThinker-Agent-v1 model is trained for agentic tasks such as Terminal-Bench 2.0 and SWE-Bench. It is post-trained from Qwen/Qwen3-8B, SFT-ed on the OpenThoughts-Agent-v1-SFT dataset, and then RL-ed on the OpenThoughts-Agent-v1-RL dataset. The OpenThoughts-Agent-v1-SFT dataset contains approximately 15,200 traces from two data sources: nl2bash (simple synthetically generated tasks for formatting shell commands) and InferredBugs (a set of bugs in C# and Java collected by Microsoft). The OpenThoughts-Agent-v1-RL dataset contains ~720 tasks drawn from the nl2bash verified dataset. The project also details the training hyperparameters and framework versions used.

提供机构:
open-thoughts
搜集汇总
数据集介绍
构建方式
在智能体(Agent)任务日益成为自然语言处理前沿方向的背景下,OpenThoughts-Agent-v1-SFT数据集应运而生,旨在为训练具备终端操作与代码工程能力的智能体提供高质量的监督微调数据。该数据集通过两阶段流水线精心构建:首先,从nl2bash和InferredBugs两个数据源中分别获取简单合成的Shell命令格式化任务与微软收集的C#及Java程序缺陷修复任务;随后,利用QuantTrio/GLM-4.6-AWQ大语言模型结合Terminus-2智能体框架,在最多32轮交互与64K上下文长度的约束下自动生成约15,200条完整轨迹。这一过程确保了数据在任务多样性与执行逻辑上的真实性,为后续的强化学习阶段奠定了坚实基础。
特点
该数据集最显著的特点在于其专注于真实世界的智能体应用场景,涵盖终端命令操作与软件工程缺陷修复两大核心领域,体现了从简单到复杂的任务层次。每条轨迹均包含完整的智能体思考与行动链条,且通过严格的过滤机制保障质量——包括剔除不稳定或耗时过长的验证器、排除环境构建缓慢的任务,以及过滤掉即使强模型也无法一次性解决的困难样本。此外,数据集规模适中(约15,200条),兼顾了覆盖度与训练效率,并采用Apache-2.0开源许可,便于研究社区进行复现与扩展。
使用方法
使用OpenThoughts-Agent-v1-SFT数据集时,研究者可将其作为监督微调阶段的训练语料,直接加载至基于Transformers框架的语言模型中进行指令微调。推荐采用多GPU分布式训练策略,初始学习率设为4e-05,批次大小根据设备调整,并配合余弦学习率调度器与7个训练周期。该数据集与配套的OpenThoughts-Agent-v1-RL数据集形成完整训练管线,用户可先使用本数据集进行SFT训练,再结合RL数据集进行强化学习微调,以最大化模型在Terminal-Bench 2.0和SWE-Bench等智能体基准上的性能表现。
背景与挑战
背景概述
在智能体(Agent)技术迅猛发展的背景下,如何高效训练具备复杂任务执行能力的大语言模型成为研究焦点。OpenThoughts-Agent-v1-SFT数据集由OpenThoughts团队于2025年12月发布,旨在为智能体任务提供高质量的监督微调(SFT)训练轨迹。该数据集包含约15,200条轨迹,主要源自nl2bash(合成命令行格式化任务)与InferredBugs(微软收集的C#和Java程序缺陷修复任务),通过GLM-4.6-AWQ模型与Terminus-2智能体框架生成,最大交互轮次为32轮、上下文长度达64K。作为OpenThinker-Agent-v1模型训练的关键组件,该数据集与后续的强化学习阶段协同,在Terminal-Bench 2.0和SWE-Bench Verified等基准上取得了8B参数规模的最优性能,为开源智能体研究树立了重要标杆。
当前挑战
该数据集所解决的领域挑战在于,现有开源数据集多聚焦于静态语言理解或简单指令执行,缺乏针对终端操作与软件工程等复杂智能体任务的高质量训练资源。构建过程中面临多重挑战:其一,如何设计合成任务(nl2bash)以覆盖多样化的命令行操作模式,同时确保任务难度与真实场景匹配;其二,从微软InferredBugs中转化而来的缺陷修复任务需精心标注与适配,以保持任务逻辑的完整性;其三,利用教师模型生成轨迹时,需平衡生成成本与轨迹质量,并通过三阶段过滤管道(剔除不稳定的验证器、环境构建缓慢的容器以及强模型单次无法解决的困难任务)来保障数据可靠性,最终在15,200条轨迹中实现高效的知识蒸馏与模型泛化能力提升。
常用场景
经典使用场景
OpenThoughts-Agent-v1-SFT 数据集专为训练具备终端操作与软件工程能力的智能体而设计,其经典使用场景聚焦于智能体在命令行环境中的任务执行。该数据集包含约15,200条监督微调轨迹,源自nl2bash(自然语言到Shell命令的合成任务)与InferredBugs(微软收集的C#和Java程序缺陷修复任务)两大来源。研究者利用这些轨迹对基础模型(如Qwen3-8B)进行指令微调,使其能够理解复杂自然语言描述并生成精准的终端命令序列,从而在Terminal-Bench 2.0和SWE-Bench等基准测试中展现卓越性能。这一场景的核心在于弥合自然语言与底层系统操作之间的鸿沟,推动语言模型从静态文本生成迈向动态环境交互。
衍生相关工作
该数据集衍生了多项经典工作,包括OpenThinker-Agent-v1模型的完整训练管线,其先通过SFT阶段学习基本行为模式,随后利用OpenThoughts-Agent-v1-RL数据集进行强化学习以优化决策策略。研究者还开发了Terminus-2智能体框架,作为统一的执行与评估环境,并构建了OpenThoughts-TB-Dev开发集用于模型迭代。后续工作探索了基于GLM-4等强教师模型的数据蒸馏方法,以及针对任务难度和验证器稳定性的三级过滤管道,这些成果共同构成了从数据生成、模型训练到评估部署的完整生态,为智能体学习研究树立了可复用的标杆。
数据集最近研究
最新研究方向
在智能体(Agent)领域,前沿研究正从单纯的指令遵循转向复杂环境下的自主决策与工具调用,尤其是结合终端操作与软件工程任务的端到端学习范式。OpenThoughts-Agent-v1-SFT数据集应运而生,它聚焦于通过监督微调(SFT)与强化学习(RL)两阶段训练,构建具备终端交互与代码修复能力的轻量级模型。该数据集包含约1.5万条高质量轨迹,覆盖shell命令生成与推断软件缺陷修复等任务,并引入多阶段过滤机制确保训练稳定性。其训练的OpenThinker-Agent-v1模型在Terminal-Bench 2.0和SWE-Bench等基准上取得了同规模最优性能,显著推动了开源智能体在自动化运维与软件工程领域的实用化进程,为构建可复现、可泛化的智能体系统奠定了重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务