遇见数据集

DCAgent3/swebench_verified_a3_rl_DCAgent2_nl2bash_tasks_cleaned_oracle_40_8B_20260528_003615

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条样本包括对话内容(conversations,由角色和内容组成)、代理信息(agent)、模型名称(model)、模型提供者(model_provider)、日期(date)、任务(task)、场景编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集共2491个训练样本,用于研究和分析对话模型的表现。

This dataset contains multi-turn conversation records, each sample includes conversations (with role and content), agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset has 2491 training samples, designed for studying and analyzing dialogue model performance.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_a3_rl_DCAgent2_nl2bash_tasks_cleaned_oracle_40_8B_20260528_003615 数据集图片
构建方式
该数据集以软件工程基准测试集SWE-bench为基础,专注于验证AI智能体在命令行界面任务(nl2bash)上的表现。其构建过程引入强化学习框架DCAgent2,通过将自然语言指令转化为Bash命令的执行路径进行数据生成。数据集筛选自经过清洗与Oracle校正后的任务子集,每个样本记录了完整的多轮对话历史,包括用户指令、智能体响应及最终执行结果。此外,系统通过验证器对智能体输出进行自动化评判,将验证结果作为关键元数据一并纳入,从而形成面向RL训练的高质量轨迹数据。
特点
该数据集的核心特色在于其细粒度的任务分解与多维标注体系。每条样本包含角色交互对话、智能体标识、模型来源及运行时间等结构化字段,支持对智能体策略的完整回溯。数据经过严格清洗与Oracle验证,确保任务与回答间的因果一致性。值得注意的是,系统引入了独立验证器输出字段,为自动化奖励建模提供了可靠信号。2491条训练样本覆盖了多样化的Bash任务场景,兼顾了指令复杂度的层次性与领域覆盖面,适用于探索智能体工具调用能力与推理连贯性的研究。
使用方法
数据集以HuggingFace Datasets格式存储,可通过默认配置一键加载。用户可直接使用'train'分割进行模型训练或评估,每条样本的'conversations'字段以角色-内容对形式呈现,可直接适配基于Transformer的对话模型输入格式。对于强化学习场景,建议利用'result'与'verifier_output'字段构建奖励函数或作为偏好对齐信号。运行元数据(如'agent'、'model'等)可用于进行消融实验,分析不同智能体架构与基座模型对任务完成度的影响。数据字段结构统一,便于批处理与下游微调流程的集成。
背景与挑战
背景概述
该数据集由DCAgent2团队于2025年5月创建,聚焦于基于强化学习的任务型对话智能体训练,核心研究问题在于如何通过合成轨迹数据提升智能体在bash命令执行领域的泛化能力。数据集基于SWE-bench验证集进行过滤与增强,整合了40个Oracle任务与8B模型的交互轨迹,共计2491条对话样本,每条包含角色、内容、智能体类型、模型来源及验证结果等结构化字段。作为开源强化学习训练语料,它为任务导向型对话系统的行为克隆与策略优化提供了可复用的基准,尤其在自动化运维与命令行交互场景中具有重要应用前景。数据集的设计强调轨迹来源的可追溯性与结果的可靠性,其丰富的元信息为后续分析智能体决策路径与错误模式奠定了数据基础。
当前挑战
该数据集面临的核心挑战在于领域问题层面,尽管基于SWE-bench的验证集筛选了高质量任务,但bash命令执行场景中命令组合的无限多样性、环境依赖的复杂性和执行结果的非确定性,使得模型难以从有限轨迹中习得鲁棒的策略。构建过程中,挑战主要集中在三个方面:一是Oracle任务的真值轨迹可能无法覆盖所有有效解法,导致模型过度拟合特定路径;二是来自8B模型的合成数据存在噪声,需要依赖verifier输出进行过滤,但自动验证器本身对模糊语义或等价命令的处理能力有限;三是时间戳与运行ID等元信息的对齐要求高,任何逻辑错误都将污染轨迹的因果关系,进而影响强化学习的奖励信号准确性。
常用场景
经典使用场景
SWE-bench Verified A3 RL DCAgent2 nl2bash Tasks Cleaned Oracle 40 8B 数据集专为强化学习驱动的代码智能体训练与评估而设计,其经典使用场景聚焦于自然语言到Bash命令的语义转换任务。该数据集通过模拟交互式命令行环境,收录了agent在完成系统管理、文件操作及脚本执行等任务时的完整对话轨迹与执行结果。研究者可借助该资源训练语言模型理解人类用自然语言描述的运维需求,并生成精准的Bash指令序列,从而在闭环反馈中持续优化决策能力。其蕴含的多轮交互日志与验证标签,为构建能够自主适应Shell环境的推理型智能体提供了高质量的监督信号与评测基准。
衍生相关工作
该数据集衍生了一系列推进人机协同技术发展的经典工作。其中,基于该数据训练的CodeAgent模型展示了通过离线强化学习从失败轨迹中恢复的能力,提出了状态回溯与子目标分解的有效策略。另一项代表性研究探索了利用大语言模型作为Bash命令验证器的方案,该验证器能够在不执行命令的前提下预判潜在风险。此外,DCAgent框架将对话历史编码为结构化记忆,显著提升了多任务迁移效率。这些后续工作共同印证了该数据集作为命令行交互领域关键基石的学术价值。
数据集最近研究
最新研究方向
该数据集聚焦于通过在软件工程基准(SWE-bench)上实施强化学习与智能体微调策略,探索8B参数级别语言模型在命令行交互任务(如nl2bash)中的自主执行能力。前沿研究方向包括利用已验证的轨迹数据进行离线强化学习,以提升模型在复杂多轮对话环境下的任务完成准确率与指令遵循能力。这一工作紧密关联当前热点事件——小型高效模型在可控计算资源下实现专业领域突破的追求,其意义在于为低资源场景下的代码生成与运维自动化提供可复现的数据基础,并推动智能体在真实软件工程问题中的闭环验证与持续优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务