遇见数据集

swebench_verified_random_100_folders_a3_rl_SankalpKJ_nemotron_code_oracle_filtered772b6a4c

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集包含多轮对话记录(conversations 字段,每个对话由角色 role 和内容 content 组成),以及相关的元数据:agent(代理标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务)、episode(轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)、trace_source(追踪来源)。训练集共有 5120 个样本,数据集总大小约 953 MB。

This dataset contains multi-turn conversation records (conversations field, each conversation consists of role and content), along with related metadata: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, trace_source. The training set has 5120 samples, and the total dataset size is approximately 953 MB.

提供机构:
LAION eV
创建时间:
2026-08-29
原始信息汇总

数据集概述

该数据集名为 laion/swebench_verified_random_100_folders_a3_rl_SankalpKJ_nemotron_code_oracle_filtered772b6a4c,托管于 Hugging Face 平台,是一个用于训练和评估代码智能体(Agent)的对话数据集,内容来源于 SWE-bench 验证集中的随机 100 个文件夹,并经过特定过滤处理。

数据规模

  • 数据集总大小:约 999.8 MB(dataset_size
  • 下载大小:约 448.9 MB(download_size
  • 数据划分:仅包含 train 划分
  • 样本数量train 划分共有 5120 条样本

数据特征(Features)

每条样本包含以下字段:

字段名 类型 说明
conversations 列表(包含 rolecontent 字段,均为字符串) 对话记录,其中 role 表示角色(如用户、助手),content 为对话内容
agent 字符串 使用的智能体类型或名称
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 数据生成或记录的日期
task 字符串 任务描述或标识
episode 字符串 回合或迭代编号
run_id 字符串 运行标识符
trial_name 字符串 试验名称
result 字符串 执行结果或结论
verifier_output 字符串 验证器的输出信息
trace_source 字符串 追踪来源或数据源

配置信息

  • 配置名称default
  • 数据文件路径data/train-*(使用通配符匹配多个文件)

该数据集适用于代码生成、智能体行为分析、强化学习等场景的研究与模型训练。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_SankalpKJ_nemotron_code_oracle_filtered772b6a4c 数据集图片
构建方式
本数据集基于SWE-bench Verified基准,选取100个随机任务,通过强化学习框架(A3-RL)与Nemotron Code Oracle模型交互生成。数据采集过程记录了智能体在解决真实软件工程问题时的完整对话轨迹,包括任务描述、代码编辑、测试结果及验证输出等关键信息。每个样本包含角色-内容对的对话序列,并附带代理、模型、日期等元数据,确保了数据的可追溯性和实验的可复现性。
使用方法
数据集采用标准的对话格式,可直接用于指令微调或强化学习训练。研究人员可使用此数据集分析智能体在解决软件工程任务时的策略,或作为基准测试新模型和算法的性能。结合verifier_output字段,可对模型输出进行自动化评估。该数据集适用于自然语言处理、代码生成和自主代理等多个研究领域,为开发更强大的编程辅助工具提供了数据支撑。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a3_rl_SankalpKJ_nemotron_code_oracle_filtered772b6a4c,源自SWE-bench Verified基准,由SankalpKJ等人于近期构建,旨在通过强化学习(RL)训练代码生成模型,以解决真实世界软件工程问题。数据集从SWE-bench Verified中随机选取100个文件夹,利用Nemotron模型和Oracle过滤机制,生成包含5120个训练样本的对话轨迹,每个样本记录了智能体解决问题的完整交互过程。该数据集聚焦于代码修复与程序合成领域,为评估和改进大型语言模型在多步推理、工具调用及代码修复上的能力提供了关键资源,推动了代码智能体研究的发展。
当前挑战
该数据集面临的核心挑战包括:领域问题层面,代码修复需处理复杂代码库、多样Bug类型及长序列推理,模型需具备代码理解、定位和修改能力,而现有模型在细粒度修复上仍精度不足;构建过程层面,数据生成依赖强大的Oracle模型进行过滤,但如何保证过滤后的数据质量与多样性、避免模型过拟合特定代码风格,以及处理强化学习中奖励稀疏和探索效率低的问题,均是构建过程中面临的主要难题。
常用场景
经典使用场景
该数据集源自SWE-bench验证集,选取了100个随机文件夹,并经过强化学习与Nemotron代码Oracle过滤,形成了包含5120条对话轨迹的高质量语料。其经典使用场景在于训练和评估智能编码代理(agent)在真实软件工程任务中的性能,尤其是代码生成、缺陷修复和单元测试生成等环节。每条记录完整保留了多轮人机交互的对话序列、代理执行轨迹及验证结果,为构建端到端的自动化编程系统提供了标准化基准。研究者可借此微调大型语言模型,使其在理解自然语言需求、检索相关代码上下文并生成可运行补丁等综合能力上获得显著提升。
解决学术问题
该数据集有效缓解了软件工程与自然语言处理交叉领域内的高质量训练数据稀缺问题,为研究代码智能体在复杂仓库级任务中的决策机制提供了翔实素材。学术上,它支持探索多轮交互中策略优化(如强化学习)、错误纠正和上下文利用等核心挑战,推动了从静态代码生成向动态环境互动的范式转变。其过滤机制确保了数据的正确性与多样性,使得研究可以聚焦于模型泛化能力与鲁棒性分析,为构建具备自主规划与自我修正能力的算法奠定了数据基础,对代码大模型领域的实证研究具有深远意义。
实际应用
在实际应用中,该数据集被用于开发企业级的智能编程助手和自动化运维工具,例如代码审查辅助系统、缺陷自动修复流水线以及需求到代码的生成平台。开发团队可利用这些对话轨迹训练模型,使其在集成开发环境(IDE)中实时提供代码补全、bug定位与修复建议,并能与开发者以自然语言进行交互。此外,该数据也适用于构建软件工程教育场景下的虚拟导师,帮助学习者通过实战案例理解编程范式。凭借其高质量的验证结果,该系统可减少人工代码评审的负担,加速软件开发周期,在金融科技、云计算等对代码质量要求严苛的行业中尤具价值。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程基准测试(SWE-bench)的强化学习与代码生成优化,融合了真实世界代码仓库的复杂任务场景。当前研究前沿在于利用大规模语言模型(LLM)进行自主代码修复与智能体轨迹分析,结合验证器过滤机制提升模型在真实编程任务中的鲁棒性。该数据集通过随机采样与精细化筛选,为多轮交互学习提供了高难度样本,助力探索智能体在长链路推理中的决策能力,以及模型泛化与对齐性能的评估,对推动自动化软件维护与可信AI代码生成具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务