遇见数据集

swebench_verified_random_100_folders_a3_rl_laion_nemotron_gym_knowledge_web_search19f35c3f

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条对话由角色(role)和内容(content)组成。此外,还提供了与对话相关的元数据,包括使用的智能体(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务类型(task)、对话轮次号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集共包含 5040 个训练样本,总大小约 988MB。适用于多轮对话分析、对话系统评估、模型行为研究等任务。

This dataset contains multi-turn dialogue records, each consisting of a role and content. Additionally, it provides metadata related to the dialogues, including the agent used, model name, model provider, date, task type, episode number, run ID, trial name, result, verifier output, and trace source. The dataset comprises 5040 training samples with a total size of approximately 988MB. It is suitable for tasks such as multi-turn dialogue analysis, dialogue system evaluation, and model behavior research.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集详情:laion/swebench_verified_random_100_folders_a3_rl_laion_nemotron_gym_knowledge_web_search19f35c3f

数据集概述

该数据集名为 swebench_verified_random_100_folders_a3_rl_laion_nemotron_gym_knowledge_web_search19f35c3f,由 Laion 组织发布,包含 SWE-bench 验证集中随机选取的 100 个文件夹相关数据,用于强化学习(RL)训练场景,涉及知识检索与网络搜索任务。数据集中主要包含多轮对话记录以及对应的代理执行日志,适用于 AI 代理任务规划与执行研究。

数据集结构

特征字段

字段名 类型 说明
conversations 列表(list) 多轮对话记录,每轮包含以下两个子字段:<br>- role:字符串(string),如用户(user)或助手(assistant)<br>- content:字符串(string),对话的内容文本
agent 字符串(string) 代理标识
model 字符串(string) 使用的模型名称
model_provider 字符串(string) 模型提供方(如 OpenAI、Laion 等)
date 字符串(string) 数据产生日期
task 字符串(string) 任务描述
episode 字符串(string) 训练轮次/情节编号
run_id 字符串(string) 运行 ID
trial_name 字符串(string) 试验名称
result 字符串(string) 执行结果(如通过/失败等)
verifier_output 字符串(string) 验证器输出(用于判定结果)
trace_source 字符串(string) 轨迹来源(如网络搜索、知识图谱等)

数据划分

  • 分割名称:train(训练集)
  • 训练集大小:988,574,662 字节(约 0.99 GB)
  • 训练集样本数:5,040 条
  • 数据集总大小:988,574,662 字节(约 0.99 GB)
  • 下载大小:478,448,697 字节(约 0.48 GB)

配置与文件

  • 默认配置名称:default
  • 数据文件路径data/train-*(训练集数据文件,使用通配符匹配多个分片文件)

主要用途

该数据集主要用于:

  • 强化学习训练:用于训练 AI 代理(agent)在 SWE-bench 任务上进行代码修复或问题解决,结合网络搜索和知识检索提高能力。
  • 多轮对话建模:记录代理与环境的完整交互过程,可用于研究代理决策、工具使用和反思。
  • 结果验证:包含验证器输出和任务结果,便于评估模型性能。

数据规模特点

  • 共有 5,040 条训练样本,每个样本包含完整的多轮对话和元数据。
  • 数据集大小接近 1GB,属于中等规模数据集,适合用于训练和评测。
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_laion_nemotron_gym_knowledge_web_search19f35c3f 数据集图片
构建方式
本数据集源自SWE-bench Verified基准,通过随机抽样100个真实软件工程任务,并运用强化学习环境与网络搜索工具,由Nemotron模型生成交互轨迹。每条数据记录包含完整的多轮对话(角色与内容)、智能体标识、模型信息、任务描述、运行参数及最终验证结果,构建过程严谨且可复现,旨在捕捉智能体在复杂代码仓库中的动态决策过程。
特点
数据集独具匠心地融合了代码修复任务、智能体行为轨迹与外部知识检索,呈现高度异质性与真实性。其规模宏大,包含5040条样本,每条样本附有详尽的元数据(如运行ID、试验名称、溯源信息),便于细粒度分析。尤为突出的是,数据涵盖成功与失败案例,并通过验证器输出客观标注,为研究智能体策略优劣提供宝贵素材。
使用方法
该数据集适用于监督式微调、强化学习及多模态智能体评估等研究场景。使用者可按标准HuggingFace格式加载,利用conversations字段构建对话训练数据,亦可借助agent、result等字段进行策略对比或错误分析。建议结合代码仓库上下文,探索智能体为何采取特定行动,以优化决策路径,推动自主软件开发智能体的发展。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a3_rl_laion_nemotron_gym_knowledge_web_search19f35c3f,由LAION团队于2025年创建,旨在构建一个用于强化学习训练与评估的智能体对话轨迹集。其核心基于SWE-bench Verified基准,随机选取100个代码仓库文件夹,融合Nemotron模型、Gym环境与知识检索及网络搜索功能,生成5040条多轮人机交互对话。该数据集针对真实软件工程问题,为研究智能体在复杂编程任务中的决策与工具调用能力提供了规模化语料,对代码生成、自主代理及强化学习领域具有重要推动作用。
当前挑战
该数据集面临的挑战涵盖领域与构建两个层面。领域上,SWE-bench Verified聚焦于软件缺陷修复,需解决跨文件、跨函数的代码理解与补丁生成难题,而引入多工具(检索与搜索)进一步加剧了动作空间复杂性。构建过程中,挑战包括从100个随机仓库中筛选出高质量问题,确保多样性与代表性;生成包含长程依赖的交互轨迹,需协调RL训练策略(如A3)与基础模型(Nemotron)的稳定性;同时,每条约1.5MB的数据体量对存储、清洗及质量验证(如verifier_output)提出了严苛要求,防止噪声数据导向偏差。
常用场景
经典使用场景
该数据集源自SWE-bench的验证子集,经随机采样100个任务文件夹构建而成,专用于评估和训练具备代码生成与仓库级问题解决能力的智能体。其核心使用场景聚焦于指令遵循与多轮交互式编程,通过记录智能体在真实GitHub问题上的完整轨迹(包括思考、行动、工具调用及最终补丁),为强化学习(RL)和基于搜索的推理方法(如Web搜索辅助)提供基准。研究者可借此测试模型在复杂代码库中的定位、修改与验证能力,特别适合作为代码智能体的训练语料或少样本提示库,以提升模型在真实软件工程任务上的泛化性能。
解决学术问题
该数据集应对的关键学术挑战在于如何评估并改进大型语言模型在端到端软件工程任务上的表现,而非孤立的代码生成。传统代码基准多聚焦于单文件或函数级生成,忽视了仓库上下文、依赖关系和测试驱动的验证。此数据集通过结合SWE-bench的严格验证机制与随机采样的多样性,支持研究者探究模型在长上下文理解、多步规划、工具使用(如执行测试)以及失败后自我修正等核心能力上的瓶颈。其意义在于推动从‘代码补全’向‘问题解决’的范式转换,为建立更贴近工业实践的代码智能评估体系提供了实证基础,并促进了对RL算法在代码代理训练中有效性的深入分析。
衍生相关工作
由此数据集衍生的工作主要围绕智能体训练策略与评估协议的创新。一方面,它可作为SWE-bench系列研究的补充资源,用于验证新的提示工程、搜索增强生成(RAG)或基于回忆的代理架构(如使用历史教训来引导当前问题解决)的有效性。另一方面,基于其轨迹数据,研究者已探索了过程奖励模型(PRM)的训练,旨在取代稀疏的结果奖励,为每个中间决策步骤提供更细粒度的反馈。此外,该数据集还催化了关于‘学习如何学习’的工作,即通过元学习或离线RL,让代理从过往尝试中抽象出可迁移的调试策略。这些衍生的研究不仅深化了对代码智能体学习机制的理解,也为构建更鲁棒、更高效的自动化软件开发工具铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务