遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B42a94b69

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集包含4821个多轮对话样本,每个样本包含对话内容(conversations,由角色role和内容content组成)以及丰富的元数据,包括智能体(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和跟踪来源(trace_source)。数据集大小约为798MB,仅提供训练集分割。适用于对话系统性能评估、智能体行为建模、多轮对话生成等任务。

This dataset contains 4821 multi-turn dialogue samples, each consisting of conversation content (conversations, composed of role and content) and rich metadata, including agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset size is approximately 798MB, and only the training set split is provided. It is suitable for tasks such as dialogue system performance evaluation, agent behavior modeling, and multi-turn dialogue generation.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集概述:laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B42a94b69

基本信息

  • 数据集地址https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B42a94b69
  • 数据集大小:约 798.7 MBdataset_size: 798705290 字节)
  • 下载大小:约 435.5 MBdownload_size: 435506347 字节)
  • 数据划分:仅包含 train 分割,包含 4,821 个样本

数据特征(Features)

该数据集包含以下字段:

字段名 类型 说明
conversations 列表(包含 rolecontent 两个子字段,均为字符串类型) 对话记录,包含角色和内容
agent 字符串 智能体标识
model 字符串 所用模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 回合/轮次标识
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 任务结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据配置

  • 配置名称default
  • 数据文件路径data/train-*(使用通配符匹配多个分片文件)

数据用途推测

  • 该数据集名称中包含 SWE-bench(软件工程评测基准)、RL(强化学习)、DCAgent(可能为某种智能体架构)以及 pymethods2test(Python方法测试)等关键词,结合数据字段(如 agentepisodeverifier_output 等),推测该数据集可能用于软件工程任务的强化学习智能体训练与评估,尤其是基于对话的代码测试生成或方法级测试场景

补充说明

  • 数据集仅提供 train 分割,无独立的验证或测试分割。
  • 每个样本包含一组对话(conversations),以及对应的智能体行为、模型信息、任务信息和验证结果,可能用于训练或评估基于对话交互的智能体在代码测试生成任务上的表现。
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B42a94b69 数据集图片
构建方式
该数据集源自SWE-bench Verified基准测试,通过随机选取100个任务文件夹,并运用DCAgent强化学习框架进行交互式轨迹采集构建而成。每条数据记录包含了多轮对话序列(conversations),其中角色(role)与内容(content)字段对应智能体与环境交互的指令和响应,同时附加了代理(agent)、模型(model)、运行标识(run_id)等元数据,以及任务描述(task)、结果(result)和验证器输出(verifier_output),从而形成结构化的智能体决策轨迹数据集。
使用方法
本数据集适用于监督微调、偏好对齐及强化学习训练。用户可将其加载为HuggingFace数据集,利用conversations字段构造指令微调样本(将消息序列直接映射为模型输入),或结合result与verifier_output构建奖励模型训练信号。对于多轮决策任务,可采用agent、task及episode字段对轨迹进行分组,进而训练RL代理或进行环境模拟。该数据集的丰富元数据也便于过滤和分析特定模型或运行条件下的行为,如通过model_provider筛选不同基础模型的轨迹,以适应个性化研究需求。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B42a94b69,源于SWE-bench Verified基准的随机子集,旨在评估和训练大型语言模型在真实软件工程任务上的能力。数据集由DCAgent项目团队于2023年创建,聚焦于自动化代码修复,核心研究问题是如何利用强化学习与多智能体协作提升模型解决GitHub issue的效率。该数据集包含4821条对话轨迹,覆盖100个随机选取的仓库文件夹,记录了智能体执行任务的全过程,包括思考、行动和验证结果。其影响力在于为软件工程领域的大模型研究提供了高保真度的训练与评估资源,推动了自动化程序修复、智能体学习等方向的发展,尤其强化学习在代码生成领域的跨界应用。
当前挑战
数据集所解决的领域问题挑战在于,传统代码修复模型难以处理真实世界的复杂软件缺陷,其问题描述模糊、上下文庞大,且需要精确的代码修改能力,而SWE-bench任务要求模型在完整仓库环境中定位并修复缺陷,这远超简单的文本生成。构建过程中的挑战则体现在数据采集与标注的高成本:需从GitHub上筛选有效问题,并人工验证补丁的合格性,确保数据的权威性。同时,数据集的规模(约800MB)与轨迹多样性增加了处理难度,需设计高效的解析与存储方案,并保证对话数据的结构一致性,以支持大规模强化学习训练。此外,数据来源的随机性可能引入类别不均衡,需通过预处理策略加以缓解。
常用场景
经典使用场景
该数据集是SWE-bench Verified子集的一个精选切片,专为评估和训练自主软件工程智能体(如DCAgent)而设计。其核心使用场景聚焦于代码修复任务的端到端性能基准测试,研究者可基于其中包含的4821条多轮交互会话,模拟真实仓库环境中的问题解决流程。数据集中每一条样本均完整记录了智能体与环境的交互轨迹(conversations)、执行策略(agent、model)及最终修复结果(result),为复现强化学习(RL)与直接偏好优化(DPO)等训练范式提供了标准化语料。此数据集尤其适用于对比不同提示策略(如pymethods2test变体)对智能体代码生成能力的影响,是验证下一代自动化编程系统鲁棒性的关键测试床。
解决学术问题
该数据集直面软件工程领域长期存在的‘环境真实性与评估粒度’失衡难题。传统基准多为静态缺陷标注,难以反映智能体在动态编译、测试执行中的复杂决策过程。此数据集通过引入细粒度的元信息(如verifier_output、episode编号),使研究者能够量化分析策略探索效率与错误修正之间的因果关系,破解了从‘代码生成’到‘缺陷根因定位’的归因瓶颈。其设计支持对同一任务跨多次运行(run_id)的稳定性检验,为强化学习中的奖励稀疏问题提供了密集信号,显著推进了可解释性智能体研究,并为多模态学习(如自然语言指令与代码语法融合)建立了可复现的实验范式。
实际应用
在实际工程领域,该数据集可加速企业级自动化代码审查与修复系统的落地。借助其丰富的交互轨迹,开发团队能训练出更具上下文感知能力的AI结对程序员,直接部署于持续集成(CI)管道中,实现对拉取请求的即时缺陷定位与补丁建议。其次,数据集内的验证器输出可辅助构建回归测试优先级排序模型,降低软件迭代中的故障泄漏风险。此外,其高度结构化的存储格式(JSON)便于与现有开发工具链(如Jupyter Notebook、IDE插件)无缝集成,为中小型团队提供低成本定制化微调方案,推动‘大模型+自动验证’的闭环开发范式从实验室走向工业界,显著缩短软件交付周期并提升代码健壮性。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域大语言模型智能体的强化学习训练,依托SWE-bench Verified基准,通过随机抽取100个真实GitHub问题构建,旨在研究基于过程奖励的强化学习(RL)策略在代码修复任务中的效能。最新研究方向强调利用轨迹级反馈(如verifier_output)和多样化智能体行为(DCAgent)来提升模型对复杂缺陷的定位与修复能力,同时探索多轮交互(episode)和运行次数(run_id)对策略稳定性的影响。该数据集为评估LLM智能体在真实软件维护场景中的泛化性和鲁棒性提供了关键资源,推动代码智能从静态生成向动态交互式决策演化,对自动化程序修复和持续集成中的智能体部署具有重要实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务