遇见数据集

swebench_verified_random_100_folders_g1_a1_top16_32b_step3600_20260819_162251

收藏
Hugging Face2026-08-24 更新2026-08-26 收录
官方服务:

资源简介:

该数据集包含5122个训练样本,总大小约994MB。每条样本记录了一个多轮对话的完整交互过程,包含对话内容(角色与文本)、智能体名称、使用的模型名称及提供商、对话日期、任务名称、对话轮次(episode)、运行ID(run_id)、试验名称(trial_name)、最终结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。该数据集适用于对话智能体训练、模型评估、任务执行追踪与结果验证等场景。

This dataset contains 5122 training samples with a total size of approximately 994MB. Each sample records the complete interaction process of a multi-turn dialogue, including dialogue content (roles and text), agent name, model name and provider used, dialogue date, task name, dialogue episode, run ID, trial name, final result, verifier output, and trace source. This dataset is suitable for scenarios such as dialogue agent training, model evaluation, task execution tracking, and result verification.

提供机构:
LAION eV
创建时间:
2026-08-24
原始信息汇总

数据集详情总结

基本信息

  • 数据集名称laion/swebench_verified_random_100_folders_g1_a1_top16_32b_step3600_20260819_162251
  • 数据集地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_g1_a1_top16_32b_step3600_20260819_162251

数据集规模

  • 总大小:约 994 MB(字节数 994,332,409)
  • 下载大小:约 436 MB(字节数 436,501,549)
  • 数据划分:仅包含 train 划分
  • 样本数量:5,122 条样本(train 划分)

数据特征(Features)

该数据集包含以下字段:

字段名 数据类型 说明
conversations 列表(每项含 rolecontent 字段,均为字符串) 对话内容,记录交互过程中的角色与消息内容
agent 字符串 智能体标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 回合/轮次编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 结果信息
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

配置信息

  • 配置名称default
  • 数据文件路径data/train-*(支持通配符匹配多个 shard 文件)

内容概述

该数据集属于 SWE-bench 验证场景的一个子集,其命名包含随机选择 100 个文件夹、使用特定模型(32B 参数规模,step 3600)生成等元信息。数据集以对话形式存储智能体执行任务过程中的交互记录,并附带了结果、验证器输出、轨迹来源等多维元数据,适用于研究智能体在软件开发任务(SWE-bench)中的行为表现与结果分析。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_g1_a1_top16_32b_step3600_20260819_162251 数据集图片
构建方式
该数据集依托SWE-bench Verified基准所筛选的软件工程任务,从随机抽取的100个代码文件夹中衍生出可执行的修复实例,并借助参数规模为32B的智能体模型在g1_a1_top16配置下进行交互式求解。每次运行均记录完整的对话轨迹、模型标识、任务编号、回合信息与验证器输出,最终由自动校验流程判定结果并汇总为5122条训练样本,整体数据规模接近1GB,从而在代码修复场景中形成了兼具过程性与结果性标注的语料集合。
特点
数据集以对话式轨迹为核心载体,完整保留了智能体在代码库中定位缺陷、编辑文件与执行验证的逐步行为,并附带agent、model、task、episode、run_id与trial_name等多维元信息,便于追溯同一任务的不同尝试。verifier_output字段提供客观的通过或失败判定,trace_source则标明轨迹来源,使得数据兼具行为观测与结果评估的双重属性,适用于软件工程智能体的训练、评测与过程分析。
使用方法
研究者可通过HuggingFace datasets库加载默认配置下的train切分,按conversations字段还原多轮交互上下文,并结合task与episode字段对齐具体代码修复任务。利用result与verifier_output可筛选成功或失败的轨迹,用于监督微调、偏好建模或失败案例分析;模型与配置信息则支持跨模型、跨运行的条件对比。该数据集亦可作为SWE-bench相关评测的补充训练资源,支撑代码生成与智能体决策的实证研究。
背景与挑战
背景概述
SWE-bench系列基准的提出,标志着代码生成评估从孤立函数合成迈向真实软件仓库级问题求解的范式转变。该数据集SWE-bench Verified Random 100 Folders G1 A1 Top16 32B Step3600于2026年构建,基于SWE-bench Verified精选子集,涵盖5122条训练样本,记录了智能体在真实GitHub仓库中定位缺陷、生成补丁并接受验证的完整轨迹。其核心研究问题在于评估大语言模型驱动的编码智能体在长程推理、多文件编辑与自动化验证下的端到端修复能力,为软件工程自动化与智能体评测提供了关键实证基础。
当前挑战
该数据集所面对的领域挑战,在于真实仓库级缺陷修复要求模型跨越文件边界理解代码依赖、推断隐含意图,并在无显式测试反馈时保持补丁的语义正确性。构建过程中的挑战同样显著:候选样本须经过人工验证以确保问题描述清晰且测试用例可靠,智能体轨迹的采集需协调多种模型配置、运行环境与验证器输出,同时平衡存储开销与数据完整性。上述困难共同塑造了该资源在代码智能体研究中的参考价值。
常用场景
经典使用场景
在自动化软件工程与智能体评测领域,该数据集最为经典的用途在于对基于大语言模型的代码修复智能体进行端到端的能力验证。数据集依托SWE-bench Verified基准,从中随机抽取一百个文件夹且引入多种提示策略与采样配置,构造出包含完整对话轨迹、验证器输出以及任务元信息的记录集合。研究者借此可系统性地考察智能体在真实代码仓库环境中定位缺陷、生成补丁并接受单元测试检验的全流程表现,进而刻画其在多轮交互中的推理深度与执行稳定性。
衍生相关工作
围绕该数据集,衍生出一系列聚焦智能体轨迹分析与训练策略优化的经典工作。部分研究利用其多轮对话结构探索过程奖励建模与失败模式归因,另一些则基于episode与trial_name字段开展多次采样的自洽性研究,以提升补丁生成的鲁棒性。还有工作将其作为强化学习环境,通过verifier_output构造稀疏奖励,推动代码智能体在真实任务上的持续进化。这些衍生成果共同拓展了软件工程基准的边界,形成了从评测到训练再到部署的连贯研究脉络。
数据集最近研究
最新研究方向
在软件工程自动化领域,SWE-bench Verified已成为评估大语言模型解决真实GitHub仓库问题能力的核心基准。该数据集通过随机采样100个文件夹并引入g1_a1_top16_32b_step3600的智能体配置,系统记录了模型与代理的多轮对话、验证器输出及运行轨迹,为探究代理式代码修复的决策模式提供了细粒度轨迹数据。当前前沿研究聚焦于利用此类轨迹优化代理的规划与工具调用策略,例如通过强化学习或偏好对齐提升修复成功率与泛化性,相关成果直接影响自主编程代理的可靠性评估与部署,对推动软件维护自动化具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务