遇见数据集

swebench_verified_random_100_folders_a1_stack_rust_20260818_162727

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集包含9839个训练样本,每个样本记录了一次完整的对话过程及相关的元数据。对话内容以多轮对话形式存储,每条消息包含角色(role)和内容(content)。此外,每个样本还提供了执行对话的代理(agent)、使用的模型(model)及模型提供商(model_provider)、日期(date)、任务(task)、剧集(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)等字段。数据集可用于训练和评估多轮对话系统、代理行为分析、模型验证等任务。

This dataset contains 9,839 training samples, each recording a complete dialogue process and associated metadata. The dialogue content is stored in a multi-turn format, with each message containing a role and content. Additionally, each sample includes fields such as the agent executing the dialogue, the model used and its provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset can be used for training and evaluating multi-turn dialogue systems, agent behavior analysis, model validation, etc.

提供机构:
LAION eV
创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集名为 laion/swebench_verified_random_100_folders_a1_stack_rust_20260818_162727,托管于 Hugging Face 平台。

数据集内容

该数据集主要包含与代码生成或软件工程任务相关的对话和多源追踪信息。每条数据记录包含以下字段:

  • conversations:一组对话记录,每条记录包含 role(角色)和 content(内容)两个字段。
  • agent:执行任务的智能体名称。
  • model:所使用的模型名称。
  • model_provider:模型提供方。
  • date:数据生成或记录的日期。
  • task:具体任务描述。
  • episode:任务会话编号。
  • run_id:运行标识符。
  • trial_name:试验名称。
  • result:任务执行结果。
  • verifier_output:验证器的输出内容。
  • trace_source:追踪信息来源。

数据规模与划分

  • 该数据集仅包含一个划分:train(训练集)。
  • 训练集包含 9,839 个样本,总字节数约为 1,669,782,570(约 1.56 GB)。
  • 数据集的下载大小约为 953,311,640 字节(约 909 MB)。

数据文件

数据文件以 data/train-* 的格式存储,默认配置名为 default

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stack_rust_20260818_162727 数据集图片
构建方式
该数据集源自SWE-bench Verified基准,通过随机抽样100个真实软件工程问题,并针对每个问题在Rust语言环境中执行多轮智能体交互任务而构建。每条记录包含完整的对话历史、执行智能体信息、模型标识、运行时间戳及任务元数据,经系统化整理形成可追溯的交互轨迹,数据规模达9839条样本,总存储量约1.67GB。
特点
数据集以多维度结构表征智能体求解过程,涵盖角色轮转的对话内容、智能体类型、模型提供方、运行环境等关键属性,并嵌入验证结果与执行日志,支持细粒度的过程分析。其随机抽样策略确保了问题分布的多样性,同时聚焦Rust生态,为评估代码生成与调试能力提供针对性对照。
使用方法
使用者可将该数据集用于智能体在真实软件任务上的性能基准测试,通过解析conversations字段复现交互流程,对比不同模型或策略的成功率与效率。结合verifier_output可进行自动化评分,而trace_source字段便于溯源错误环节,适用于强化学习训练、行为克隆或评估指标研发等场景,需注意数据以train分割形式加载。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a1_stack_rust_20260818_162727,由研究团队于2026年8月创建,旨在评估和推动大型语言模型在真实软件工程任务中的自动化修复能力。其核心研究问题聚焦于如何利用多轮交互式智能体(agent)解决SWE-bench Verified基准中的随机抽取的100个文件夹问题,特别针对Rust编程语言栈。数据集记录了智能体与环境的完整对话轨迹、模型配置及验证结果,为研究多智能体协作、规划策略和工具使用提供了实证基础。该数据集对软件工程自动化领域具有重要影响力,促进了从理论模型到实际代码修复的桥接,为构建更健壮的代码智能系统提供了数据支撑。
当前挑战
该数据集面临的挑战主要涵盖两大层面。在领域层面,它致力于解决自动化代码修复中的复杂问题,如跨文件依赖推断、上下文理解、错误定位及修复策略生成,这些任务对智能体的长程规划与逻辑推理能力提出了极高要求。在构建层面,挑战包括数据收集的完整性与一致性,确保多轮对话轨迹无缺失且格式统一;覆盖多种模型与提供者的异构性,需标准化不同来源的数据以支持公平比较;以及大规模数据(近万个样本,1.6GB)的存储与高效处理,同时需维护数据质量,过滤无效交互,保证验证结果的可靠性。这些挑战共同构成了数据集在促进可复现研究与实际应用中的关键障碍。
常用场景
经典使用场景
该数据集来源于SWE-bench的验证子集,选取了100个随机文件夹并针对Rust语言堆栈进行强化学习训练,包含近万个交互式会话样本。其经典使用场景在于对基于大语言模型的代码智能体进行端到端的训练与评估,尤其是在自动化软件维护任务中,能够模拟真实世界的GitHub问题解决流程。数据集提供了完整的对话轨迹、代理执行记录和结果验证信息,使得研究者能够复现和比较不同强化学习算法在代码修复任务上的表现,是检验智能体在复杂软件工程环境中决策能力的基准测试平台。
解决学术问题
该数据集针对软件开发自动化中的核心学术难题——如何使语言模型具备深度的代码理解与修改能力,而不仅是文本生成。通过提供大量带有成功或失败标记的多轮交互数据,它解决了现有数据集缺乏动态反馈和真实版本控制信息的问题。研究者可借此探索程序修复、需求满足测试及回归检测等方向,并量化模型在真实仓库上的泛化能力。其意义在于推动从静态代码生成向交互式软件维护的范式转变,为构建更可靠的自动编程助手奠定数据基础。
衍生相关工作
基于此数据集,可衍生出一系列经典研究工作,包括利用离线强化学习从成功轨迹中提取奖励模型、开发多代理协作框架以进行复杂问题的分解与并行解决,以及设计可解释的验证器来评估代理行为的正确性。这些工作推动了如CodeRL、SWE-agent等后续框架的发展,它们借鉴了类似的结构以统一代码生成与执行反馈。该数据集还促进了针对不同语言和框架的迁移学习研究,为构建跨领域、自适应的软件工程智能体提供了基准参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务