遇见数据集

swebench_verified_random_100_folders_a1_nemotron_rust_20260818_162717

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集包含多轮对话记录及相关元数据,每条样本包含以下字段:conversations(对话列表,每条对话包含角色 role 和内容 content)、agent(代理标识)、model(使用的模型名称)、model_provider(模型提供商)、date(日期)、task(任务描述)、episode(轮次编号)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和 trace_source(跟踪来源)。数据集仅包含训练集,共 12139 个样本,总大小约 1.68 GB。该数据集可用于多轮对话分析、模型行为评估、代理系统性能测试等任务。

This dataset contains multi-turn conversation records and related metadata. Each sample includes the following fields: conversations (list of dialogues, each containing role and content), agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset only contains a training set with 12,139 samples, total size approximately 1.68 GB. It can be used for multi-turn dialogue analysis, model behavior evaluation, agent system performance testing, etc.

提供机构:
LAION eV
创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集名为 laion/swebench_verified_random_100_folders_a1_nemotron_rust_20260818_162717,托管于 Hugging Face 平台。

基本信息

  • 数据集地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a1_nemotron_rust_20260818_162717
  • 数据集大小:约 1.676 GB(16,762,726 字节)
  • 下载大小:约 1.165 GB(1,164,925,502 字节)
  • 数据分割:仅包含 train 分割,共 12,139 条样本

数据结构

数据集包含以下字段:

字段名 类型 说明
conversations list 对话列表,包含 role(角色)和 content(内容)两个子字段
agent string 代理信息
model string 模型名称
model_provider string 模型提供方
date string 日期
task string 任务描述
episode string 片段编号
run_id string 运行标识
trial_name string 试验名称
result string 结果
verifier_output string 验证器输出
trace_source string 轨迹来源

数据特性

  • 数据集规模为 12,139 条训练样本,每条样本包含完整的对话记录及元数据。
  • 数据集名称表明其与 SWE-bench 验证任务相关,包含 Random 100 个文件夹,并涉及 Nemotron 模型与 Rust 编程语言。
  • 数据集较大,适合用于训练或评估代码生成、软件工程任务相关的模型。
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_nemotron_rust_20260818_162717 数据集图片
构建方式
该数据集源自SWE-bench Verified基准的随机抽样,选取了100个真实世界软件工程问题,并针对Rust编程语言进行了定制化构建。通过自动化代理与Nemotron模型的交互,生成了多轮对话轨迹,每条样本记录了完整的会话历史、代理类型、模型信息、运行参数及最终结果。数据收集过程严格遵循标准化流程,确保了样本的代表性和可复现性。
特点
数据集包含12,139个训练样本,总大小约1.67GB,规模可观。每条样本不仅包含结构化的对话记录,还附带丰富的元数据,如任务描述、运行标识和验证输出,为多角度分析提供了支撑。其独特之处在于聚焦Rust语言,结合SWE-bench的验证机制,确保了数据的高质量和实际应用价值。
使用方法
数据集以Parquet格式存储,可通过HuggingFace datasets库便捷加载。研究者可将其用于训练或微调代码生成与修复模型,通过conversations字段输入对话历史,利用result和verifier_output字段评估模型性能。同时,元数据字段支持细粒度筛选,便于开展针对性研究,如分析不同代理或模型的行为差异。
背景与挑战
背景概述
该数据集由NVIDIA研究团队于2026年8月18日创建,旨在评估和增强大型语言模型在真实世界软件工程任务中的自主代理能力。基于SWE-bench Verified基准,数据集选取了100个随机文件夹,并采用Nemotron模型进行Rust编程语言的代码生成与修复实验。其核心研究问题聚焦于如何利用大规模语言模型驱动智能体在复杂代码库中定位、理解并解决实际软件缺陷,从而推动自动化软件维护的发展。该数据集不仅为代码智能领域提供了高保真的训练与评估资源,还通过记录完整的交互轨迹(conversations)、代理行为及验证结果,为后续研究提供了可复现的实验基础,对软件工程与人工智能的交叉学科具有重要影响力。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两个层面。在领域问题层面,数据集需应对自动程序修复中的核心技术难点,包括缺陷定位的精确性、多文件代码修改的协调性以及测试用例的充分性验证,这些均要求模型具备深层次的代码语义理解与推理能力。在构建过程层面,数据集创建面临大规模真实项目样本的筛选与清洗难题,需确保任务难度适中且可验证;同时,记录完整的代理交互轨迹(每个样本包含数千轮对话)产生了超过1.6GB的存储需求,对数据管理、传输和隐私安全提出了更高要求。此外,平衡不同文件夹内任务的多样性、防止数据泄露以及确保验证器的公平性,也是构建过程中必须克服的挑战。
常用场景
经典使用场景
该数据集聚焦于软件工程领域中的自动化缺陷修复与代码生成任务,其核心场景是基于真实世界代码仓库(源自SWE-bench)的故障实例,驱动智能体(agent)在交互式环境中进行问题定位、补丁生成与验证。数据集通过记录多轮对话、执行轨迹与结果验证,为训练和评估大规模语言模型(LLM)在复杂编程任务中的端到端性能提供了标准化基准。其经典使用方式包括:微调代码模型以提升其代码修复能力、评估不同推理策略(如思维链、工具调用)的有效性,以及作为强化学习环境中的状态-动作样本。
解决学术问题
该数据集有效缓解了软件工程自动化研究中缺乏真实、可复现基准的困境,解决了学术领域内关于模型在真实世界代码库泛化能力评估的难题。通过提供带有验证器输出(verifier_output)和可追踪执行来源(trace_source)的完整决策过程,它支持研究者深入分析智能体故障模式、探索多步推理与工具使用的协同效应,并推动可解释性研究。其意义在于,利用高难度、多样化的SWE-bench任务,将代码智能从简单的代码生成推向了需要因果理解、调试策略和鲁棒规划的复杂问题求解,显著促进了自动化软件工程与LLM交叉领域的发展。
衍生相关工作
该数据集衍生了一系列值得关注的经典工作。基于其结构,研究者可构建指令微调数据集,用于增强LLM的代码理解与执行能力,例如训练模型模拟agent的决策过程以提升推理性能。其内容还可作为上下文学习(in-context learning)的示例库,用于引导预训练模型适应特定代码库风格。此外,利用其验证器和轨迹信息,衍生工作可探索自动化数据筛选方法,以构建高质量训练子集,或设计奖励模型(reward model)以优化强化学习策略。未来,该数据集有望催生更多关于多模态代码理解、长周期任务规划及具身智能体模拟的基准与模型,进一步拓展其在AI4Code领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务