遇见数据集

swebench_verified_random_100_folders_a1_stack_cpp_20260818_162720

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集是一个多轮对话数据集,包含12399个样本。每个样本由多个字段构成:'conversations'字段为对话轮次列表,每轮包含角色(role)和内容(content);'agent'字段标识对话代理;'model'和'model_provider'指示使用的模型及其提供商;'date'记录数据日期;'task'指定任务类型;'episode'、'run_id'、'trial_name'用于实验追踪;'result'为对话结果;'verifier_output'为验证器输出;'trace_source'提供数据来源。数据集可用于对话系统训练、评估或强化学习场景。

This dataset is a multi-turn dialogue dataset containing 12,399 samples. Each sample consists of multiple fields: the conversations field is a list of dialogue turns, each turn containing role and content; the agent field identifies the dialogue agent; model and model_provider indicate the model used and its provider; date records the data date; task specifies the task type; episode, run_id, and trial_name are used for experiment tracking; result is the dialogue outcome; verifier_output is the verifiers output; trace_source provides the data source. The dataset can be used for dialogue system training, evaluation, or reinforcement learning scenarios.

提供机构:
LAION eV
创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集名为 laion/swebench_verified_random_100_folders_a1_stack_cpp_20260818_162720,托管于 Hugging Face,内容聚焦于代码生成与软件工程任务相关的多轮对话记录。

数据规模

  • 数据集总大小:约 1.63 GB(1,745,207,044 字节)
  • 下载大小:约 1.26 GB(1,347,559,372 字节)
  • 数据划分:仅包含一个训练集(train)
    • 样本数量:12,399 条
    • 数据大小:1,745,207,044 字节

数据字段结构

每条数据包含以下字段:

字段名 类型 说明
conversations 列表(含 rolecontent 字符串) 多轮对话内容,记录角色与消息文本
agent 字符串 使用的智能体标识
model 字符串 模型名称
model_provider 字符串 模型提供方
date 字符串 数据生成日期
task 字符串 任务描述或标识
episode 字符串 轮次标识
run_id 字符串 运行 ID
trial_name 字符串 试验名称
result 字符串 执行结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

配置信息

  • 默认配置名:default
  • 数据文件路径:data/train-*(使用通配符匹配多个分片文件)

用途推测

基于字段设计(如 conversationsagentmodelverifier_output 等),该数据集可能用于训练或评估代码智能体在 SWE-bench 验证任务中的表现,特别是针对 C++ 编程任务,并包含随机选取的 100 个文件目录场景下的多轮交互记录。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stack_cpp_20260818_162720 数据集图片
构建方式
该数据集源自SWE-bench Verified基准的随机抽样,选取100个真实世界软件工程问题,聚焦于C++编程任务。通过自动化智能体(agent)在多轮交互中生成解决方案,并记录完整的对话历史、执行轨迹及验证结果。每个样本包含角色交替的会话内容、智能体配置、模型信息、运行时间戳及任务标识等元数据,共汇聚12,399条训练实例,构成一个结构丰富、可复现的交互式任务求解语料库。
特点
数据集的核心特点在于其多维度信息整合与真实性。它不仅涵盖任务描述与解答过程,还附带了智能体类型、模型提供商、验证器输出等关键属性,使研究者能深入分析不同配置下的性能差异。此外,通过记录运行ID与试验名称,确保了每次尝试的独立性与可追溯性。数据规模庞大,下载量超1.3GB,体现了丰富的对话与执行细节,适合用于训练和评估代码生成与问题解决模型。
使用方法
使用时,研究人员可将其作为强化学习或监督微调的语料,输入对话序列以训练智能体在C++环境中的编程能力。通过解析'conversations'字段获取多轮交互,结合'verifier_output'判断最终答案质量,从而构建奖励信号。数据集的划分(如train)预定义清晰,便于直接加载;同时,元数据字段如'agent'和'model'支持分组对比实验,以评估不同算法或模型架构的效果。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a1_stack_cpp_20260818_162720,由研究团队于2026年8月创建,旨在评估和提升大型语言模型在真实软件工程任务中的自动化解决能力。该数据集源自SWE-bench Verified基准,专注于C++编程语言,通过随机选取100个文件夹构建而成,包含12399条对话记录,每条记录涵盖了智能体(agent)与用户的多轮交互、模型输出、执行结果及验证信息。其核心研究问题在于如何利用多轮对话轨迹来训练和评估模型在复杂代码库上的问题修复能力,对软件工程自动化领域具有重要的推动意义,为构建更智能的编程助手提供了标准化的数据支撑。
当前挑战
该数据集面临的挑战可分为领域问题与构建问题两方面。领域上,软件工程任务复杂度高,涉及跨文件依赖、上下文理解与精确修改,模型需在庞大代码库中定位缺陷并生成有效补丁,现有模型在此类任务上仍存在性能瓶颈,且C++语言特性(如内存管理、模板元编程)增加了难度。构建过程中,数据收集需从真实GitHub仓库提取问题并确保验证的可靠性,需严格过滤噪声样本,同时多轮对话的生成与结果验证需耗费大量计算资源,且在保证数据多样性、避免过拟合方面存在挑战。此外,确保数据集的公平性和泛化能力,防止模型对特定场景过度适配,也是持续面临的难题。
常用场景
经典使用场景
该数据集源于SWE-bench验证集,针对C++代码仓库,经过随机抽样并构建为多轮人机对话形式,记录了智能体在解决真实软件工程问题时的完整交互轨迹。其经典使用场景聚焦于评估和训练代码生成模型在复杂仓库级任务上的能力,特别是跨文件修改、缺陷定位与修复等挑战性场景。研究者可借此基准测试模型对C++项目结构、依赖关系及编译错误的理解,推动自动化编程系统从单函数补全向端到端问题求解的范式演进。
衍生相关工作
围绕该数据集,研究者已衍生出多项经典工作。一方面,它被用作强化学习训练的奖励信号源,结合过程监督或结果监督方法,优化代码生成代理的探索策略,催生了多轮决策的SWE-agent及AutoCodeRover等代表性框架。另一方面,基于数据集的对话结构化特征,衍生出面向代码推理的指令微调数据集,提升了模型对仓库级上下文的理解与补丁生成能力。此外,数据集的验证器输出与跟踪溯源信息支撑了关于模型失败模式的分析研究,为构建更稳健的鲁棒性评估体系及新基准(如SWE-bench++扩展)提供了数据基础。
数据集最近研究
最新研究方向
基于SWE-bench Verified基准的强化学习与多智能体协作研究,聚焦于代码生成与程序修复任务的端到端训练,通过大规模对话轨迹(12399条)和多样化模型(agent及provider)的交互数据,探索如何利用真实软件工程问题提升大语言模型的代码推理与bug修复能力,该数据集为评估和优化AI编程助手提供了高保真仿真环境,推动了从静态代码生成到动态环境交互的范式转变,对构建可自我纠错的智能体具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务