遇见数据集

swebench_verified_random_100_folders_g1_a1_top16_32b_step600_20260819_162257

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集包含多轮对话轨迹,每条记录由对话列表(conversations)和丰富的元数据组成。每轮对话包含角色(role)和内容(content)。元数据包括:代理标识(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务描述(task)、会话期数(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集共包含6985个样本,仅提供训练集划分,总大小约1.48GB。适用于对话代理评估、任务完成分析、模型行为审计等研究场景。

This dataset contains multi-turn dialogue trajectories, each record consisting of a list of conversations and rich metadata. Each turn includes role and content. Metadata includes: agent identifier, model name, model provider, date, task description, episode, run ID, trial name, result, verifier output, and trace source. The dataset contains 6985 samples, only providing a training set split, with a total size of approximately 1.48GB. It is suitable for research scenarios such as dialogue agent evaluation, task completion analysis, and model behavior auditing.

提供机构:
LAION eV
创建时间:
2026-08-26
原始信息汇总

数据集概述:laion/swebench_verified_random_100_folders_g1_a1_top16_32b_step600_20260819_162257

该数据集托管于 Hugging Face,由 LAION 组织发布,旨在记录和评估 SWE-bench 任务中某个模型(推测为 32B 规模的模型)在验证集上的交互轨迹与结果。

基本信息

  • 数据集名称:swebench_verified_random_100_folders_g1_a1_top16_32b_step600_20260819_162257
  • 任务类型:SWE-bench(软件工程基准测试)任务轨迹数据,包含多轮对话和执行结果。
  • 数据规模:训练集包含 6,985 条样本,数据集总大小约 1.48 GB(解压后),下载大小约 579 MB

数据特征

每条样本包含以下字段:

字段名 类型 说明
conversations 列表(list) 包含多轮对话,每轮对话包含 role(角色)和 content(内容)两个字符串字段
agent string 执行任务的智能体名称或标识
model string 使用的模型名称
model_provider string 模型提供方
date string 数据记录日期
task string 具体任务标识
episode string 任务轮次或场景编号
run_id string 运行标识号
trial_name string 试验名称
result string 任务执行结果(如通过/失败)
verifier_output string 验证器输出的详细信息
trace_source string 轨迹数据的来源或记录方式

数据划分

  • 单一划分:仅包含 train 划分,共 6,985 个样本。

数据格式与结构

  • 默认配置名为 default,数据文件位于 data/train-*,采用分片存储(sharded parquet 格式)。
  • 该数据集的显著特点是记录了完整的智能体-模型对话历史,适合用于研究模型在软件工程任务中的推理过程、错误模式及改进策略。

使用场景建议

  • 分析模型在真实软件工程问题上的表现与失败原因。
  • 微调或评估代码生成与修复模型。
  • 研究多轮交互中的决策过程及验证器反馈的作用。
搜集汇总
数据集介绍
swebench_verified_random_100_folders_g1_a1_top16_32b_step600_20260819_162257 数据集图片
构建方式
该数据集源自SWE-bench Verified基准,通过随机抽取100个任务文件夹,并利用一个具有160亿参数、经过300步微调的强大模型进行交互式求解,最终收集了6985条完整会话记录。每条记录详细保存了多轮人机对话、任务描述、模型标识、运行环境及轨迹来源等关键元数据,构建过程严谨,确保了数据的真实性与可追溯性。
使用方法
使用时,可直接加载HuggingFace数据集,利用conversations字段进行多轮对话建模或指令微调。结合agent、model及result字段可进行性能评估与错误分析。适用于软件工程自动化、代码生成及智能体研究,尤其适合探索模型在复杂编程任务中的决策过程与改进方向。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_g1_a1_top16_32b_step600_20260819_162257,创建于2026年8月19日,由某研究机构或团队基于SWE-bench Verified基准构建,旨在评估和提升大语言模型在真实软件工程任务中的自动化解决能力。数据集包含6985个训练样本,每个样本记录了多轮人机对话、模型输出、运行轨迹及验证结果,核心研究问题聚焦于如何通过强化学习或监督微调,使模型能够高效地定位并修复代码缺陷。该数据集在软件工程与人工智能交叉领域具有重要影响,为智能编程助手、自动程序修复等研究提供了标准化训练与评估资源,推动了代码智能从理论向工程实践的转化。
当前挑战
当前挑战包括:领域问题层面,软件工程任务复杂度高,涉及仓库级上下文理解、多文件协调修改及隐藏测试用例的泛化,现有模型在解决真实世界缺陷时仍面临准确率低和鲁棒性不足的问题;构建过程层面,数据收集需确保任务多样性与标注质量,过滤无效对话并平衡不同难度样本以避免偏差,同时需处理大规模数据存储与处理开销,保持验证输出的可靠性,这些挑战共同制约了数据集的实用价值与模型性能的进一步突破。
常用场景
经典使用场景
该数据集源于SWE-bench验证集,精心筛选了100个真实软件工程问题,并经由特定强化学习策略(如g1_a1_top16_32b_step600)生成多轮智能体交互轨迹。其经典使用场景聚焦于训练和评估大型语言模型在自动化代码修复与问题解决方面的能力,特别是在终端到终端软件工程任务中模拟智能体探索、决策与行动的全过程。研究者常利用此数据集微调模型,以提升其在真实GitHub问题上的修复成功率和代码生成质量,同时通过对比不同轨迹验证算法性能。
解决学术问题
该数据集直面软件工程自动化中智能体泛化能力不足与经验迁移困难的学术挑战。它通过记录包含工具调用、环境反馈和逐步推理的完整交互轨迹,为研究如何利用强化学习信号优化多步决策策略提供了高质量资源。这有助于解决奖励稀疏、搜索空间庞大等核心难题,推动从静态代码生成向动态环境交互的范式转变,为可验证、可执行的自动化编程代理研究奠定实证基础,其意义在于缩短理论与实践间的鸿沟。
实际应用
在实际应用中,该数据集可作为训练语料,强化企业级代码助手在复杂缺陷修复、单元测试生成和持续集成流水线中的自主决策能力。开发者不仅能借此构建更智能的编程辅助工具,实现对问题报告的高效分类与补丁推荐,还可用于部署在云原生开发环境中的自主代理,辅助维护人员优先处理关键错误。此外,数据集中多轮对话的结构也适用于构建交互式故障诊断系统,提升开发运维的一体化响应效率,在DevOps和AI辅助软件开发中具有显著价值。
数据集最近研究
最新研究方向
该数据集聚焦于大型语言模型在真实软件工程任务中的自主智能体行为研究,通过收集多轮交互轨迹、模型输出及验证结果,为评估和提升智能体在复杂编码环境中的决策能力提供了规模化基准。其内容涵盖了从任务理解到代码生成与错误修复的完整流程,前沿方向包括基于强化学习的智能体策略优化、多步骤推理的鲁棒性分析以及模型在未见问题上的泛化性能研究。当前热点事件涉及AI编程助手的可靠性与安全性,该数据集的公开有效支撑了可复现实验,推动了基于真实世界任务的智能体评估体系发展,对构建更高效、更可信的自动化软件开发范式具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务