遇见数据集

swebench_verified_random_100_folders_a1_stack_phpunit_20260818_162722

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集包含多轮对话记录及其他相关元数据。每条样本包含一个对话列表(conversations),每个对话由角色(role)和内容(content)组成。此外,还提供执行主体(agent)、模型名称(model)、模型提供者(model_provider)、日期(date)、任务标识(task)、运行轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)等字段。数据集仅包含训练集,共12,685个样本,总大小约1.84GB。该数据集可用于研究多轮对话、模型行为分析、任务执行记录及验证等场景。

This dataset contains multi-turn conversation records and other related metadata. Each sample includes a conversation list (conversations), where each conversation consists of a role and content. Additionally, it provides fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset only contains a training set with 12,685 samples, totaling approximately 1.84GB. It can be used for research on multi-turn dialogue, model behavior analysis, task execution records, and verification.

提供机构:
LAION eV
创建时间:
2026-08-21
原始信息汇总

数据集概述

数据集名称laion/swebench_verified_random_100_folders_a1_stack_phpunit_20260818_162722

数据集来源:Hugging Face(链接:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a1_stack_phpunit_20260818_162722)

数据集简介:该数据集包含与软件工程任务相关的人机对话记录,可能用于训练或评估AI代理在代码调试或测试场景下的表现。数据集名称中的关键词(如swebenchphpunitstack)暗示其与SWE-bench基准测试、PHP单元测试框架有关,但具体任务细节未在README中详细说明。


数据规模

  • 数据集总大小:约1.84 GB(1840845195字节)
  • 下载大小:约1.27 GB(1273648531字节)
  • 样本数量(训练集):12,685条对话记录

数据特征字段

每条样本包含以下字段:

字段名 数据类型 说明
conversations list (包含 role, content 字段) 对话轮次列表,每轮包含角色(role)和内容(content)
agent string 代理标识
model string 使用的模型名称
model_provider string 模型提供方
date string 日期
task string 任务描述
episode string 回合编号
run_id string 运行ID
trial_name string 试验名称
result string 结果
verifier_output string 验证器输出
trace_source string 追踪来源

数据切分

  • 仅提供 train 切分,包含全部12,685个样本。
  • 数据文件路径:data/train-*(支持通配符匹配)。

配置信息

  • 默认配置名为 default,对应训练切分数据。
  • 数据以Parquet等格式存储(具体格式未明确说明,但路径模式表明为分片文件)。

潜在用途

该数据集可能适用于:

  • 训练代码生成、调试或测试相关的AI代理
  • 评估AI在软件工程任务上的表现
  • 研究对话式交互在编程场景中的应用

注意:README中未提供任务的具体定义、数据收集方法或示例样本,因此以上信息均基于数据集的字段结构和命名推测。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stack_phpunit_20260818_162722 数据集图片
构建方式
该数据集源自SWE-bench Verified基准,通过随机抽取100个任务文件夹,并基于A1 Stack与PHPUnit测试框架进行构建。数据采集过程记录了智能体在多轮对话中的完整交互轨迹,每条样本包含角色与内容组成的对话序列,以及智能体标识、模型信息、运行日期、任务描述、试验编号等元数据。最终汇聚为包含12,685条样本的训练集,数据总量达1.84GB,确保了样本的丰富性与多样性。
使用方法
使用时,可将该数据集作为训练或评估资源,直接加载conversations字段作为输入输出对,用于微调对话模型或强化学习智能体。元数据字段如agent、model及result可用于过滤或分组分析,以研究不同条件下的性能差异。由于已按SWE-bench Verified标准生成,可无缝衔接现有评估流程,支持对模型在真实软件工程任务中的表现进行量化衡量。建议结合验证工具对输出进行二次核验,以提升结果的可靠性。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a1_stack_phpunit_20260818_162722,源于SWE-bench项目,由普林斯顿大学等研究机构于2023年推出,旨在评估大型语言模型在真实软件工程任务中的表现。它从GitHub上精选了100个Python仓库的随机文件夹,并集成了PHPUnit测试框架,用于验证模型生成的代码补丁能否通过单元测试。此数据集涵盖了2026年8月18日生成的对话轨迹,包含12,685个样本,记录了模型与环境的交互过程,为研究多智能体协作、工具使用及代码生成提供了高质量基准,对软件工程自动化领域具有重要影响力。
当前挑战
该数据集面临的挑战包括:1) 领域问题:SWE-bench旨在解决代码生成与自动修复的可靠性问题,即模型需在真实仓库上下文中生成正确补丁并满足测试约束,这要求模型具备上下文理解、代码推理和精确编辑能力;2) 构建过程:数据收集涉及从多个仓库中随机采样文件夹,并整合PHPUnit测试环境,需处理复杂的依赖关系和版本兼容性,同时确保对话轨迹的完整性与正确性,以及大规模数据集(如1.8GB)的存储与处理效率,这些均对数据管线的鲁棒性和可扩展性提出较高要求。
常用场景
经典使用场景
该数据集汇聚了来自SWE-bench验证集中随机抽取的100个真实软件工程任务,每条样本记录了智能体在解决这些任务时的完整对话轨迹、执行结果与验证器反馈。其经典使用场景在于评估和比较不同代码生成模型或智能体框架在复杂软件缺陷修复上的表现,尤其适用于研究多轮交互式推理、工具调用策略以及反馈循环机制对任务成功率的影响。通过标准化轨迹和结果字段,研究者可精确量化模型在真实世界代码库中的纠错能力,推动代码智能体从受限基准向动态、真实项目环境的迁移评估。
解决学术问题
该数据集的构建直面软件工程领域中长期存在的‘基准与实战脱节’难题,解决了以往代码生成任务因样本过于简化或环境封闭而导致的泛化性不足问题。它提供包含详细执行日志和验证结果的高保真轨迹,使得研究者能够追溯智能体决策路径,剖析失败原因,从而系统性地研究代码诊断、策略优化和错误恢复机制。这一资源显著促进了可复现的智能体教研,为探索模型在复杂依赖、多文件变更及测试驱动开发场景中的鲁棒性提供了坚实的数据基础,推动了从标准化测试到动态软件修复的学术范式跃迁。
实际应用
在实际研发中,该数据集可直接服务于智能编程助手的研发迭代,助力团队在内部发布前对模型进行更贴近真实工作流的回归测试和压力测试。企业可利用其对话轨迹与验证输出,训练出能精准定位缺陷、高效调用开发工具链的定制化智能体,从而加速CI/CD流程中的自动化修复。此外,数据集中多轮交互和结果标注为构建辅助代码审查系统、生成教学案例或模拟DevOps故障注入实验提供了高价值素材,在提升开发者效率、降低维护成本方面展现出广阔的应用前景。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中的自动程序修复与代码生成前沿研究,通过整合SWE-bench验证集及随机抽取的100个文件夹,并辅以PHPUnit测试套件作为验证工具,为智能体(Agent)在真实代码仓库中的交互式问题解决提供了丰富的训练与评估语料。当前研究热点集中于利用大语言模型驱动的多智能体协作框架,探索代码缺陷定位、补丁生成与回归测试的端到端范式,尤其关注在复杂工程环境下的鲁棒性与泛化能力。该数据集的发布推动了从静态代码生成向动态环境反馈闭环的转变,强调了可验证性与可复现性在AI辅助软件工程中的核心地位,对提升软件开发自动化水平与降低维护成本具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务