swebench_verified_random_100_folders_a3_rl_DCAgent_inferredbugs_sandboxes_verifierb984e9c9
收藏资源简介:
该数据集是一个多轮对话记录集合,包含7373条训练样本,总大小约1.3GB。每条样本包含完整的对话历史(conversations),其中每条消息由角色(role)和内容(content)组成;同时记录了对话所涉及的智能体(agent)、模型名称(model)、模型提供商(model_provider)、对话日期(date)、任务描述(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。该数据集适用于对话系统训练、多轮对话建模、任务型对话评估、模型输出验证等场景。
This dataset is a collection of multi-turn dialogue records, containing 7373 training samples with a total size of approximately 1.3GB. Each sample includes a complete conversation history (conversations), where each message consists of a role and content. It also records the agent involved in the dialogue, model name, model provider, dialogue date, task description, episode number, run ID, trial name, result, verifier output, and trace source. This dataset is suitable for dialogue system training, multi-turn dialogue modeling, task-oriented dialogue evaluation, model output verification, and other scenarios.
数据集详情总结
数据集名称
laion/swebench_verified_random_100_folders_a3_rl_DCAgent_inferredbugs_sandboxes_verifierb984e9c9
数据集简介
本数据集源自 LAION 团队,专注于软件工程基准测试(SWE-bench)中的验证任务,包含通过强化学习(RL)随机抽取的 100 个文件夹样本,涉及 DCAgent 推断缺陷的沙箱验证结果。数据集中记录了智能体与模型在解决软件工程问题时的完整对话、执行轨迹及验证器输出,适用于研究、训练和评估代码生成与缺陷修复智能体。
数据集规模
- 总大小:约 1.31 GB(1,309,886,431 字节)
- 下载大小:约 647.88 MB(647,878,827 字节)
- 样本数量:7,373 条(训练集)
- 数据划分:仅包含一个
train划分,无单独的测试集或验证集
数据集特征(字段说明)
| 字段名 | 类型 | 描述 |
|---|---|---|
conversations |
列表 | 包含多轮对话,每个对话有 role(角色)和 content(内容)两个字段 |
agent |
字符串 | 使用的智能体名称 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方(如 OpenAI 等) |
date |
字符串 | 数据生成日期 |
task |
字符串 | 具体的软件工程任务标识 |
episode |
字符串 | 强化学习中的回合编号 |
run_id |
字符串 | 运行 ID |
trial_name |
字符串 | 实验尝试名称 |
result |
字符串 | 任务执行结果 |
verifier_output |
字符串 | 验证器的输出信息 |
trace_source |
字符串 | 追踪来源(如沙箱日志等) |
数据配置
- 配置名称:
default(唯一配置) - 数据文件:位于
data/train-*路径下,支持流式加载。
数据用途
该数据集主要服务于以下场景:
- 评估和比较不同智能体(如 DCAgent)在软件缺陷推断与修复任务上的性能。
- 训练或微调代码生成模型、对话式智能体。
- 分析强化学习策略在真实软件工程任务中的表现,以及验证器反馈的有效性。
其他说明
- 数据集文件格式为 Hugging Face 标准数据集格式,支持
datasets库直接加载。 - 数据内容包含完整的对话历史和执行轨迹,适合进行细粒度的行为分析和错误诊断。




