swebench_verified_random_100_folders_a3_rl_SankalpKJ_nemotron_code_oracle_filtered772b6a4c
收藏资源简介:
该数据集包含多轮对话记录(conversations 字段,每个对话由角色 role 和内容 content 组成),以及相关的元数据:agent(代理标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务)、episode(轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)、trace_source(追踪来源)。训练集共有 5120 个样本,数据集总大小约 953 MB。
This dataset contains multi-turn conversation records (conversations field, each conversation consists of role and content), along with related metadata: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, trace_source. The training set has 5120 samples, and the total dataset size is approximately 953 MB.
数据集概述
该数据集名为 laion/swebench_verified_random_100_folders_a3_rl_SankalpKJ_nemotron_code_oracle_filtered772b6a4c,托管于 Hugging Face 平台,是一个用于训练和评估代码智能体(Agent)的对话数据集,内容来源于 SWE-bench 验证集中的随机 100 个文件夹,并经过特定过滤处理。
数据规模
- 数据集总大小:约 999.8 MB(
dataset_size) - 下载大小:约 448.9 MB(
download_size) - 数据划分:仅包含
train划分 - 样本数量:
train划分共有 5120 条样本
数据特征(Features)
每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(包含 role 和 content 字段,均为字符串) |
对话记录,其中 role 表示角色(如用户、助手),content 为对话内容 |
agent |
字符串 | 使用的智能体类型或名称 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 数据生成或记录的日期 |
task |
字符串 | 任务描述或标识 |
episode |
字符串 | 回合或迭代编号 |
run_id |
字符串 | 运行标识符 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 执行结果或结论 |
verifier_output |
字符串 | 验证器的输出信息 |
trace_source |
字符串 | 追踪来源或数据源 |
配置信息
- 配置名称:
default - 数据文件路径:
data/train-*(使用通配符匹配多个文件)
该数据集适用于代码生成、智能体行为分析、强化学习等场景的研究与模型训练。




