dev_set_v2_a1_repo_scaffold_20260810_175146
收藏资源简介:
该数据集包含5372个样本,每个样本记录了一次多轮对话的完整轨迹。数据字段包括:对话历史(conversations,由角色role和内容content组成)、智能体名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务描述(task)、对话轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集可用于研究AI智能体在多轮对话中的行为表现、模型输出验证、任务完成情况分析等场景。
This dataset contains 5372 samples, each recording the complete trajectory of a multi-turn dialogue. The data fields include: conversation history (conversations, consisting of role and content), agent name (agent), model name (model), model provider (model_provider), date (date), task description (task), dialogue episode (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset can be used for studying AI agent behavior in multi-turn dialogues, model output verification, task completion analysis, and other scenarios.
数据集概述
该数据集名为 laion/dev_set_v2_a1_repo_scaffold_20260810_175146,托管于 Hugging Face,由 LAION 组织发布。
基本信息
- 数据集大小:约 448.5 MB(下载大小),解压后约 509.7 MB
- 数据划分:仅包含训练集(train),共 5372 条样本
- 文件格式:数据文件存放于
data/train-*路径下,采用分片存储方式
数据字段结构
每条样本包含以下 12 个字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话记录,每个元素包含 role(角色,字符串)和 content(内容,字符串) |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合/场景编号 |
run_id |
字符串 | 运行编号 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据特点
- 数据以对话(conversations)为核心,包含多轮角色-内容对
- 每条记录还附带丰富的元数据(如模型、任务、运行信息等),便于追踪和分析
- 该数据集可能用于智能体行为分析、模型评估或训练数据构建等场景
备注
- 数据集当前仅提供
default配置,无额外配置选项 - 数据总量适中(约 5372 条),适合中小规模实验或作为子集使用




