dev_set_v2_a1_stack_selfdoc_gpt5mini_20260811_231815
收藏资源简介:
该数据集包含多轮对话记录,每条记录由以下字段组成:conversations(对话列表,每个元素包含 role(角色)和 content(内容))、agent(代理标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务)、episode(轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和 trace_source(追踪来源)。数据集只有一个训练集,包含 5056 个样本,总大小约 453MB。可用于对话系统、模型行为分析、任务评估等场景。
This dataset contains multi-turn dialogue records. Each record consists of the following fields: conversations (a list of dialogue turns, each containing role and content), agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset has a single training set with 5056 samples, totaling approximately 453MB. It can be used for dialogue systems, model behavior analysis, task evaluation, and other scenarios.
数据集概述:laion/dev_set_v2_a1_stack_selfdoc_gpt5mini_20260811_231815
基本信息
- 数据集名称:laion/dev_set_v2_a1_stack_selfdoc_gpt5mini_20260811_231815
- 所属机构:LAION
- 数据集规模:
- 训练集样本数:5,056 条
- 数据集总大小:约 453.7 MB
- 下载大小:约 385.6 MB
- 数据集格式:仅包含
train分割,数据文件存储于data/train-*路径下
数据特征
该数据集包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| conversations | 列表(包含 role 和 content 两个子字段) | 对话记录,其中 role 为字符串类型(如 user/assistant),content 为字符串类型(对话内容) |
| agent | 字符串 | 智能体相关信息 |
| model | 字符串 | 使用的模型名称 |
| model_provider | 字符串 | 模型提供商 |
| date | 字符串 | 数据生成日期 |
| task | 字符串 | 任务类型 |
| episode | 字符串 | 回合/场景编号 |
| run_id | 字符串 | 运行标识符 |
| trial_name | 字符串 | 试验名称 |
| result | 字符串 | 任务结果 |
| verifier_output | 字符串 | 验证器输出 |
| trace_source | 字符串 | 轨迹来源 |
数据集特点
- 该数据集包含多轮对话(conversations),每条对话记录包含角色(role)和内容(content)两部分。
- 数据集中包含了丰富的元数据字段,如智能体信息、模型信息、任务类型、运行标识符、验证器输出等,便于进行多维度分析和追踪。
- 数据集名中的 "stack_selfdoc" 暗示可能与堆栈自文档化任务相关,"gpt5mini" 表明使用了 GPT-5 Mini 模型进行数据生成或处理。
适用场景
该数据集适用于以下研究和应用场景:
- 智能体对话行为分析与建模
- 多轮对话系统训练与评估
- 任务执行轨迹分析与验证
- 模型输出质量评估与验证器研究




