dev_set_v2_a1_stack_dockerfile_20260820_135115
收藏资源简介:
该数据集包含多轮对话记录及相关的代理、模型、任务和结果信息。每条数据包含一个对话列表(conversations),每个对话由角色(role)和内容(content)组成;此外还包含代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。训练集共5459个样本,总数据量约519MB。该数据集适用于训练或评估对话代理、模型行为分析、多轮对话系统等任务。
This dataset contains multi-turn dialogue records along with related agent, model, task, and result information. Each data entry includes a list of conversations, where each conversation consists of a role and content; additionally, it includes agent name, model name, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The training set has 5,459 samples, with a total data size of approximately 519MB. This dataset is suitable for training or evaluating dialogue agents, model behavior analysis, multi-turn dialogue systems, etc.
数据集概述
该数据集名为 dev_set_v2_a1_stack_dockerfile_20260820_135115,由 LAION 组织发布,托管于 Hugging Face 平台。
基本信息
- 数据集地址:https://huggingface.co/datasets/laion/dev_set_v2_a1_stack_dockerfile_20260820_135115
- 下载大小:约 449.92 MB(449920139 字节)
- 数据集总大小:约 519.33 MB(519333215 字节)
- 数据分割:仅包含训练集(train),共 5,459 条样本
数据特征
数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话内容,包含 role(角色)和 content(内容)两个子字段,均为字符串类型 |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合/场景编号 |
run_id |
字符串 | 运行标识符 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据集特点
- 数据文件存储于
data/train-*路径下,采用通配符匹配多个文件。 - 数据集名称中包含
stack_dockerfile关键词,暗示该数据集可能与 Dockerfile 相关的软件栈开发任务有关。 - 字段设计包含智能体对话、模型信息、任务执行轨迹和验证结果,推测该数据集适用于智能体训练、决策过程记录或任务执行评估等场景。
- 数据集中同时包含
episode、run_id、trial_name等字段,表明数据可能按实验轮次和运行单元进行组织。




