dev_set_v2_a1_stack_ruby_20260811_204537
收藏资源简介:
该数据集包含4428个训练样本,用于记录多轮对话交互过程。每个样本由以下字段组成:conversations(对话列表,每条消息包含角色role和内容content)、agent(代理标识)、model(模型名称)、model_provider(模型提供方)、date(日期)、task(任务类型)、episode(回合编号)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)以及trace_source(跟踪来源)。数据集中所有样本均划分在训练集内,总数据量约为416MB。该数据集适用于对话系统、AI代理评估、模型行为分析等研究场景。
This dataset contains 4,428 training samples recording multi-turn dialogue interaction processes. Each sample consists of the following fields: conversations (a list of dialogue messages, each containing role and content), agent (agent identifier), model (model name), model_provider (model provider), date (date), task (task type), episode (episode number), run_id (run ID), trial_name (trial name), result (result), verifier_output (verifier output), and trace_source (trace source). All samples are in the training set, with a total data size of approximately 416 MB. This dataset is suitable for research scenarios such as dialogue systems, AI agent evaluation, and model behavior analysis.
数据集概述
基本信息
- 数据集名称:dev_set_v2_a1_stack_ruby_20260811_204537
- 数据集提供方:LAION
- 数据集地址:https://huggingface.co/datasets/laion/dev_set_v2_a1_stack_ruby_20260811_204537
数据规模
- 数据集总大小:416,911,130 字节(约 397.6 MB)
- 下载大小:351,698,461 字节(约 335.4 MB)
- 训练集样本数:4,428 条
数据划分
- 训练集(train):包含全部 4,428 条样本,数据存储在
data/train-*路径下
数据特征(Features)
主要字段
| 字段名 | 类型 | 说明 |
|---|---|---|
| conversations | list | 对话记录列表 |
| agent | string | 智能体名称 |
| model | string | 模型名称 |
| model_provider | string | 模型提供方 |
| date | string | 日期 |
| task | string | 任务类型 |
| episode | string | 回合/轮次标识 |
| run_id | string | 运行ID |
| trial_name | string | 试验名称 |
| result | string | 结果 |
| verifier_output | string | 验证器输出 |
| trace_source | string | 追踪来源 |
conversations 字段结构
- role(string):对话角色(如用户、助手等)
- content(string):对话内容
数据集特点
- 该数据集为开发验证集(dev_set),版本标识为 v2_a1_stack_ruby
- 数据包含完整的对话记录以及对应的智能体、模型、任务、运行信息等元数据
- 每个样本均包含验证器输出和追踪来源,可用于模型评估和分析




