dev_set_v2_a3_rl_DCAgent_exp_rpt_curriculum_medium_10_8B_20260825_134030
收藏资源简介:
该数据集是一个多轮对话交互数据集,包含4226个训练样本。每条样本记录了完整的对话历史(conversations),包括角色(role)和内容(content);同时包含执行对话的代理(agent)、使用的模型(model)及其提供商(model_provider)、任务描述(task)、运行日期(date)、实验编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)。该数据集适用于对话系统训练、代理行为分析、任务完成评估以及模型性能对比等场景。
This dataset is a multi-turn dialogue interaction dataset containing 4,226 training samples. Each sample records the complete conversation history (conversations), including role and content. It also includes the agent executing the dialogue, the model used and its provider, task description, date, episode number, run ID, trial name, result, verifier output, and trace source. This dataset is suitable for dialogue system training, agent behavior analysis, task completion evaluation, and model performance comparison.
数据集详情总结
数据集概述
本数据集名为 dev_set_v2_a3_rl_DCAgent_exp_rpt_curriculum_medium_10_8B_20260825_134030,由 laion 组织发布,用于训练和评估基于强化学习(RL)的对话代理(DCAgent)模型。数据集聚焦于中等难度(medium)的课程学习(curriculum)场景,共包含 10 个训练轮次,涉及 8B 参数规模的模型。
数据规模与结构
- 数据总量:数据集大小为 331,578,611 字节(约 316 MB),压缩后下载大小为 290,423,722 字节(约 277 MB)。
- 样本数量:训练集(train)共包含 4,226 个样本。
- 数据划分:仅提供
train分割,无验证集或测试集划分。
数据字段说明
每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(含 role 和 content 字符串字段) |
对话历史记录,记录角色(如用户/助手)及对应内容 |
agent |
字符串 | 代理标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 数据生成日期 |
task |
字符串 | 任务描述 |
episode |
字符串 | 训练轮次编号 |
run_id |
字符串 | 运行标识号 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 任务结果 |
verifier_output |
字符串 | 验证器输出信息 |
trace_source |
字符串 | 轨迹来源 |
配置与访问
- 配置名称:
default - 数据文件:路径为
data/train-*,采用通配符匹配多个数据分片文件,存储在数据集的data目录下。
适用场景
该数据集适用于需要对对话代理进行强化学习训练和评估的研究场景,特别是中等复杂度的课程学习任务,可用于模型调优、性能验证及能力对比等用途。




