dev_set_v2_a3_rl_DCAgent_mix_h4_binary_easy_50_8B_20260825_134033
收藏资源简介:
该数据集包含5861个训练样本,每个样本由多轮对话(conversations)组成,对话中每条消息包含角色(role)和内容(content)。此外,每个样本还标注了相关的agent、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、情节(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集总大小约450MB,适用于对话系统训练、模型行为分析、推理过程追踪等任务。
The dataset contains 5861 training samples, each consisting of multi-turn conversations, where each message includes a role and content. Additionally, each sample is annotated with agent, model name, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The total dataset size is approximately 450MB, suitable for dialogue system training, model behavior analysis, and reasoning process tracing.
数据集概述
- 数据集名称:
laion/dev_set_v2_a3_rl_DCAgent_mix_h4_binary_easy_50_8B_20260825_134033 - 数据集提供方:LAION
- 数据集地址:https://huggingface.co/datasets/laion/dev_set_v2_a3_rl_DCAgent_mix_h4_binary_easy_50_8B_20260825_134033
基本信息
- 数据集大小:45,005,516 字节(约 429.6 MB)
- 下载大小:396,810,264 字节(约 378.3 MB)
- 数据分割:仅包含训练集(
train) - 训练集样本数:5,861 条
- 训练集大小:450,055,516 字节
数据特征
数据集每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(包含role和content两个字符串字段) |
对话记录 |
agent |
字符串 | 智能体标识 |
model |
字符串 | 模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据格式
- 配置文件:默认配置(
default) - 数据文件:位于
data/train-*,为分片存储的训练数据
典型应用场景
该数据集适用于强化学习(RL)、智能体(Agent)训练、对话系统开发以及多轮交互任务的模型微调与评估。




