dev_set_v2_a1_r2egym_20260810_172110
收藏资源简介:
该数据集包含多轮对话记录,每个样本包括对话历史(conversations,由角色和内容组成)、使用的代理(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、对话轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据规模为6448个训练样本,总大小约568MB。适用于对话系统评估、模型比较、强化学习轨迹分析等任务。
This dataset contains multi-turn dialogue records, where each sample includes conversation history (conversations, composed of roles and content), the agent used (agent), model name (model), model provider (model_provider), date (date), task (task), episode (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset has 6448 training samples, with a total size of approximately 568 MB. It is suitable for tasks such as dialogue system evaluation, model comparison, and reinforcement learning trajectory analysis.
数据集概述
- 数据集名称:
laion/dev_set_v2_a1_r2egym_20260810_172110 - 数据集地址:https://huggingface.co/datasets/laion/dev_set_v2_a1_r2egym_20260810_172110
数据集基本信息
- 数据集大小:约 568 MB(
dataset_size: 568267401字节) - 下载大小:约 497 MB(
download_size: 497389154字节) - 数据分割:仅包含
train分割- 样本数量:6,448 条
- 字节数:568,267,401
数据特征(Features)
该数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(包含 role 和 content,均为字符串) |
对话记录,role 表示角色,content 表示内容 |
agent |
字符串 | 代理标识 |
model |
字符串 | 模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 场景/回合编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据格式
- 配置文件:
default - 数据文件路径:
data/train-*(表示多个分片文件)
数据集用途推测
该数据集由 LAION 组织发布,从字段结构和命名来看,可能用于:
- 多轮对话训练或评估
- 强化学习 / 环境交互(
episode、run_id、trial_name等字段提示与实验追踪有关) - 模型行为分析(包含
model、model_provider、result、verifier_output等)




