dev_set_v2_a1_nemotron_rspec_20260810_131744
收藏资源简介:
该数据集包含5898个训练样本,记录了多轮对话及其相关元数据。每条样本包含一个对话列表(conversations),其中每个对话回合由角色(role)和内容(content)组成。此外,还提供了代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集总大小约为543MB,适用于训练或评估AI对话代理、模型验证、多轮交互分析等场景。
This dataset contains 5898 training samples, recording multi-turn dialogues and their related metadata. Each sample includes a conversation list, where each turn consists of a role and content. Additionally, it provides agent name, model name, model provider, date, task, episode number, run ID, trial name, result, verifier output, and trace source. The total dataset size is approximately 543MB, suitable for training or evaluating AI dialogue agents, model validation, multi-turn interaction analysis, etc.
数据集详情总结
基本信息
- 数据集名称:
laion/dev_set_v2_a1_nemotron_rspec_20260810_131744 - 所属机构:LAION
- 数据集大小:约 543.6 MB(下载大小约 476.2 MB)
- 训练集样本数:5,898 条
- 数据分割:仅包含训练集(train)
数据特征
该数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话内容,包含 role(角色)和 content(内容)两个子字段,均为字符串类型 |
agent |
字符串 | 智能体名称或标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合或场景标识 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据集用途
该数据集为开发集(dev set),版本标识为 v2_a1,可能用于训练或评估 Nemotron 相关模型(从名称中的 nemotron 推断),涉及强化学习或智能体交互场景(包含 episode、run_id、trial_name 等字段)。数据以对话形式组织,适用于多轮对话、智能体决策或模型对齐等任务。
数据格式
- 数据文件路径:
data/train-*(支持通配符匹配) - 配置名:
default - 数据格式为 Parquet 或类似结构(基于字节大小和 Hugging Face 标准格式)




