dev_set_v2_a3_rl_laion_nemotron_gym_math_advanced_calculations_v3_60_8B_20260825_182341
收藏资源简介:
该数据集包含多轮对话记录,每条记录由对话历史(conversations,包含角色和内容)、使用的代理模型信息(agent、model、model_provider)、任务标识(task)、日期(date)、运行批次(episode、run_id、trial_name)、最终结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)等字段组成。数据规模为2674条训练样本,总大小约202MB。该数据集适用于多轮对话系统的评估、模型行为分析、以及基于代理的交互任务研究。
This dataset contains multi-turn conversation records, each consisting of conversation history (conversations, including roles and content), agent model information (agent, model, model_provider), task identifier (task), date (date), run batch (episode, run_id, trial_name), final result (result), verifier output (verifier_output), and trace source (trace_source). The data scale is 2674 training samples, with a total size of approximately 202MB. This dataset is suitable for evaluating multi-turn dialogue systems, analyzing model behavior, and studying agent-based interaction tasks.
数据集概述
该数据集名为 laion/dev_set_v2_a3_rl_laion_nemotron_gym_math_advanced_calculations_v3_60_8B_20260825_182341,由 LAION 组织发布,托管于 Hugging Face 平台。
数据集规模
- 总大小:202,474,443 字节(约 193 MB)
- 下载大小:177,616,006 字节(约 169 MB)
- 训练集样本数:2,674 条
- 数据分割:仅包含
train分割,无验证集或测试集
数据字段
每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话内容,包含 role(角色)和 content(内容)两个子字段 |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据特点
- 数据集名称中包含
math_advanced_calculations和rl(强化学习)字样,推测其内容与高级数学计算任务及强化学习相关。 - 数据文件采用分区存储方式,路径为
data/train-*,数据类型为通用格式。 - 数据集主要用于开发集(dev set)用途,可能用于模型验证或评估。
配置信息
- 默认配置名称为
default,数据文件为data/train-*,包含完整的训练数据。




