dev_set_v2_a3_rl_laion_exp_rpt_codenet_python_v2_20260825_134025
收藏资源简介:
该数据集包含1902个样本,每个样本包含多轮对话(conversations字段,每轮对话有role和content)、智能体标识(agent)、模型名称(model)、模型提供方(model_provider)、日期(date)、任务(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集仅提供训练集,总大小约139MB。数据格式为结构化JSON,适用于多轮对话分析、智能体行为评估或模型输出验证等任务。
The dataset contains 1902 samples, each consisting of multi-turn conversations (conversations field with role and content for each turn), agent identifier (agent), model name (model), model provider (model_provider), date (date), task (task), episode number (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset only provides a training set, with a total size of approximately 139MB. The data format is structured JSON, suitable for tasks such as multi-turn dialogue analysis, agent behavior evaluation, or model output validation.
数据集概述
该数据集名为 laion/dev_set_v2_a3_rl_laion_exp_rpt_codenet_python_v2_20260825_134025,托管于 Hugging Face 平台,主要面向强化学习(RL)相关任务,包含 Python 代码生成与执行追踪数据。
数据规模
- 总数据集大小:约 139.93 MB(压缩下载大小约 116.43 MB)
- 样本数量:1902 条
- 划分方式:仅提供
train分割,所有样本均用于训练
数据结构
每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话记录,包含 role(角色)和 content(内容)两个子字段 |
agent |
字符串 | 代理标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 数据生成日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 交互回合编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 任务结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据格式与存储
- 配置文件:默认配置名称为
default - 文件路径:
data/train-*(通配符表示按分片存储) - 数据格式:支持 Hugging Face 标准数据加载方式(如通过
load_dataset加载)
用途与背景
- 数据集名称中的
codenet_python表明其聚焦于 Python 代码相关任务。 - 包含
conversations字段,适用于多轮交互或对话式强化学习场景。 episode、run_id、trial_name等字段表明数据来源于多次运行实验的追踪记录,可能用于评估模型在代码生成或执行验证中的表现。




