dev_set_v2_a3_rl_laion_exp_rpt_stack_bash_v3_70_8B_20260825_134028
收藏资源简介:
该数据集包含多轮对话样本,每条样本记录了一段对话历史(conversations),其中每轮对话由角色(role)和内容(content)组成。此外,还提供了丰富的元信息:智能体(agent)、模型(model)、模型提供者(model_provider)、日期(date)、任务(task)、episode、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)。数据集共包含4736个训练样本,总大小约379MB。适用于对话系统训练、智能体行为分析、多轮对话评估等自然语言处理任务。
This dataset contains multi-turn dialogue samples. Each sample records a conversation history (conversations) where each turn consists of a role and content. Additionally, it provides rich metadata: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset includes 4,736 training samples with a total size of approximately 379MB. It is suitable for natural language processing tasks such as dialogue system training, agent behavior analysis, and multi-turn dialogue evaluation.
数据集概述
该数据集名为 dev_set_v2_a3_rl_laion_exp_rpt_stack_bash_v3_70_8B_20260825_134028,由 LAION 发布,是一个用于训练和评估代理(agent)在多轮对话中执行任务的开发集。
数据规模
- 数据集总大小:379,160,984 字节(约 361.6 MB)
- 下载大小:320,866,609 字节(约 306 MB)
- 训练集样本数:4,736 条
- 划分:仅包含
train训练集
数据特征
每条数据包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 多轮对话内容,每轮包含 role(角色)和 content(内容)两个子字段,均为字符串 |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 执行结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据文件
- 数据文件路径为
data/train-*,采用分片存储方式。
用途推测
结合数据集名称中的 rl(强化学习)、stack_bash 等关键词,该数据集可能用于训练或评估基于大语言模型的代理在命令行操作、代码执行或强化学习环境中的任务完成能力。




