a1-nl2bash-tb2-leonardo-20260720
收藏资源简介:
该数据集是一个多轮对话数据集,包含2234个训练样本。每条记录由多个字段组成:对话内容(conversations)包含角色(role)和文本内容(content),以及使用的智能体(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)。数据集适用于对话系统训练、智能体行为分析、模型评估与验证等任务。
This dataset is a multi-turn dialogue dataset containing 2,234 training samples. Each record consists of multiple fields: conversation content (conversations) including role and text content, as well as the agent used, model, model provider, date, task, episode number, run ID, trial name, result, verifier output, and trace source. The dataset is suitable for tasks such as dialogue system training, agent behavior analysis, model evaluation and validation.
数据集概述:laion/a1-nl2bash-tb2-leonardo-20260720
该数据集由 LAION 发布,属于自然语言到 Bash 命令转换任务(NL2Bash)的对话式数据集,版本标识为 tb2-leonardo-20260720。
基本信息
- 数据集名称:
a1-nl2bash-tb2-leonardo-20260720 - 发布机构:LAION
- 主要任务:将自然语言指令转换为 Bash 命令(NL2Bash),重点关注多轮对话场景下的命令生成。
- 数据规模:
- 训练集样本数:
2,234条 - 训练集大小:约
199 MB(208,981,948字节) - 下载大小:约
54 MB(56,448,087字节)
- 训练集样本数:
数据字段结构
每条数据包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(包含 content 和 role 两个子字段) |
多轮对话内容,content 为字符串文本,role 标明发言角色(如用户、助手) |
agent |
字符串 | 执行任务的智能体标识 |
model |
字符串 | 生成对话所使用的模型名称 |
model_provider |
字符串 | 模型提供方(如 OpenAI、Anthropic 等) |
date |
字符串 | 数据生成或记录的日期 |
task |
字符串 | 所属任务类型或名称 |
episode |
字符串 | 数据所属的轮次或场景编号 |
run_id |
字符串 | 运行过程中的唯一标识符 |
trial_name |
字符串 | 实验或测试的尝试名称 |
result |
字符串 | 任务执行后得到的结果或输出 |
verifier_output |
字符串 | 验证器(verifier)对结果进行校验后的输出 |
trace_source |
字符串 | 追踪信息的来源(如日志、工具调用等) |
数据划分
- 唯一划分:
train(训练集),包含全部2,234条数据。 - 文件格式:数据文件以
data/train-*命名,支持通配符读取(可能是 Parquet 或 JSON 格式)。
适用场景
- 训练或微调自然语言到 Bash 命令的转换模型。
- 多轮对话场景下的命令生成、纠错与验证。
- 智能体(agent)行为追踪与分析,尤其是涉及命令执行的日志与验证结果。
备注
- 数据集中包含
verifier_output字段,表明生成结果经过验证器校验,适合用于研究命令生成的准确性和可靠性。 - 该数据集版本标识中的日期
20260720表明其生成或更新时间为 2026 年 7 月 20 日。




