dev_set_v2_a1_nl2bash_20260820_135116
收藏资源简介:
该数据集包含 5482 个样本,每个样本记录一次完整的交互过程。主要字段包括:多轮对话记录(conversations,以角色和内容对形式存储)、使用的代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、目标任务(task)、实验轮次(episode)、运行 ID(run_id)、试验名称(trial_name)、执行结果(result)、验证器输出(verifier_output)以及轨迹来源(trace_source)。数据集可用于训练或评估AI代理对话能力、任务完成情况,以及分析不同模型和代理在特定任务上的表现。
This dataset contains 5482 samples, each recording a complete interaction process. The main fields include: multi-turn conversation records (conversations, stored as role and content pairs), agent name, model name, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset can be used to train or evaluate AI agent dialogue capabilities, task completion, and analyze the performance of different models and agents on specific tasks.
数据集概述:dev_set_v2_a1_nl2bash_20260820_135116
基本信息
- 数据集名称:dev_set_v2_a1_nl2bash_20260820_135116
- 数据集提供方:LAION(Large-scale Artificial Intelligence Open Network)
- 数据集地址:https://huggingface.co/datasets/laion/dev_set_v2_a1_nl2bash_20260820_135116
数据集规模
- 总数据集大小:516,567,399 字节(约492.6 MB)
- 下载大小:432,215,046 字节(约412.2 MB)
- 数据划分:仅包含训练集(train)
- 训练集样本数量:5,482 条
数据特征
数据集中每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
| conversations | 列表 | 对话内容,每个对话项包含角色(role)和内容(content)两个字段 |
| agent | 字符串 | 智能体标识 |
| model | 字符串 | 使用的模型名称 |
| model_provider | 字符串 | 模型提供方 |
| date | 字符串 | 日期信息 |
| task | 字符串 | 任务名称 |
| episode | 字符串 | 会话轮次编号 |
| run_id | 字符串 | 运行标识 |
| trial_name | 字符串 | 试验名称 |
| result | 字符串 | 执行结果 |
| verifier_output | 字符串 | 验证器输出 |
| trace_source | 字符串 | 轨迹来源 |
数据用途
该数据集由 LAION 发布,专门用于 NL2Bash(自然语言转 Bash 命令) 任务的开发与验证,旨在帮助模型学习将自然语言指令转换为可执行的 Bash 脚本命令。
数据文件结构
- 配置文件:default
- 数据文件路径:data/train-*(分片存储)




