dev_set_v2_a1_stack_bash_20260814_171329
收藏资源简介:
该数据集包含5090个训练样本,每条样本包含多轮对话(conversations字段,每轮由角色role和内容content组成),以及元数据字段:agent(代理标识)、model(模型名称)、model_provider(模型提供方)、date(日期)、task(任务名称)、episode(回合)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)、trace_source(追踪来源)。数据集总大小约为458MB,适用于对话生成、模型评估或Agent行为分析等任务。
The dataset contains 5090 training samples, each sample includes multi-turn conversations (conversations field, each turn consists of role and content), and metadata fields: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, trace_source. The total dataset size is approximately 458MB, suitable for tasks such as dialogue generation, model evaluation, or agent behavior analysis.
数据集概述
该数据集名为 laion/dev_set_v2_a1_stack_bash_20260814_171329,由 LAION 发布,是一个用于训练和评估 AI 智能体在 Bash 环境下执行任务的数据集。
数据集结构
数据集包含以下字段:
- conversations: 对话列表,每条对话包含角色(role)和内容(content)两个子字段。
- agent: 执行任务的智能体名称。
- model: 使用的模型名称。
- model_provider: 模型提供方。
- date: 数据生成的日期。
- task: 具体任务描述。
- episode: 所属的回合编号。
- run_id: 运行标识符。
- trial_name: 试验名称。
- result: 任务执行结果。
- verifier_output: 验证器输出信息。
- trace_source: 数据轨迹的来源。
数据集规模
- 训练集 (train): 包含 5,090 个样本,占 458,477,209 字节(约 437 MB)。
- 数据集总大小: 458,477,209 字节(约 437 MB)。
- 下载大小: 394,908,193 字节(约 377 MB)。
数据文件
数据集只有一个默认配置(default),训练数据存储在 data/train-* 路径下,以分片(shard)形式组织。
用途
该数据集专注于 Bash 环境下的智能体任务,可用于开发、训练和评估在命令行环境中执行复杂操作的 AI 系统,例如自动完成运维、代码执行等场景。




