terminal_bench_2_a1_stack_selfdoc_20260803_154957
收藏资源简介:
该数据集包含1564个训练样本,每个样本由多轮对话(conversations)组成,其中每条对话记录包括角色(role)和内容(content)。此外,每个样本还带有代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等字段。数据集适用于多轮对话分析、AI代理行为评估、模型性能验证等任务,可能涉及问答、指令跟随或工具使用等场景。
This dataset contains 1564 training samples, each consisting of multi-turn conversations, where each conversation record includes role and content. Additionally, each sample is accompanied by fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset is suitable for tasks such as multi-turn conversation analysis, AI agent behavior evaluation, and model performance verification, potentially involving question answering, instruction following, or tool use scenarios.
数据集详情:laion/terminal_bench_2_a1_stack_selfdoc_20260803_154957
基本信息
- 数据集名称:terminal_bench_2_a1_stack_selfdoc_20260803_154957
- 数据集提供方:LAION
- 数据大小:数据集总大小约173.36 MB,下载大小约144.64 MB
- 分割信息:仅包含训练集(train),共1,564个样本
数据特征
数据集包含以下12个字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| conversations | 列表(包含role和content两个子字段) | 对话内容,其中role为字符串,content为字符串 |
| agent | 字符串 | 智能体信息 |
| model | 字符串 | 使用的模型 |
| model_provider | 字符串 | 模型提供方 |
| date | 字符串 | 日期 |
| task | 字符串 | 任务描述 |
| episode | 字符串 | 回合/场景编号 |
| run_id | 字符串 | 运行标识 |
| trial_name | 字符串 | 实验/试验名称 |
| result | 字符串 | 结果 |
| verifier_output | 字符串 | 验证器输出 |
| trace_source | 字符串 | 追踪来源 |
数据配置
- 配置名称:default
- 数据文件路径:data/train-*(包含通配符匹配的多个文件)
要点总结
该数据集属于LAION发布的terminal_bench系列,聚焦于基于终端(terminal)的智能体基准测试任务,包含详细的对话轨迹、模型执行信息(如模型提供方、运行ID)、任务结果及验证信息(verifier_output),可用于研究智能体在终端环境中的任务执行与自我文档生成能力。数据集结构清晰,每个样本包含完整的对话记录及执行元数据,适合用于训练和评估终端操作相关的智能体模型。




