terminal_bench_2_a1_taskmaster2_20260810_061724
收藏资源简介:
该数据集包含6225个训练样本,每个样本记录了一次多轮对话交互(conversations),其中每条消息包含角色(role)和内容(content)。此外,每个样本还提供了代理名称(agent)、使用的模型(model)及其提供商(model_provider)、对话日期(date)、所属任务(task)、集数(episode)、运行ID(run_id)、试验名称(trial_name)、交互结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集适用于对话系统研究、代理行为分析、模型评估等任务,可用于训练或评估模型在特定任务中的对话能力。
This dataset contains 6225 training samples. Each sample records a multi-turn dialogue interaction (conversations), where each message includes a role and content. Additionally, each sample provides agent name, model used and its provider, conversation date, task, episode, run ID, trial name, interaction result, verifier output, and trace source. The dataset is suitable for tasks such as dialogue system research, agent behavior analysis, and model evaluation, and can be used to train or evaluate models conversational abilities in specific tasks.
数据集详情总结
基本信息
- 数据集名称:
laion/terminal_bench_2_a1_taskmaster2_20260810_061724 - 所属机构:LAION
- 数据集大小:约 579.9 MB(579,885,767 字节)
- 下载大小:约 466.4 MB(466,375,830 字节)
- 数据分割:仅包含
train分割,共 6,225 个样本
数据特征
该数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话记录,包含 role(角色)和 content(内容)两个子字段,均为字符串类型 |
agent |
字符串 | 智能体名称 |
model |
字符串 | 使用的模型 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合/会话编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 执行结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据用途
- 该数据集为 Terminal Bench 2 系列的一部分,面向 A1 任务,基于 Taskmaster2 基准构建。
- 数据内容涉及终端操作场景下的对话记录与任务执行追踪,适用于评估智能体在命令行/终端环境中的任务完成能力。
- 每条样本包含完整的对话上下文、所用模型信息、任务执行结果及验证器反馈,可用于训练或评估对话式 AI 代理在终端任务上的表现。
文件结构
- 数据文件位于
data/train-*路径下,采用默认配置(default),数据格式为支持分片读取的通用格式。




