terminal_bench_2_a1_qasper_20260804_134723
收藏资源简介:
该数据集包含多轮对话记录,每条记录由对话内容(conversations,包含角色 role 和文本 content)、代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行 ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)等字段组成。数据集共包含 4287 个训练样本,总大小约 365MB,适用于对话系统的训练、评估与分析。
This dataset contains multi-turn dialogue records, each consisting of fields such as conversation content (conversations, including role and text content), agent name (agent), model name (model), model provider (model_provider), date (date), task (task), episode (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset contains a total of 4287 training samples, with a total size of approximately 365MB, suitable for training, evaluation, and analysis of dialogue systems.
数据集详情:laion/terminal_bench_2_a1_qasper_20260804_134723
基本信息
- 数据集名称:terminal_bench_2_a1_qasper_20260804_134723
- 所属机构:LAION
- 数据规模:训练集包含 4,287 条样本,总大小约 365.77 MB,下载大小约 310.14 MB
数据特征
该数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
| conversations | 列表 | 对话内容,每项包含角色(role)和内容(content),均为字符串 |
| agent | 字符串 | 智能体名称 |
| model | 字符串 | 使用的模型 |
| model_provider | 字符串 | 模型提供方 |
| date | 字符串 | 日期 |
| task | 字符串 | 任务类型 |
| episode | 字符串 | 回合编号 |
| run_id | 字符串 | 运行标识 |
| trial_name | 字符串 | 试验名称 |
| result | 字符串 | 结果 |
| verifier_output | 字符串 | 验证器输出 |
| trace_source | 字符串 | 轨迹来源 |
数据集划分
- 划分方式:仅包含训练集(train)
- 数据格式:数据文件存储在
data/train-*路径下
数据用途
该数据集属于 Terminal-Bench 2 系列,任务类型为 a1_qasper,主要用于评估智能体在终端环境中的任务执行能力,结合 QASPER 数据集场景,可应用于智能体系统评测、对话系统训练及终端操作任务研究等领域。




