terminal_bench_2_a1_toolscale_20260810_081852
收藏资源简介:
该数据集包含多轮对话记录及相关元数据。每条样本包含一个 conversations 列表,其中每个对话条目由角色(role)和内容(content)组成,此外还记录了代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)。训练集共有7330个样本,总数据量约为740 MB。该数据集可用于对话系统、模型评估或代理行为分析等场景。
This dataset contains multi-turn dialogue records and related metadata. Each sample includes a conversations list, where each dialogue entry consists of a role and content. Additionally, it records agent name, model name, model provider, date, task, episode number, run ID, trial name, result, verifier output, and trace source. The training set contains 7330 samples with a total data size of approximately 740 MB. This dataset can be used for dialogue systems, model evaluation, or agent behavior analysis scenarios.
数据集概述
基本信息
- 数据集名称:
laion/terminal_bench_2_a1_toolscale_20260810_081852 - 提供机构:LAION
- 数据集大小:约 740.87 MB(下载大小约 588.03 MB)
- 数据划分:仅包含训练集(train),共 7,330 条样本
数据结构
数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话记录,包含角色(role)和内容(content) |
agent |
字符串 | 智能体标识 |
model |
字符串 | 模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期 |
task |
字符串 | 任务描述 |
episode |
字符串 | 会话轮次 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 执行结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据集特点
- 对话格式:每条样本包含多轮对话,每轮对话记录角色(如用户、助手)及对应内容。
- 元数据丰富:包含模型、任务、运行标识、结果验证等多维度信息,方便用于智能体轨迹分析、任务评估与模型微调。
- 规模:训练集约 7,330 条,适用于中等规模实验。
适用场景
- 智能体行为分析与评估
- 多轮对话模型的微调与评测
- 工具调用(ToolScale)相关任务的基准测试
- 模型运行轨迹的追踪与分析




