terminal_bench_2_a1_unitsyn_python_20260808_162058
收藏资源简介:
该数据集包含多轮对话的记录,每条对话由一系列角色(role)和内容(content)组成,并附加了丰富的元数据字段,包括使用的智能体(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)。数据集共包含4710个训练样本,总大小约352MB,下载大小约288MB。该数据集适用于对话系统评测、多轮交互分析、模型行为追踪等任务。
This dataset contains records of multi-turn dialogues, each consisting of a series of roles and contents, along with rich metadata fields including agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset contains 4710 training samples, with a total size of approximately 352MB and a download size of approximately 288MB. It is suitable for tasks such as dialogue system evaluation, multi-turn interaction analysis, and model behavior tracking.
数据集概述
此数据集为 laion/terminal_bench_2_a1_unitsyn_python_20260808_162058,由 LAION 团队创建,用于终端(Terminal)操作相关的基准测试与评估,专注于 Python 编程环境。
基本信息
- 数据集名称:terminal_bench_2_a1_unitsyn_python_20260808_162058
- 任务类型:终端操作基准测试(Terminal Bench)
- 语言/环境:Python
- 下载大小:约 288.84 MB
- 数据集总大小:约 352.72 MB
数据划分
- 训练集(train):
- 样本数量:4,710 条
- 数据大小:约 352.72 MB(占全部数据)
数据字段(Features)
每条样本包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
conversations |
list | 对话记录,包含角色和内容(角色为字符串,内容为字符串) |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务描述 |
episode |
字符串 | 回合/场景编号 |
run_id |
字符串 | 运行标识符 |
trial_name |
字符串 | 尝试名称 |
result |
字符串 | 执行结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据格式
- 配置文件:default
- 数据文件路径:
data/train-*(Parquet 格式,支持通配符读取)
数据集用途
该数据集主要用于评估和调试大语言模型在终端环境中的操作能力,特别是针对 Python 任务的执行、跟踪与验证,适用于智能体行为分析、代码生成以及终端交互场景的研究。




