eval-laion_lrboost-80-8B_DCAgent2_terminal_bench_2-traces
收藏资源简介:
该数据集记录了AI代理在多种任务上的执行轨迹和对话交互数据。每个数据样本包含多轮对话记录(conversations字段,含对话内容和角色信息),以及丰富的元数据:执行代理(agent)、使用的模型(model)及提供商(model_provider)、执行日期(date)、任务类型(task)、任务场景(episode)、运行标识(run_id)、试验名称(trial_name)、任务执行结果(result)、验证器输出(verifier_output)和数据来源(trace_source)。数据集规模为1103个样本,适用于AI代理性能评估、多轮对话系统分析、任务完成度验证、模型行为研究等应用场景。
This dataset records the execution trajectories and dialogue interactions of AI agents across various tasks. Each data sample includes multi-turn conversation records (conversations field, containing dialogue content and role information), along with rich metadata: executing agent (agent), model used (model) and provider (model_provider), execution date (date), task type (task), task scenario (episode), run identifier (run_id), trial name (trial_name), task execution result (result), verifier output (verifier_output), and data source (trace_source). The dataset consists of 1103 samples and is suitable for applications such as AI agent performance evaluation, multi-turn dialogue system analysis, task completion verification, and model behavior research.
数据集概述
该数据集名为 eval-laion_lrboost-80-8B_DCAgent2_terminal_bench_2-traces,由 LAION 提供,主要用于评估特定模型在智能体任务中的表现。
数据字段
数据集包含以下字段:
- conversations:对话记录,每条记录包含
content(字符串,对话内容)和role(字符串,角色标识)。 - agent:智能体名称(字符串)。
- model:使用的模型名称(字符串)。
- model_provider:模型提供方(字符串)。
- date:数据日期(字符串)。
- task:任务类型(字符串)。
- episode:轮次编号(字符串)。
- run_id:运行 ID(字符串)。
- trial_name:试验名称(字符串)。
- result:任务结果(字符串)。
- verifier_output:验证器输出(字符串)。
- trace_source:追踪来源(字符串)。
数据规模
- 数据集总大小:约 97.82 MB。
- 下载大小:约 73.01 MB。
- 数据划分:仅包含训练集(
train),共 1103 条样本。
配置与文件
- 配置名称:
default。 - 数据文件路径:
data/train-*(分片存储)。




