遇见数据集

onedayagent_traj

收藏
Hugging Face2026-07-21 更新2026-07-23 收录
官方服务:

资源简介:

OneDayAgent Trajectory Data 是一个用于评估自主智能体在长视野任务上性能的数据集,源自论文《OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents》(Zheng等人,2026年)中报告的所有实验。该数据集基于AgentIF-OneDay基准,包含104个任务和767个实例级评分准则。数据集提供了九个完整运行的原始证据链,包括智能体的完整执行轨迹、最终交付产物以及基于LLM-as-judge的每准则评分,旨在确保论文中所有 headline 数字的可直接复现性,无需外部依赖。数据集包含九个运行,覆盖六个主要后端LLM变体(如GLM-5.2、Gemini-3.1-Pro-Preview、Qwen3.5-397B-A17B等)、一个基线(Codex/GPT-5.5 medium)以及三个消融变体(DIRECT、DECOMP、VERIFY)。每个运行遵循统一的六组件布局:核心轨迹文件(rollout1.jsonl,每任务一行JSON对象,共104行,包含任务描述、附件、评分准则、任务标签、领域标签、时间预算、完整提示、最终文本答案、耗时、产物文件列表以及完整的轨迹对话历史)、自动评分文件(auto_score_*.jsonl,每评分准则一行,共767行,包含准则内容、二进制评分、满意度及推理)、人类可读的聚合评分报告、运行日志、环境配置快照以及104个任务各自的最终交付产物目录(包含如Excel、PNG、Markdown、PPT等文件)。轨迹文件中的`trajectory`对象详细记录了系统消息、有序执行阶段(如规划、子任务执行、合成、验证、修复)和扩展信息。评分文件则提供了按任务类型、领域、评分维度、时间预算、附件情况等细粒度聚合的评分结果。数据集适用于自主智能体评估、长视野任务规划与执行分析、LLM-as-judge评分研究以及智能体消融实验分析。

OneDayAgent Trajectory Data is a dataset for evaluating the performance of autonomous agents on long-horizon tasks, derived from all experiments reported in the paper OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents (Zheng et al., 2026). The dataset is based on the AgentIF-OneDay benchmark and includes 104 tasks and 767 instance-level scoring criteria. It provides nine complete runs of raw evidence chains, including the agents full execution trajectories, final deliverables, and per-criterion scores based on LLM-as-judge, aiming to ensure direct reproducibility of all headline numbers in the paper without external dependencies. The dataset contains nine runs, covering six main backend LLM variants (e.g., GLM-5.2, Gemini-3.1-Pro-Preview, Qwen3.5-397B-A17B, etc.), one baseline (Codex/GPT-5.5 medium), and three ablation variants (DIRECT, DECOMP, VERIFY). Each run follows a uniform six-component layout: core trajectory files (rollout1.jsonl, one JSON object per task, 104 lines total, containing task descriptions, attachments, scoring criteria, task labels, domain labels, time budgets, full prompts, final text answers, time consumption, product file lists, and complete trajectory dialogue histories), automatic scoring files (auto_score_*.jsonl, one line per scoring criterion, 767 lines total, containing criterion content, binary scores, satisfaction, and reasoning), human-readable aggregated scoring reports, run logs, environment configuration snapshots, and directories for final deliverables of each of the 104 tasks (including files such as Excel, PNG, Markdown, PPT). The `trajectory` object in the trajectory files records system messages, ordered execution phases (e.g., planning, subtask execution, synthesis, verification, repair), and extended information. The scoring files provide fine-grained aggregated scoring results by task type, domain, scoring dimension, time budget, attachment status, etc. The dataset is suitable for autonomous agent evaluation, long-horizon task planning and execution analysis, LLM-as-judge scoring research, and agent ablation experiment analysis.

提供机构:
ZJUNLP
创建时间:
2026-07-21
原始信息汇总

OneDayAgent Trajectory 数据集

数据集概述

该数据集包含论文 OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents (Zheng et al., 2026) 中所有实验的执行轨迹和 LLM-as-judge 评分,评估基于 AgentIF-OneDay 基准(104 个任务,767 个实例级评分点)。数据集包含每次运行的原始证据链:完整的智能体轨迹、最终交付件以及每个标准的评分。


包含的运行

共 9 次运行,覆盖全部 104 个任务的 AgentIF-OneDay 套件。包括 6 个主要后端、1 个额外基线和 3 个消融变体。

运行目录 论文角色 后端 LLM 论文整体得分
onedayagent_glm52_20260623_132100_8210 OneDayAgent (主) GLM-5.2 0.821
onedayagent_gemini31propreview_20260513_* 后端变体 Gemini-3.1-Pro-Preview 0.743
onedayagent_qwen35_397b_20260610_* 后端变体 Qwen3.5-397B-A17B 0.708
onedayagent_qwen35_9b_20260507_* 后端变体 Qwen3.5-9B 0.624
onedayagent_qwen36_27b_20250618_* 后端变体 Qwen3.6-27B 0.613
codex_gpt55_20260622_174300_6643 基线 Codex (GPT-5.5 medium) 0.664
ablation_study/ablation_glm52_react_direct_* DIRECT 消融 GLM-5.2 0.771
ablation_study/ablation_glm52_decompose_only_* DECOMP 消融 GLM-5.2 0.804
ablation_study/ablation_glm52_verify_only_* VERIFY 消融 GLM-5.2 0.804

注意:FULL 消融变体未重复置于 ablation_study/ 下,其与主 onedayagent_glm52_* 运行相同(两个模块均启用)。


统一的运行目录结构

每次运行包含以下六个组件:

<run>/ ├── auto_score_<ts>.jsonl # 767 行——每条评分标准的评分 ├── auto_score_<ts>.txt # 以上内容的人类可读汇总 ├── run_<ts>.log # 运行日志 ├── env_snapshot.txt # 运行环境配置 ├── <Backend><ts>/ # 后端子目录,仅包含: │ └── rollout1.jsonl # 104 行——每个任务的完整轨迹 └── taskif<id>_<ts>/ # 104 个目录——每个任务的最终交付件 └── ... # 智能体产生的文件(xlsx/png/md/pptx/...)

这六项构成了完整的证据链:任务定义 → 智能体执行 → 最终交付件 → 评分。


rollout1.jsonl — 核心轨迹文件

每行一个 JSON 对象,每次运行 104 行。所有后端(包括 Codex 基线)使用相同 schema。

顶层字段

字段 类型 内容
question_id str 例如 taskif_111
title, description str 任务描述
attachment_filenames list[str] 用户提供的输入文件
score_criteria list[obj] 所有评分点:{content, score}(共 767 条)
reference_answer_attachment_filenames list[str] 参考交付件
task_tag str 交互模式:Open Workflow Execution / Latent Instruction Inference / Iterative Refinement
domain_tag str Work / Life / Study
rubrics_tag str Execution / Content / Form
time str 时间预算:<1h / 1-4h / 4-8h / 8-12h / 12-24h / 24+h
question str 发送给智能体的完整提示
prediction str 智能体的最终文本回答
time_cost float 墙钟时间延迟(秒)(表 3 延迟列)
result_files list[str] 最终交付件文件名(与 taskif_<id>_* 内容匹配)
task_ts str 每个任务的开始时间戳 YYYYMMDD_HHMMSS
trajectory obj 完整对话(见下文)

trajectory 子对象

trajectory: guid : str — 轨迹 ID system_message : {token_cost, role, content, tool_specs} — 系统提示 + 工具 schema conversations : list[stage] — 有序的执行阶段(见下文) ext_info : {type, model, agent, task_description, task_seed} create_time : str — ISO 时间戳

conversations — 执行阶段

每次运行被划分为有序阶段。一个完整的 OneDayAgent 任务通常包括:

索引 阶段 questions solutions answer
0 planning 任务 + 规划器输出 subtask JSON 列表
1..n subtask 子任务提示 ReAct 轮次(reason/act/observe) 子任务摘要
n+1 synthesis 综合提示 候选交付件
n+2 verify 验证提示 {completed, reason, missing_items, suggestions}
n+3 repair? (仅在验证失败时)修复反馈 + ReAct 轮次 修复后的交付件
  • DIRECT 消融:单个子任务阶段,无 verify/repair。
  • DECOMP 消融:有子任务分解,无 verify/repair。
  • VERIFY 消融:有 verify/repair,无分解。

auto_score_*.jsonl / .txt — 评分

auto_score_*.jsonl — 767 行(每条评分标准一行,跨 104 个任务汇总)

json { "question_id": "taskif_111", "agent_name": "react", "method": "gemini-3.1-pro-preview", "criterion_content": "The returned file accurately names the subtable "March"...", "criterion_score": 1, "satisfied": true, "reasoning": "The answer successfully created a new worksheet named March..." }

  • method 是 LLM-as-judge 模型(Gemini-3.1-Pro-Preview,温度 0.1,最大令牌数 65536;参见表 2)。
  • agent_name 始终为字面量 "react",无论实际后端为何——请通过目录名称而非此字段识别运行。

auto_score_*.txt — 预聚合报告

包含主要数值以及表 3 / 表 4 的所有分类(按任务类型、领域、评分维度、时间预算、是否带附件)。Average score 行即为论文中归一化整体得分 ×100。

搜集汇总
数据集介绍
onedayagent_traj 数据集图片
构建方式
OneDayAgent_Traj数据集是基于AgentIF-OneDay基准测试构建的,该基准涵盖104个任务与767个实例级评分点。数据集的构建围绕九个独立运行实验展开,每个实验均覆盖全部任务,包括六种主要后端模型、一个基线模型及三种消融变体。每个运行目录统一包含六类组件:自动评分记录、运行日志、环境快照、后端子目录(存放轨迹文件)、任务交付物子目录以及核心轨迹文件'rollout1.jsonl'。轨迹文件按行存储104个JSON对象,每个对象详细记录了任务标识、评分标准、代理完整对话历史、执行阶段(如规划、子任务、合成、验证及修复)以及最终交付物信息。此外,自动评分文件汇总了LLM作为裁判对每个评分点的二元判定结果,确保论文中所有关键指标均可直接复现。
特点
该数据集的核心特点在于其完整性和结构化设计。每个运行目录构成一条完整的证据链,从任务定义、代理执行轨迹到最终交付物和裁判评分,所有环节均可追溯。轨迹文件采用统一的分阶段架构,清晰划分了规划、子任务执行、交付物合成、验证及修复等阶段,为分析长周期自主代理的行为模式提供了细粒度观测窗口。数据集涵盖了多种后端LLM(如GLM-5.2、Gemini-3.1-Pro-Preview、Qwen系列)及消融变体(直接执行、仅分解、仅验证),支持对代理设计选择的系统性对比研究。评分数据基于767个二元判定点,按任务类型、领域、评分维度和时间预算等多维度聚合,便于进行深入的性能剖析。
使用方法
使用该数据集时,研究人员可直接从各运行目录中加载'rollout1.jsonl'文件,通过解析其JSON结构获取每项任务的执行轨迹、阶段划分和代理回复。自动评分文件'auto_score_*.jsonl'提供了每个评分点对应的LLM裁判判定和推理,可用于复现论文中的性能指标或进行自定义分析。'auto_score_*.txt'文件则提供了预聚合的统计报告,便于快速获取整体性能概览。数据集支持按运行目录名称区分不同实验配置,可通过轨迹中的'task_tag'、'domain_tag'和'rubrics_tag'等字段进行任务子集筛选。由于所有文件均为标准JSON和文本格式,无需额外依赖即可直接使用Python等工具进行数据加载、处理和分析,适用于代理性能基准测试和长周期任务行为研究。
背景与挑战
背景概述
在自主智能体领域,长时域任务执行能力的评估与提升始终是核心研究挑战之一。现有基准多聚焦于短周期、单一目标的场景,难以刻画智能体在跨小时级甚至跨日级任务中的规划、执行与自纠错能力。针对这一空白,Zheng等人于2026年提出了OneDayAgent框架,并同步构建了OneDayAgent Traj数据集,旨在为长时域自主智能体研究提供标准化评估工具。该数据集由多所研究机构联合创建,围绕AgentIF-OneDay基准(涵盖104项任务、767个细粒度评分项)展开,系统记录了智能体在多样化任务类型、领域及时间预算下的完整执行轨迹。数据集收录了六大主流后端模型及消融实验共九组运行结果,包括GLM-5.2、Gemini-3.1-Pro-Preview、Qwen系列等,并提供了LLM-as-Judge自动评分结果,支撑了论文中所有核心指标的复现。OneDayAgent Traj数据集不仅为长时域自主智能体性能对比建立了可靠基准,更通过细粒度轨迹与评分数据的开放,推动了该领域可重复性研究的发展。
当前挑战
OneDayAgent Traj数据集主要应对两大层面的挑战。在领域问题层面,长时域任务要求智能体具备跨多步骤的连贯规划与执行能力,且任务类型涵盖开放工作流执行、隐式指令推断与迭代精炼等高级认知模式,时间跨度从不足一小时到超过24小时不等,这对现有模型的记忆、推理与自适应能力提出了严峻考验。现有基准无法有效刻画这些复杂交互模式,导致模型在长时域场景下的真实能力被低估或误判。在数据集构建层面,首要挑战是设计出能忠实反映执行过程的标准化轨迹记录格式,包括任务定义、智能体决策链条、中间产物及最终交付物。此外,如何确保评分过程客观可复现也是一大难题,为此研究团队采用了LLM-as-Judge自动评分机制,但需在提示词设计、评判标准一致性及跨模型评判偏差控制上进行精心校准。同时,数据集收录了不同后端模型与消融变体在海量任务上的执行日志,需保证轨迹结构统一、评分粒度精细且无外部依赖,确保每一篇论文中的数字均能通过本数据集直接复现,这对数据组织的规范性提出了极高要求。
常用场景
经典使用场景
在长周期自主智能体研究领域,OneDayAgent Trajectory数据集为评估智能体在复杂、多步骤任务中的执行能力提供了标准化基准。该数据集包含104项覆盖工作、生活与学习三大领域的任务,每项任务配备多达767个细粒度评分点,支持对智能体的执行精度、内容质量与形式规范性进行多维剖析。研究者可利用其中的完整轨迹记录与裁判评分,复现论文中的实验结论,并以此为基础开发更高效的智能体架构或优化策略。
实际应用
在实际应用层面,OneDayAgent Trajectory数据集可直接服务于企业级自动化工具的性能筛选与定制化调优。例如,在金融报告生成、医疗文档整理或学术材料编排等需要连续推理与多类工具调用的场景中,开发人员可依据该数据集的评估框架快速测试智能体在实际工作流中的续航能力与错误修复效率。其包含的裁判评分与轨迹细节还支持自动化质量监控系统的构建,降低人工审核成本。
衍生相关工作
该数据集催生了多项延伸性研究工作。围绕其中的轨迹结构与评分模式,学界已发展出针对智能体规划阶段的分解策略优化算法、基于验证反馈的修复机制改进方案,以及跨模型迁移的适配框架。特别地,对Codex基线智能体与其他变体的对比分析,启发了将静态代码生成与动态任务执行结合的新型智能体范式。这些工作进一步深化了对智能体长周期行为建模与归因分析的理论理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务