遇见数据集

env0-experiment-trajectories

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

Env0 Experiment Trajectories 是一个私有数据集,旨在保存来自 2026 年 6 月 16-17 日 Env0 后训练试点的完整 BenchFlow 评估轨迹工件。数据集内容主要包括:位于 `eval_summaries/` 目录下的 BenchFlow 任务级别摘要、每个任务的结果与奖励元数据,以及从基础和适配器评估运行中捕获的 ACP 轨迹文件。此外,还包含 2026 年 6 月 19 日 SkillsBench 10 任务管道金丝雀测试的完整工件同步,涵盖工件审计报告和每次 rollout 的轨迹。数据集在上传前已扫描常见实时令牌模式。由于轨迹中可能仍包含本地路径、模拟服务状态、提供者请求元数据以及其他不应未经单独审查即公开的实验上下文信息,因此该数据集被设为私有。这些工件的目的是为了长期保存和确保可审计性,它们记录了 BenchFlow -> Modal vLLM -> Pi-ACP -> 验证器路径产生了带有奖励的评估轨迹,但其本身并不直接证明模型性能的提升。

Env0 Experiment Trajectories is a private dataset designed to preserve complete BenchFlow evaluation trajectory artifacts from the Env0 post-training pilot conducted on June 16–17, 2026. The dataset primarily comprises: BenchFlow task-level summaries stored in the `eval_summaries/` directory, result and reward metadata for each task, as well as ACP trajectory files captured from both base model and adapter evaluation runs. Additionally, it includes full artifact synchronization from the SkillsBench 10-task pipeline canary test held on June 19, 2026, covering artifact audit reports and trajectories from each rollout. The dataset was scanned for common live token patterns prior to upload. Given that the trajectories may still contain local paths, simulated service states, provider request metadata, and other experimental contextual information that should not be disclosed without separate review, this dataset is designated as private. The purpose of these artifacts is long-term preservation and auditability; they document reward-bearing evaluation trajectories generated via the BenchFlow -> Modal vLLM -> Pi-ACP -> Validator pipeline, but do not directly demonstrate improved model performance.

创建时间:
2026-06-18
原始信息汇总

数据集概述

名称:Env0 Experiment Trajectories

语言:英语

标签:benchflow, env0, trajectories, tool-use

可见性:私有数据集


内容

该数据集保存了2026年6月16日至17日Env0后训练试点项目中的完整BenchFlow评估轨迹工件。数据来自经净化的会话导出源仓库:https://github.com/benchflow-ai/env0-experiment

数据集包含以下文件结构:

  • eval_summaries/**/summary.json:BenchFlow任务级摘要
  • eval_summaries/**/result.json:每个任务的结果和奖励元数据
  • eval_summaries/**/trajectory/acp_trajectory.jsonl:基础和适配器评估运行中捕获的ACP轨迹
  • experiments/skillsbench/qwen35-skillsbench-sglang/canary10-20260619-150811/**:2026年6月19日SkillsBench 10任务管道金丝雀的完整工件同步,包括工件审计报告和每个部署轨迹

上传文件在提交前已扫描常见实时令牌模式。数据集为私有,因为轨迹中可能仍包含本地路径、模拟服务状态、提供者请求元数据及其他未经过单独审查不应公开的实验上下文信息。


范围

这些工件用于长期保存和可审计性。它们记录了BenchFlow → Modal vLLM → Pi-ACP → 验证器路径产生了可获奖励的评估轨迹,但数据集本身并不单独证明模型性能提升。

搜集汇总
数据集介绍
env0-experiment-trajectories 数据集图片
构建方式
该数据集源自2026年6月16日至17日进行的Env0后训练试点实验,系统性地保存了BenchFlow评估流程中生成的全部轨迹工件。数据构建依托于BenchFlow框架,通过Modal vLLM部署的Pi-ACP推理管道与验证器协同运作,产出包含奖励信号的评估轨迹。数据采集涵盖基础模型与适配模型的两次独立评估运行,以ACP轨迹格式(acp_trajectory.jsonl)记录代理与环境交互的完整序列。此外,数据集中还纳入了2026年6月19日SkillsBench十任务流水线金丝雀测试的完整工件同步结果,包括审计报告与逐轨迹展开细节,从而构建起一个结构严谨、层次分明的实验轨迹档案库。
特点
该数据集最显著的特征在于其封闭性与审计导向。作为私有数据集,其访问受到严格控制,原因在于轨迹文件中可能残留本地路径、模拟服务状态、提供方请求元数据等敏感实验上下文信息,未经单独审查不宜公开。数据集内部采用层级分明的目录组织方式,涵盖作业级摘要、任务结果与奖励元数据、ACP轨迹序列等多元内容,尤其保留了金丝雀测试的完整审计报告与逐轨迹展开详情。这种设计使其成为长期保存与可审计性的理想载体,能够忠实记录BenchFlow至Pi-ACP管道产出有奖励信号的评估轨迹这一完整过程,为后续实验复现与质量回溯提供坚实依据。
使用方法
该数据集主要用于实验轨迹的长期保存与审计验证。用户可通过读取`eval_summaries`目录下的`summary.json`获取作业级评估概览,解析`result.json`以获取每项任务的奖励元数据与结果判决。对于需要深入分析代理行为的研究者,可加载`trajectory/acp_trajectory.jsonl`文件,该文件按行存储ACP格式的轨迹序列,便于逐步回溯模型在环境中的决策过程。金丝雀测试的完整工件存放于`experiments/skillsbench/qwen35-skillsbench-sglang/canary10-20260619-150811`路径下,可用于复现特定流水线的运行细节或进行跨实验对比分析。鉴于数据集的私有属性,使用前需获得相应访问权限,并注意轨迹数据中可能隐含的敏感信息。
背景与挑战
背景概述
Env0 Experiment Trajectories数据集创建于2026年6月,由BenchFlow团队在Env0后训练试点项目中生成,旨在系统化捕获和保存工具使用场景下的大语言模型评估轨迹。核心研究问题聚焦于验证从BenchFlow到Modal vLLM、Pi-ACP及验证器的完整流水线能否产出带有奖励信号的评估轨迹,为模型后训练提供可审计的实证依据。该数据集通过记录标准化任务结果与元数据,为工具增强型语言模型的性能评估与可重复性研究提供了重要基础资源,有助于推动该领域从经验性报告向结构化、可验证的评估范式转型。
当前挑战
该数据集所解决的领域问题在于,工具使用场景下的评估轨迹往往缺乏标准化记录与持久化归档,导致模型训练过程中的奖励信号无法被系统地复现与审计。数据集构建过程中面临的核心挑战包括:轨迹中可能包含本地路径、模拟服务状态及提供者请求元数据等敏感实验上下文,需进行严格的脱敏审查后方可公开;此外,现有实验凭证虽能证明流水线产生了有奖励的评估轨迹,但尚不足以单独验证模型能力的实际提升,凸显了端到端归因分析的复杂性。
常用场景
经典使用场景
Env0 Experiment Trajectories数据集专为记录与复现大语言模型后训练阶段的评估轨迹而设计,广泛应用于模型性能的追溯性分析与基准测试。在工具使用与智能体行为评估等前沿领域,研究者可借助该数据集捕获的ACP轨迹,系统性地检视模型在多样化任务中的决策路径、中间状态及奖励反馈,为模型行为的可解释性研究提供坚实的数据基础。通过分析完整的评估轨迹,科研人员能够深入剖析模型在复杂工程环境中的推理过程与错误模式,推动大模型训练与评估范式的持续优化。
衍生相关工作
Env0 Experiment Trajectories数据集的发布催生了多项关于评估轨迹分析与模型行为审计的后续研究。其定义的ACP轨迹格式与完整评估流水线记录方法,为BenchFlow生态下的多任务评估框架、基于轨迹的奖励建模以及弱到强泛化等研究方向提供了可扩展的数据基础设施。后续工作在此基础上引入了轨迹级别的差异分析技术,通过对比基线与适配模型的决策路径,实现了对后训练策略导致的细粒度行为偏移的量化检测。此外,该数据集促进了面向大模型可审计性的元数据标准化探索,推动了跨平台评估实验结果的可比性与复现性提升。
数据集最近研究
最新研究方向
该数据集聚焦于智能体协作框架中的工具使用行为轨迹保存与分析,属于大语言模型后训练阶段的关键验证环节。结合2026年Env0后训练试验这一前沿事件,数据集记录了BenchFlow评估流程中多模态推理、ACP协议交互及奖励信号生成的完整生态轨迹,为研究模型在工具增强环境中的逐步决策与归因提供了不可替代的审计凭证。其私有化特性反映了当前领域对实验可复现性与安全边界的双重重视,推动了智能体评估从静态基准向动态轨迹分析的范式迁移,对构建可信赖的协作式AI系统具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务