遇见数据集

forge-evals

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

Forge Agentic Workflow Evaluation Corpus 是一个专注于评估多步骤代理工作流(agentic workflow)的数据集,由 Forge 评估框架生成。该数据集记录了每次评估运行的公开结果(run-level outcome),用于比较不同模型、量化方案、推理后端、函数调用模式、场景、护栏消融以及推理重放策略的效果。数据集中每一行代表一次尝试的评估运行,但并非完整的代理轨迹,不包含完整提示、对话、工具结果或隐藏的模型推理内容。 数据集包含三个配置版本: - `latest`(默认):包含 corpus 范围内最大评估世代的精选行,共 293,800 条尝试,得分 69.84%。 - `snapshot`:保留每个可比配置的选定臂(arm),包括较旧的延续证据,共 412,100 条尝试,得分 62.20%。 - `history`:包含所有已发布的行,包括被取代的世代,按源文件和行哈希顺序排列,共 552,500 条尝试,得分 62.49%。 所有列均采用统一的 v2 模式,共 52 列,涵盖以下类别: - 身份和条件:模型、后端、模式、消融、工具选择、推理重放/级别、场景、运行索引、评估世代。 - 结果:正确性(correct)、完成状态(completed)、验证错误、执行错误类型和消息。 - 效率:迭代次数、理想迭代次数、浪费调用、耗时、上下文预算、流重试次数。 - 护栏和推理遥测:提示次数、工具错误、压缩事件、捕获的推理计数、在线推理计数。 - 托管计费:输入/输出/缓存创建/缓存读取 token 数,以及记录的成本(由源后端提供)。 - 溯源和选择:发布版本、源文件和行哈希、世代元数据、规范配置/臂标识符、选择状态、视图成员资格。 数据集的典型使用场景包括:重新计算聚合指标、进行独立分析;比较受控的模型/后端/模式或消融组;研究完成、验证、效率、重放和护栏行为;构建新的统计视图并保留源级溯源。该数据集不应用于通用模型质量排行榜、训练文本或作为某后端/模型全面优越的证据,也不衡量主观答案质量(仅基于场景的确定性验证器)。 数据集以 Parquet 格式存储,可通过 Hugging Face Datasets 库加载,使用 `load_dataset("antoinezambelli/forge-evals", "latest", split="train")` 等命令。相关溯源文件(provenance/sources.json、schema.json、manifest.json)确保数据的可验证性。

Forge Agentic Workflow Evaluation Corpus is a dataset focused on evaluating multi-step agentic workflows, generated by the Forge evaluation framework. It records the run-level outcome of each evaluation run, enabling comparison of different models, quantization schemes, inference backends, function calling modes, scenarios, guardrail ablations, and inference replay strategies. Each row represents a single attempted evaluation run, not a full agent trajectory, and does not include complete prompts, conversations, tool results, or hidden model reasoning. The dataset includes three configuration versions: latest (default), snapshot, and history, containing 293,800, 412,100, and 552,500 attempts respectively. All columns follow a unified v2 schema with 52 columns, covering categories such as identity and conditions, outcomes, efficiency, guardrail and inference telemetry, hosted billing, and provenance and selection. The dataset is stored in Parquet format and can be loaded via the Hugging Face Datasets library. Typical use cases include recomputing aggregate metrics, comparing controlled model/backend/mode or ablation groups, and studying completion, validation, efficiency, replay, and guardrail behavior. It is not intended for general model quality leaderboards, training text, or as evidence of one backend/models overall superiority.

创建时间:
2026-08-08
原始信息汇总

Forge Agentic Workflow Evaluation Corpus 数据集概述

该数据集用于评估多步骤智能体工作流在不同模型、量化方式、推理后端、函数调用模式、场景、护栏消融和推理重放策略下的表现,发布的是运行级别的结果数据,每一行代表一次评估运行。

数据集配置

| 配置名称 | 尝试次数 | 正确次数 | 有效次数 | 完成次数 | 得分 | 有效准确率 | 完成率 | |---|---|---|---:|---:|---:|---:|---:|---:| | latest(默认) | 293,800 | 205,180 | 259,363 | 259,363 | 69.84% | 79.11% | 88.28% | | snapshot | 412,100 | 256,333 | 344,048 | 344,048 | 62.20% | 74.51% | 83.49% | | history | 552,500 | 345,280 | 460,591 | 460,591 | 62.49% | 74.96% | 83.36% |

  • latest:默认配置,包含语料库最大评估代次中选定的行。
  • snapshot:保留每个可比较配置的选定分支,包括在无更新匹配分支时保留的旧有证据。
  • history:包含所有已发布的行,包括被取代的代次,按固定源文件和行顺序排列。

指标定义

  • 得分(Score):正确数 / 尝试数
  • 有效准确率(Validated Accuracy):正确数 / 有效数
  • 完成率(Completion Rate):完成数 / 尝试数

其中,attempted_count 表示所选队列中实际存在的行数,correct 可为 true、false 或 null(无可用正确性判断时)。null 判断保留在得分分母中,但不计入有效准确率分母。completed 记录工作流是否正常返回,与正确性无关。

数据模式

所有 52 列使用统一的 v2 模式,主要包含:

  • 身份与条件:模型、后端、模式、消融、工具选择、推理重放/级别、场景、运行索引和评估代次。
  • 结果:正确性、完成状态、验证错误、执行错误类型和消息。
  • 效率:迭代次数、理想迭代次数、浪费的调用、耗时、上下文预算和流重试次数。
  • 护栏与推理遥测:提示次数、工具错误、压缩事件、捕获的推理次数和在线推理次数。
  • 托管计费:输入、输出、缓存创建、缓存读取 token 数以及记录的成本(后端提供时)。
  • 来源与选择:发布版本、源文件和行哈希、代次元数据、规范配置/分支标识符、选择状态和视图成员资格。

代次、重放与保留证据

评估“代次”是比较性时期,而非生成的模型文本或 Forge 发布版本。代次在收集语义发生重大变化时改变,多个发布版本可能共享一个代次。原始 reasoning_replay 字段保留源值;在旋钮出现之前的行没有原始值,解析为有效值 full,且该继承分支与显式记录的 full 分支不同。缺失的原始 reasoning_level 解析为有效值 default。保留证据是仅在不存在较新匹配队列时保留的较旧选定队列。

方法论与统计使用

Forge 场景涵盖工具选择、参数保真度、多步骤序列、错误恢复、状态交互和上下文压力路径。重复运行单独存储。队列比较应控制模型、量化、后端、模式、场景集、重放策略、推理级别、代次和收集环境。对于配对分支,Forge 使用配对 McNemar 检验对匹配的 (scenario, run) 观测值进行分析,并使用 Wilson 区间计算得分。运行行包含配对观测值和精确的结果组件,可用于独立重新计算这些分析。

预期用途

  • 从运行级结果重新计算汇总指标并进行独立分析。
  • 比较受控的模型/后端/模式或消融队列。
  • 研究完成、验证、效率、重放和护栏行为。
  • 在保留源级溯源的同时构建新的统计视图。

该数据集不应作为通用模型质量排行榜、训练文本或一个后端/模型普遍更优的证据,也不衡量超出每个场景确定性验证器范围的主观答案质量。

局限性

许多单元格故意缺失或不适用,缺失场景不计为尝试失败。历史证据跨越不同的设备、后端、量化、服务版本、上下文预算和模型特定推理行为。计时、token 和成本字段是操作测量值,仅在兼容的收集条件下可比较。同一场景内的重复运行可能比独立场景级效应更相关。

溯源与完整性

provenance/sources.json 固定每个已发布的源、代次、方言、行数和 SHA-256;provenance/schema.json 包含完整的源方言和规范化模式契约;manifest.json 记录每个配置、逻辑摘要、分片行数、文件哈希、构建器源哈希、Git 修订版、Python 版本和 Parquet 写入器版本。可使用命令 python -m tests.eval.dataset_builder verify --source-root . --bundle <bundle> 验证下载的捆绑包。

引用信息

  • 项目与方法:https://github.com/antoinezambelli/forge/blob/main/docs/EVAL_GUIDE.md
  • 论文引用:Zambelli, A. Forge: Closing the Agentic Reliability Gap Between Self-Hosted and Frontier Language Models. https://doi.org/10.1145/3786335.3813193
  • 许可证:MIT
搜集汇总
数据集介绍
forge-evals 数据集图片
构建方式
该数据集名为Forge Agentic Workflow Evaluation Corpus,由Forge项目构建,旨在系统评估多步骤智能体工作流在不同模型、量化级别、推理后端、函数调用模式、场景、护栏消融和推理回放策略下的表现。数据集通过发布运行级别的结果记录,每条记录代表一次评估运行,涵盖身份条件、结果、效率、护栏与推理遥测、托管计费以及来源与选择等52列明确结构的字段。构建过程中,来源JSONL文件不被修改,每个接受的源修订版本通过精确哈希固定,并附带来源验证文件以确保数据的完整性和可追溯性。数据集提供三种配置:最新(默认)、快照和历史,分别对应不同的选择策略和记录保留方式,以满足不同分析场景的需求。
特点
该数据集的核心特征在于其作为结果语料库的定位,专注于运行级别的结果而非完整代理轨迹,不包含提示、对话或隐藏推理等端到端内容。其指标合同明确,包括得分、验证准确率和完成率等可复现的计算公式,并提供了精确的整数成分以确保统计透明度。数据集的独特之处在于其多维度比较能力,支持控制模型、量化、后端、模式、场景集、回放策略、推理级别和生成环境等因素进行配对分析,如使用McNemar检验和Wilson区间进行统计推断。此外,数据集覆盖了从旧证据到最新生成的三种配置,允许研究历史演变和可比性,同时保留了来源级溯源和验证信息,增强了分析的可信度和灵活性。
使用方法
使用该数据集时,用户可以通过HuggingFace的datasets库轻松加载不同配置的数据,例如加载最新、快照或历史版本。数据集适用于重新计算聚合指标、进行独立的统计分析,以及对比受控的模型/后端/模式或消融实验队列。用户可研究完成率、验证行为、效率、回放和护栏效果,并基于运行级结果构建新的统计视图,同时保留来源级溯源。然而,数据集不应被用作通用模型质量排行榜、训练文本或判断模型优越性的证据,且不衡量主观答案质量。由于许多单元格可能缺失或不可用,分析时应严格控制条件并考虑历史证据的差异,以确保比较的公平性和结论的可靠性。
背景与挑战
背景概述
Forge Agentic Workflow Evaluation Corpus(简称forge-evals)是由研究者Antoine Zambelli于2024年创建并发布的开源数据集,旨在系统评估多步骤智能体工作流在不同模型、量化级别、推理后端、函数调用模式、场景及防护栏消融等条件下的表现。该数据集源自Forge项目,其核心研究问题在于弥合自托管语言模型与前沿模型之间在智能体可靠性上的差距,相关成果发表于ACM会议论文(DOI:10.1145/3786335.3813193)。作为首个大规模智能体评估结果语料库,forge-evals提供了超过55万次尝试运行的细粒度结果记录,涵盖正确性、完成率、效率及推理遥测等多维指标,为智能体系统的可复现性研究树立了新标杆,对agent评估领域产生了深远影响。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。在领域层面,智能体评估需克服场景多样性、多步推理的复杂依赖以及结果正确性判定的主观性,现有基准往往局限于单步任务或静态指标,难以全面反映真实世界中的工具选择、参数保真度、错误恢复及状态跟踪能力。构建过程中,数据收集需兼容不同模型、后端和量化配置,导致环境异构性显著,历史数据跨越多种运行条件,使得横截面比较易受混杂因素干扰;同时,空缺值处理、旧版本语义映射(如legacy字段归一化)及来源可追溯性要求平衡数据完整性与工程实现复杂度,最终通过精确哈希钉扎和分代机制解决了数据一致性问题。
常用场景
经典使用场景
Forge Agentic Workflow Evaluation Corpus(简称forge-evals)作为一项专为多步骤智能体工作流设计的评估语料库,其核心应用在于系统性地度量不同模型、量化级别、推理后端、函数调用模式以及防护栏消融等变量对智能体任务执行效能的综合影响。该数据集以运行级结果记录为基本单元,每一行代表一次完整的评估尝试,从而支持研究者对智能体在工具选择、参数保真度、序列编排、错误恢复和状态管理等关键环节的表现进行细粒度剖析,成为代理式工作流对比研究与可复现性分析的基础性资源。
实际应用
在实际应用中,forge-evals的价值体现在多个层面:对于模型部署工程师,它能够辅助甄别在特定推理条件下(如量化或自托管后端)表现稳健的配置,从而调和本地推理与前沿模型之间的可靠性鸿沟;对于智能体应用开发者,该语料库揭示的完成率、验证精度及成本效率指标,可直接指导工作流设计中防护栏策略、思维重放机制及上下文预算的优化;此外,该数据集还为自动化评测平台提供了标准化参照,使得跨团队、跨时段的效能追踪成为可能,在工业界智能体从原型走向生产的过程中扮演了基准验证的关键角色。
衍生相关工作
围绕forge-evals已经衍生出若干具有影响力的学术与实践成果。其数据组织方式和度量合同为后续智能体基准测试的设计树立了范例,启发了若干专门针对函数调用或工具使用场景的评估框架。基于该数据集,研究者构建了预测模型来分析推理重放策略对任务成功率的影响,并开发了用于异常检测的统计工具,以识别评估过程中由环境波动引起的偏差。此外,其开源的验证方法与完整溯源机制也为探索大型语言模型在多样后端上的行为一致性研究提供了共享语料,直接支撑了关于自托管与前沿推理系统可靠边界的一系列后续探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务