forge-evals
收藏资源简介:
Forge Agentic Workflow Evaluation Corpus 是一个专注于评估多步骤代理工作流(agentic workflow)的数据集,由 Forge 评估框架生成。该数据集记录了每次评估运行的公开结果(run-level outcome),用于比较不同模型、量化方案、推理后端、函数调用模式、场景、护栏消融以及推理重放策略的效果。数据集中每一行代表一次尝试的评估运行,但并非完整的代理轨迹,不包含完整提示、对话、工具结果或隐藏的模型推理内容。 数据集包含三个配置版本: - `latest`(默认):包含 corpus 范围内最大评估世代的精选行,共 293,800 条尝试,得分 69.84%。 - `snapshot`:保留每个可比配置的选定臂(arm),包括较旧的延续证据,共 412,100 条尝试,得分 62.20%。 - `history`:包含所有已发布的行,包括被取代的世代,按源文件和行哈希顺序排列,共 552,500 条尝试,得分 62.49%。 所有列均采用统一的 v2 模式,共 52 列,涵盖以下类别: - 身份和条件:模型、后端、模式、消融、工具选择、推理重放/级别、场景、运行索引、评估世代。 - 结果:正确性(correct)、完成状态(completed)、验证错误、执行错误类型和消息。 - 效率:迭代次数、理想迭代次数、浪费调用、耗时、上下文预算、流重试次数。 - 护栏和推理遥测:提示次数、工具错误、压缩事件、捕获的推理计数、在线推理计数。 - 托管计费:输入/输出/缓存创建/缓存读取 token 数,以及记录的成本(由源后端提供)。 - 溯源和选择:发布版本、源文件和行哈希、世代元数据、规范配置/臂标识符、选择状态、视图成员资格。 数据集的典型使用场景包括:重新计算聚合指标、进行独立分析;比较受控的模型/后端/模式或消融组;研究完成、验证、效率、重放和护栏行为;构建新的统计视图并保留源级溯源。该数据集不应用于通用模型质量排行榜、训练文本或作为某后端/模型全面优越的证据,也不衡量主观答案质量(仅基于场景的确定性验证器)。 数据集以 Parquet 格式存储,可通过 Hugging Face Datasets 库加载,使用 `load_dataset("antoinezambelli/forge-evals", "latest", split="train")` 等命令。相关溯源文件(provenance/sources.json、schema.json、manifest.json)确保数据的可验证性。
Forge Agentic Workflow Evaluation Corpus is a dataset focused on evaluating multi-step agentic workflows, generated by the Forge evaluation framework. It records the run-level outcome of each evaluation run, enabling comparison of different models, quantization schemes, inference backends, function calling modes, scenarios, guardrail ablations, and inference replay strategies. Each row represents a single attempted evaluation run, not a full agent trajectory, and does not include complete prompts, conversations, tool results, or hidden model reasoning. The dataset includes three configuration versions: latest (default), snapshot, and history, containing 293,800, 412,100, and 552,500 attempts respectively. All columns follow a unified v2 schema with 52 columns, covering categories such as identity and conditions, outcomes, efficiency, guardrail and inference telemetry, hosted billing, and provenance and selection. The dataset is stored in Parquet format and can be loaded via the Hugging Face Datasets library. Typical use cases include recomputing aggregate metrics, comparing controlled model/backend/mode or ablation groups, and studying completion, validation, efficiency, replay, and guardrail behavior. It is not intended for general model quality leaderboards, training text, or as evidence of one backend/models overall superiority.
Forge Agentic Workflow Evaluation Corpus 数据集概述
该数据集用于评估多步骤智能体工作流在不同模型、量化方式、推理后端、函数调用模式、场景、护栏消融和推理重放策略下的表现,发布的是运行级别的结果数据,每一行代表一次评估运行。
数据集配置
| 配置名称 | 尝试次数 | 正确次数 | 有效次数 | 完成次数 | 得分 | 有效准确率 | 完成率 |
|---|---|---|---:|---:|---:|---:|---:|---:|
| latest(默认) | 293,800 | 205,180 | 259,363 | 259,363 | 69.84% | 79.11% | 88.28% |
| snapshot | 412,100 | 256,333 | 344,048 | 344,048 | 62.20% | 74.51% | 83.49% |
| history | 552,500 | 345,280 | 460,591 | 460,591 | 62.49% | 74.96% | 83.36% |
- latest:默认配置,包含语料库最大评估代次中选定的行。
- snapshot:保留每个可比较配置的选定分支,包括在无更新匹配分支时保留的旧有证据。
- history:包含所有已发布的行,包括被取代的代次,按固定源文件和行顺序排列。
指标定义
- 得分(Score):正确数 / 尝试数
- 有效准确率(Validated Accuracy):正确数 / 有效数
- 完成率(Completion Rate):完成数 / 尝试数
其中,attempted_count 表示所选队列中实际存在的行数,correct 可为 true、false 或 null(无可用正确性判断时)。null 判断保留在得分分母中,但不计入有效准确率分母。completed 记录工作流是否正常返回,与正确性无关。
数据模式
所有 52 列使用统一的 v2 模式,主要包含:
- 身份与条件:模型、后端、模式、消融、工具选择、推理重放/级别、场景、运行索引和评估代次。
- 结果:正确性、完成状态、验证错误、执行错误类型和消息。
- 效率:迭代次数、理想迭代次数、浪费的调用、耗时、上下文预算和流重试次数。
- 护栏与推理遥测:提示次数、工具错误、压缩事件、捕获的推理次数和在线推理次数。
- 托管计费:输入、输出、缓存创建、缓存读取 token 数以及记录的成本(后端提供时)。
- 来源与选择:发布版本、源文件和行哈希、代次元数据、规范配置/分支标识符、选择状态和视图成员资格。
代次、重放与保留证据
评估“代次”是比较性时期,而非生成的模型文本或 Forge 发布版本。代次在收集语义发生重大变化时改变,多个发布版本可能共享一个代次。原始 reasoning_replay 字段保留源值;在旋钮出现之前的行没有原始值,解析为有效值 full,且该继承分支与显式记录的 full 分支不同。缺失的原始 reasoning_level 解析为有效值 default。保留证据是仅在不存在较新匹配队列时保留的较旧选定队列。
方法论与统计使用
Forge 场景涵盖工具选择、参数保真度、多步骤序列、错误恢复、状态交互和上下文压力路径。重复运行单独存储。队列比较应控制模型、量化、后端、模式、场景集、重放策略、推理级别、代次和收集环境。对于配对分支,Forge 使用配对 McNemar 检验对匹配的 (scenario, run) 观测值进行分析,并使用 Wilson 区间计算得分。运行行包含配对观测值和精确的结果组件,可用于独立重新计算这些分析。
预期用途
- 从运行级结果重新计算汇总指标并进行独立分析。
- 比较受控的模型/后端/模式或消融队列。
- 研究完成、验证、效率、重放和护栏行为。
- 在保留源级溯源的同时构建新的统计视图。
该数据集不应作为通用模型质量排行榜、训练文本或一个后端/模型普遍更优的证据,也不衡量超出每个场景确定性验证器范围的主观答案质量。
局限性
许多单元格故意缺失或不适用,缺失场景不计为尝试失败。历史证据跨越不同的设备、后端、量化、服务版本、上下文预算和模型特定推理行为。计时、token 和成本字段是操作测量值,仅在兼容的收集条件下可比较。同一场景内的重复运行可能比独立场景级效应更相关。
溯源与完整性
provenance/sources.json 固定每个已发布的源、代次、方言、行数和 SHA-256;provenance/schema.json 包含完整的源方言和规范化模式契约;manifest.json 记录每个配置、逻辑摘要、分片行数、文件哈希、构建器源哈希、Git 修订版、Python 版本和 Parquet 写入器版本。可使用命令 python -m tests.eval.dataset_builder verify --source-root . --bundle <bundle> 验证下载的捆绑包。
引用信息
- 项目与方法:https://github.com/antoinezambelli/forge/blob/main/docs/EVAL_GUIDE.md
- 论文引用:Zambelli, A. Forge: Closing the Agentic Reliability Gap Between Self-Hosted and Frontier Language Models. https://doi.org/10.1145/3786335.3813193
- 许可证:MIT





