遇见数据集

Fara-40-baseline-artifact

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集提供了 WootzApp CUA Bench 中 Fara 1.5 9B 模型在40个任务上的基线评估完整工件。数据包含两个配置:任务级结果(task-results)和评估摘要(summary),均以 Parquet 格式存储。评估记录了每个任务的原始输出、模型输出、日志、评分标准及验证器结果,并提供了精确的来源追踪(模型检查点、任务数据集、基础设施代码等)。在40个选定任务中,模型通过了8个,24个出现验证器失败,8个出现执行错误,总通过率(Pass@1)为20.0%,在通过验证的任务中通过率为25.0%。该数据集适用于审计、复现评估结果以及深入分析模型在特定任务上的表现。

This dataset provides the complete baseline evaluation artifacts of the Fara 1.5 9B model on 40 tasks in the WootzApp CUA Bench. The data contains two configurations: task-level results (task-results) and evaluation summary (summary), both stored in Parquet format. The evaluation records raw output, model output, logs, scoring criteria, and validator results for each task, along with precise source tracking (model checkpoint, task dataset, infrastructure code, etc.). Among the 40 selected tasks, the model passed 8, had 24 validator failures, and 8 execution errors, with a total pass rate (Pass@1) of 20.0% and a pass rate of 25.0% among tasks that passed validation. This dataset is suitable for auditing, reproducing evaluation results, and conducting in-depth analysis of model performance on specific tasks.

创建时间:
2026-09-29
原始信息汇总

Fara 1.5 9B 40-Task Baseline Evaluation Artifacts

数据集概述

该数据集保存了 WootzApp CUA Bench 中 40 项任务的 Fara 基线评估的完整评估产物。

评估结果

指标 数值
选定任务数 40
通过 8
验证器失败 24
执行错误 8
基础设施错误 0
所有选定任务的 Pass@1 20.0%
已验证任务的通过率 25.0%

执行错误仍保留在分母中。数据集包含原始任务日志,因此这八个任务可以与验证器评分的失败任务分开审计。

精确来源

组件 仓库或资源 精确版本
上游模型 microsoft/Fara1.5-9B 1a93677cd89d5601bc2ed759791e981f3a520032
保留的模型检查点 WootzappLab/fara-9b-baseline-eval 6b15345b4dd7d567863bc08ec3bc79b44780dd99
Fara 推理源代码 服务设置所使用的 Microsoft Fara 源代码 a675d6d61c41c47ae87bacefeab22caad18e3e84
任务数据集 WootzappLab/cua-bench-baseline-40 c2dd9ed8f23cbc477f49be7b7704e42bf4d46de6;精确快照 SHA256 745f113b9c45f1a8dc3581ebc671435a3eafdfdbfb38bcaa6df1097ec10ab2e3
记录器、浏览器测试框架、环境、验证器 tokenbender/w8-cua-bench 09976c86454f9a87e2fa6a3a3589d2e4d24f180e
基础设施代码 infra-changes 分支 eb5dc3d9e0cbfbe389334b0600002f8db3a795dd
结果包 原始产物与任务快照清单 43f4ed88b79d9c0abe7a733ac6499b0000364e3f1f676a29320e83d1682e081b

评估使用了 GCP 实例 w8-fara-9b-8115f370-head-3ibtw2ah-compute,项目为 lifeandhalf-24122025,区域为 us-central1-a。

仓库结构

  • artifacts/43f4ed88b79d9c0abe7a733ac6499b0000364e3f1f676a29320e83d1682e081b/raw/:完整原始输出,包括每个任务的录制、模型输出、日志、评分标准和验证器结果
  • artifacts/43f4ed88b79d9c0abe7a733ac6499b0000364e3f1f676a29320e83d1682e081b/source/tasks.jsonl:精确的 40 项任务输入快照
  • data/task-results-00000-of-00001.parquet:每个任务一行规范化记录,以及默认数据集视图
  • data/summary-00000-of-00001.parquet:评估级摘要与来源信息
  • metadata/evaluation.json:机器可读的评估回执与任务结果
  • metadata/publication.json:发布身份信息
  • manifests/43f4ed88b79d9c0abe7a733ac6499b0000364e3f1f676a29320e83d1682e081b.sha256:每个原始产物与源快照的 SHA256

完整性检查

bash sha256sum -c manifests/43f4ed88b79d9c0abe7a733ac6499b0000364e3f1f676a29320e83d1682e081b.sha256

结果包 SHA256 是基于原始评估输出与精确任务快照的规范化清单派生的完整性校验和。

范围

该仓库包含评估证据与结构化结果。它不包含访问令牌、TLS 证书、浏览器缓存或模型权重。权重单独保存在上述链接的检查点仓库中。

配置

  • task-results(默认):data/task-results-*.parquet
  • summary:data/summary-*.parquet
搜集汇总
数据集介绍
Fara-40-baseline-artifact 数据集图片
构建方式
在计算机使用代理(CUA)基准评测领域,可复现的评估证据对于衡量模型真实能力至关重要。该数据集通过系统化流程构建:基于微软Fara1.5-9B模型,在WootzApp CUA Bench的40项任务上执行基线评估,全面采集原始输出,包括逐任务录制、模型输出、日志、评分标准及验证器结果。所有组件均绑定精确版本,最终将产物封装为Parquet格式与完整性校验清单,确保评估链条完整可审计。
特点
该数据集以证据完整性和可复现性为核心特点。其涵盖40项任务中8项通过、24项验证失败、8项执行错误的详细结果,并保留原始日志以供独立审计。数据集提供任务级归一化记录与评估级摘要,附带精确溯源表、基础设施信息及SHA256完整性校验,结构清晰,便于验证与二次分析。
使用方法
研究者可通过HuggingFace数据集库直接加载task-results与summary配置,快速获取结构化评估数据。使用sha256sum命令校验清单以验证数据完整性。如需深入审计,可访问raw目录查阅逐任务录制与日志,或结合source/tasks.jsonl与metadata文件复现评估流程。该数据集适用于分析模型在CUA任务中的表现瓶颈及评估方法可靠性。
背景与挑战
背景概述
近年来,计算机使用代理(Computer-Using Agent, CUA)作为人工智能与图形用户界面交互的前沿范式,其评估的标准化与可复现性日益成为学术界与工业界关注的焦点。Fara-40-baseline-artifact数据集由WootzApp团队于2025年创建,旨在完整保存Fara 1.5 9B模型在WootzApp CUA Bench中40项基线任务的评估工件,涵盖原始日志、模型输出、验证结果及精确溯源信息。该数据集回应了CUA评估中证据链缺失与结果难以审计的核心问题,为后续研究提供了透明、可验证的基准参照,对推动代理评估的规范化具有基础性意义。
当前挑战
在计算机使用代理的评估领域,核心挑战在于任务执行的验证与错误归因:模型输出的正确性常依赖环境状态与多步交互,自动验证器可能产生假阴性,而执行错误与验证失败又需严格区分。构建该数据集时,面临的挑战包括:确保40项任务快照的精确复现与哈希校验,整合浏览器测试框架、记录器与验证器等多组件版本,以及在保留完整原始日志的同时标准化结构化结果。此外,执行错误与验证器失败在分母中的处理方式,亦对通过率指标的可解释性构成挑战,要求审计时兼顾原始日志与规范化数据。
常用场景
经典使用场景
在智能体评测领域,Fara-40-baseline-artifact数据集扮演着可复现基准证据库的角色。其经典用法是围绕WootzApp CUA Bench中的40项计算机使用任务,对Fara 1.5 9B模型进行基线评估,通过保存逐任务录制、模型输出、日志、评分标准和验证器结果,为后续模型能力对比提供标准化参照。研究者常直接加载该数据集的task-results与summary配置,复现通过率、验证器失败率与执行错误率等核心指标,从而在统一任务快照与固定模型修订版本下,建立严格的评测基线。
实际应用
在实际应用层面,该数据集为智能体系统的开发迭代与质量保障提供直接支撑。工程团队可利用其中逐任务记录定位模型在具体操作步骤中的薄弱环节,例如界面元素识别、多步推理或工具调用失败,并据此优化提示策略或环境配置。同时,验证器失败与执行错误的明确分栏,有助于运维人员判断问题源自模型行为还是基础设施,从而在真实部署前完成风险排查。该数据集亦可作为内部回归测试的固定基准,衡量后续模型版本相对基线的实际提升。
衍生相关工作
以该基线评估为起点,相关衍生工作主要围绕模型能力改进与评测体系扩展展开。一方面,Fara 1.5 9B的检查点被单独保存,便于研究者在此基础上进行微调或对比实验,催生针对计算机使用任务的强化学习与数据增强研究。另一方面,WootzApp CUA Bench的任务集与验证器代码共同构成可扩展的评测框架,后续工作可替换任务或引入新模型,形成跨模型、跨任务的比较研究。这些衍生实践共同丰富了智能体评测的公共资源生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务