遇见数据集

WorkSurface-Bench

收藏
github2026-07-27 更新2026-07-29 收录
官方服务:

资源简介:

WorkSurface-Bench是一个用于评估企业代理在多表面知识路由任务上的基准数据集,包含1,151个原子任务,源自100个Workspace-Bench-Lite源任务。它涵盖RAG、表格、图及其交叉表面组合,并评估路由、证据、答案、效率和聚合得分。数据集提供了4个骨干模型×6个代理设置下的27,624个轨迹,以及基于200个任务样本的人工审计结果。

WorkSurface-Bench is a benchmark dataset for evaluating enterprise agents on multi-surface knowledge routing tasks. It comprises 1,151 atomic tasks derived from 100 source tasks of Workspace-Bench-Lite. The dataset covers RAG, tabular, graph, and their cross-surface combinations, and evaluates metrics including routing, evidence, answer, efficiency, and aggregation scores. A total of 27,624 trajectories under 4 backbone models × 6 agent settings are provided, along with manual audit results based on 200 task samples.

创建时间:
2026-07-09
原始信息汇总

WorkSurface-Bench 数据集概述

WorkSurface-Bench 是一个用于评估企业智能体在多面知识路由(multi-surface knowledge routing)能力上的基准测试。它主要考察智能体能否从文档检索(RAG)、结构化表格(Table)和依赖关系图(Graph)这三种企业知识面中,选择并组合正确的知识源,并最终完成证据获取与答案生成。

核心数据与规模

  • 任务数量:包含 1,151 个原子任务,这些任务源自 100 个 Workspace-Bench-Lite 的源任务。
  • 知识面类型:RAG、Table、Graph,以及跨面组合。
  • 评估维度:路由(Route)、证据(Evidence)、答案(Answer)、效率(Efficiency)以及综合评分(Aggregate)。
  • 实验规模:使用 4 种骨干模型 × 6 种智能体设置,共计 27,624 条公开轨迹
  • 人工审计:由 3 名标注员200 个分层抽样任务 进行了人工审计。

数据访问

数据集和官方轨迹文件可以通过以下链接获取:

基准测试结构

数据集仓库的结构如下:

  • worksurface/:知识面构建、任务推导与质量控制
  • scoring/:路由、证据、答案、效率及安全评分器
  • runner/:工具环境与 S1–S6 智能体框架
  • results/:分析与发布构建脚本
  • scripts/:源代码下载、来源锁定、预算管理及 Hugging Face 发布构建
  • schemas/:基准测试任务的 JSON Schema
  • assets/:README 中使用的图表
  • docs/:公开的数据来源文档

智能体设置

该基准测试定义了六种智能体设置(S1–S6),用于隔离不同能力的影响:

ID 设置名称 目的
S1 Closed book 无任何知识面工具
S2 Always RAG 仅使用文档检索
S3 Single-surface router 在回答前选择单一知识面
S4 ReAct all-tools 探索所有 RAG、Table 和 Graph 工具
S5 Gold-constrained 仅暴露所需工具的黄金标签
S6 Gold-hint/all 黄金标签提示,且所有工具可用

评分体系

每个任务会从路由、证据、答案和效率四个维度分别评分。综合评分(Aggregate)的计算公式如下:

text Aggregate = 0.35 Answer + 0.30 Evidence + 0.25 Route F1 + 0.10 Efficiency

数据来源与许可

  • 数据来源:数据集基于 Workspace-Bench-Lite 英文版,将其原始工作空间投影到规范的文档、表格和图表知识面上。
  • 许可证:仓库代码遵循 Apache License 2.0,衍生基准数据遵循 CC BY 4.0,并受 Workspace-Bench-Lite 的归属和许可要求约束。
搜集汇总
数据集介绍
WorkSurface-Bench 数据集图片
构建方式
WorkSurface-Bench的构建始于对Workspace-Bench-Lite中100个源任务的深度解析,将其转化为规范化的文档检索、结构化表格与依赖图三类知识表征。随后,从每个源任务衍生出原子化子任务,并为每项子任务明确标注所需的知识表面类型、黄金证据及预期答案。整个流程经过确定性校验、多模型筛选及人工审计三重质量控制,最终精选出1,151个具备可回答性、正确性、自然性与表面必要性的任务,形成最终的评测数据集。
特点
该基准的显著特征在于其对多表面知识路由能力的精细化评估。每个任务明确关联一种或多种知识表面(RAG、表格、依赖图),使得代理的路由决策、证据获取与答案合成三个阶段可被独立度量,从而精准定位失败的根源。数据集覆盖了单一表面及跨表面组合的丰富场景,并引入了路由F1、证据、答案、效率及聚合分数等多维度评价指标,为深入分析多表面信息融合的挑战提供了系统性的评测框架。
使用方法
使用WorkSurface-Bench时,研究者可通过Hugging Face datasets库直接加载任务、评分结果及人工审计数据。为运行完整的工具环境,需下载Hugging Face仓库的快照以获取规范的资源文件。评测通过调用基准提供的实验框架进行,支持多种代理设置,包括封闭书、仅RAG、单表面路由、ReAct全工具及黄金标签约束等模式。研究者可运行预设的评分脚本来评估自己的代理轨迹,或使用内置的基线模型进行对比实验。
背景与挑战
背景概述
随着企业级知识管理系统的日益复杂,智能体(Agent)需要在多元知识表面对信息进行精准路由与整合。WorkSurface-Bench于2025年由北京大学研究团队主导创建,旨在系统性地评估智能体在多表面知识路由任务中的表现。该基准涵盖1,151个原子任务,源自100个Workspace-Bench-Lite源任务,涉及文档检索(RAG)、结构化表格与依赖图三种知识表面及其交叉组合。通过引入分阶段评估框架——路由、证据获取、答案合成与效率——WorkSurface-Bench突破了传统单一维度的评测范式,为多表面知识密集型场景下的智能体能力量化提供了高参考价值的标尺,推动了企业级知识助手研究向可解释、可诊断的方向演进。
当前挑战
WorkSurface-Bench所解决的领域核心挑战在于,智能体在面对异构知识表面时,须自主决策应调用哪些表面、如何获取有效证据并生成准确答案,这一过程涉及路由规划与多源异构信息的动态整合。另一方面,基准构建过程本身亦面临显著挑战:如何从混合了公共资源与人工生成的复杂工作空间文件中,提取出规范的文档、表格与图结构表面;如何确保衍生任务的可回答性、正确性、自然性与表面必要性,而非追求均匀配额;以及如何通过确定性验证、多模型筛选与人工审核的三重质控机制,过滤掉冗余或误导性样本。最终1,151个任务的确立,是在严格的质量标准与有限的源任务基础上,通过精细化的表面转换与任务衍生管线实现的平衡结果。
常用场景
经典使用场景
WorkSurface-Bench专注于评估企业级智能体在多知识面路由中的决策能力,其经典使用场景在于模拟企业办公环境中智能体需要同时整合文档检索(RAG)、结构化表格与依赖关系图等异构知识源的任务。研究者通过将复杂工作空间拆解为1,151个原子化任务,要求智能体首先判断应激活哪些知识面,再依次执行证据获取与答案合成。该基准尤其注重区分路由失败、证据获取失败与答案合成失败三类错误来源,为深入剖析智能体在企业知识路由中的薄弱环节提供了标准化范式。
衍生相关工作
WorkSurface-Bench衍生了一系列专注于知识路由与智能体评估的前沿工作。官方开源了包含4种基座模型、6种agent设置共27,624条完整测试轨迹,为后续研究提供了丰富的对比分析素材。研究者基于该基准进一步探索了智能体在受限路由策略下的决策行为,例如S5(金标签约束)与S6(金标签提示)两种设置的对比实验揭示了显式知识面信息对路由与答案质量的解耦影响。此外,基于Claude Agent SDK的无约束基线实验为评测工业级智能体方案提供了可复用的对比框架。
数据集最近研究
最新研究方向
当前企业级智能体研究正经历从单一知识源检索向多源知识路由决策的范式跃迁。WorkSurface-Bench精准回应了这一前沿需求,开创性地构建了文档检索、结构化表格与依赖图三种企业知识表面的协同路由基准。该基准通过1,151个原子任务与27,624条轨迹数据,将智能体的路由、证据获取与答案生成能力进行解耦评估,揭示了即使配备黄金路由提示,模型在证据执行与答案综合环节仍存在显著瓶颈。这一精细化的评估框架不仅为多表面知识路由这一热点方向提供了标准化测试平台,更推动了企业知识检索增强生成(RAG)系统从简单工具调用向智能表面选择与跨模态证据融合的进化,对构建可审计、高鲁棒性的企业级智能体具有里程碑式的参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务