遇见数据集

WorkSurface-Bench

收藏
arXiv2026-07-28 更新2026-07-30 收录
官方服务:

资源简介:

WorkSurface-Bench是由北京大学、中关村研究院和中国科学院大学联合创建的企业级多表面知识路由基准数据集。该数据集包含1,151个原子任务,源自五个角色限定工作区,并投影到文档、表格和图形三种可路由知识表面,旨在评估智能体在不同知识表示形式间的选择能力。数据集通过确定性规则和可验证的LLM辅助流程构建,所有参考答案均基于执行的DuckDB查询、验证的文本片段或源依赖图注释生成,确保可审计性。该数据集主要应用于企业智能体评估领域,旨在分离并量化表面路由选择与最终答案正确性,以诊断智能体在复杂知识检索与合成任务中的失败环节。

WorkSurface-Bench is an enterprise-grade multi-surface knowledge routing benchmark dataset jointly created by Peking University, Zhongguancun Research Institute, and University of Chinese Academy of Sciences. It contains 1,151 atomic tasks derived from five role-defined workspaces, projected onto three routable knowledge surfaces: documents, tables, and graphs, aiming to evaluate AI Agents' ability to select between different knowledge representation formats. The dataset is constructed via deterministic rules and verifiable LLM-aided workflows. All reference answers are generated based on executed DuckDB queries, verified text snippets or source dependency graph annotations to ensure auditability. Primarily applied in the field of enterprise AI Agent evaluation, this dataset aims to isolate and quantify surface routing choices and final answer correctness, so as to diagnose the failure points of AI Agents in complex knowledge retrieval and synthesis tasks.

创建时间:
2026-07-28
原始信息汇总

WorkSurface-Bench 数据集概述

  • 数据集名称: WorkSurface-Bench
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 任务类别: 问答(question-answering)
  • 标签: agents, benchmark, RAG, tables, knowledge-graphs, tool-use
  • 数据集大小: 1,000 — 10,000 条

核心内容

WorkSurface-Bench 是一个用于评估企业智能体在多源信息检索场景下能力的基准测试。它测试智能体是否能够跨文档检索(RAG)、结构化表格和依赖图进行路由,获取正确证据并生成正确答案。

数据集规模与构成

  • 原子任务: 1,151 个,衍生自 100 个 Workspace-Bench-Lite 源任务
  • 工作区: 5 个基于人物角色的工作区
  • 任务类型分布:
    • 跨表面任务:488 个
    • 仅表格任务:279 个
    • 仅 RAG 任务:213 个
    • 仅图任务:171 个
  • 跨表面组合:
    • RAG + 图:314 个
    • 图 + 表格:100 个
    • RAG + 表格:59 个
    • RAG + 图 + 表格:15 个
  • 保留轨迹: 27,624 条(4 个模型 × 6 种设置 × 1,151 个任务,无协议错误)
  • 人工审核: 3 位标注员对 200 个分层抽样任务进行审核,全部通过六项标准,其中 192 个任务一致通过

数据文件与配置

数据集提供三个配置:

  • tasks: 测试集,包含所有任务数据(Parquet/JSONL 格式)
  • scores: 测试集,包含归一化轨迹评分
  • human_audit: 测试集,包含人工审核的多数投票结果

仓库结构

  • data/: 可视化的 Parquet 文件和完整任务 JSONL
  • resources/profiles/: 规范的 KB 文档、表格 Parquet 文件和图
  • resources/skills/: 基准测试使用的技能元数据
  • schema/: 任务 JSON Schema
  • trajectories/: 24 个官方运行的原始模型轨迹
  • results/: 归一化轨迹评分和完整评分报告
  • audits/: 匿名化人工投票、多数结果和分歧记录
  • release_manifest.json: 机器可读的计数和运行摘要

评估设置

六种评估设置:

  • S1 — 闭卷: 无知识表面工具
  • S2 — 仅 RAG: 仅暴露文档检索表面
  • S3 — 单表面路由: 模型在回答前选择一个表面
  • S4 — 所有工具: 向 ReAct 智能体暴露 RAG、表格和图工具
  • S5 — 黄金约束: 提供黄金表面标签,仅暴露所需表面工具
  • S6 — 黄金提示/所有: 提供黄金表面标签,同时暴露所有表面工具

总体评分公式: 0.35 * 答案得分 + 0.30 * 证据得分 + 0.25 * 路由得分 + 0.10 * 效率得分

人工评估

200 个任务的样本按表面组合分层:30 个图、40 个表格、30 个 RAG、25 个图+表格、35 个 RAG+图、25 个 RAG+表格、15 个三表面任务。标注员独立评估:问题自然性、证据可回答性、表面必要性、黄金答案正确性、原子性和表面泄漏。

数据来源与限制

WorkSurface-Bench 将英语 Workspace-Bench-Lite 版本投影到规范的文档、表格和图表面。任务场景和依赖标注由人工策划,工作区文件结合公共资源和生成产物。1,151 个基准项是原子衍生任务,而非 1,151 个独立源工作区。分布不均在 release_manifest.json 和论文中有说明,尤其是仅有 15 个任务需要所有三个表面。

该基准仅用于评估,不适用于训练或安全关键部署决策。

代码与引用

搜集汇总
数据集介绍
WorkSurface-Bench 数据集图片
构建方式
WorkSurface-Bench 的构建源于一个严谨且可验证的流水线,其基础源自 Workspace-Bench-Lite 英语语料库。首先,通过冻结源提交与文件哈希确保输入的可复现性。随后,将每个角色工作空间投射至三个可路由的知识表面:文档知识库转换为 UTF-8 标记文本,表格数据注册为 DuckDB 视图,文件依赖图则通过程序化边(如提及、模式重叠)进行丰富。原子任务经由两条路径派生:确定性规则直接从源工件(如数值评分、文件依赖)提取金标答案;可验证的 LLM 辅助策略则要求模型提出附带证明工件的问题,如表格查询的执行结果、文档中的精确文本跨度,或图路径的源注释,凡查询错误或缺失跨度者均被剔除。最终,通过 GPT-5.5、DeepSeek 与 Gemini 三模型严格筛选及人工审计,保留 1,151 项任务,每项任务的金标答案均可通过执行 SQL、核对跨度或验证图路径复现。
特点
该数据集的核心特质在于将知识表面路由与答案正确性解耦为独立评分维度,这是其区别于现有基准的显著创新。其构建了三个原生知识表面——文档、表格与依赖图,每个表面均配备专属工具接口(如只读 DuckDB 查询、图遍历),而非简单转换为统一检索格式。每项任务获得四维评分:Route F1 衡量所选表面集与所需表面集的一致性,Evidence 评估工件层面的访问完整性,Answer 依赖类型匹配(如数值容忍 5% 误差、列表无序集合 F1)而非模型生成文本,Efficiency 则基于令牌预算刻画计算效率。这种多维分解使得系统失败点得以精准定位:低 Route 指向表面选择失误,高 Route 伴低 Evidence 揭示证据获取障碍,而高 Route 与 Evidence 下的低 Answer 则凸显下游推理或计算缺陷。此外,所有金标答案均可追溯至确定性执行或源注释,无需依赖模型自由文本,确保了评估的透明与可复现。
使用方法
WorkSurface-Bench 的使用围绕其提供的标准化 Agent 框架与评分协议展开。研究者可加载公开的 Python Agent 工具集,该工具集为每个表面封装了检索、查询与遍历操作,并基于 ReAct 循环在最多八步内完成交互。评估时,需针对每项任务提交 Agent 的最终答案与完整工具调用轨迹。评分脚本自动计算四维指标:通过比对轨迹中实际使用的表面与任务所需表面得到 Route F1,通过匹配工件级证据(如文档文件是否被读取、视图是否被查询、图节点是否被返回)获得 Evidence 分数,Answer 分数依答案类型采用精确匹配、集合 F1 或相对误差容忍判定,Efficiency 则基于令牌消耗与预设预算的比值线性计算。数据集支持六种 Agent 设置(如无工具基线、全表面自由路由、金标表面约束),便于研究者分离路由信息与工具限制的影响。所有 1,151 项任务的金标答案均附有可执行的证明工件(SQL 查询、文档跨度、图路径),确保评估过程的可复现性与审计性。
背景与挑战
背景概述
在当代企业级人工智能代理的研究版图中,如何高效地从异构知识源中获取并整合信息已成为核心议题。2026年7月,由北京大学、中关村学院及中国科学院大学的研究团队联合发布了WorkSurface-Bench数据集,旨在系统评估企业代理在文档、表格与依赖图谱三种知识曲面间的路由选择能力。该数据集的创建源于一个关键洞察:现有基准大多聚焦于检索或工具使用的端到端性能,却忽视了代理在问题求解前需先判断知识表征形式这一前置决策。WorkSurface-Bench通过将五个角色限定的工作空间投影至三种可路由曲面,构建了包含1,151个原子任务的评测体系,其参考答案全部经由可执行查询、文档跨度验证或图源注释生成,开创性地将曲面选择与答案正确性分离评分,为相关领域提供了可复现的诊断工具。
当前挑战
WorkSurface-Bench直面企业级知识路由的核心难题:代理必须同时处理文档叙事事实、表格数值计算与文件依赖关系三种异构知识,而现有基准无法区分‘选择正确曲面’与‘正确使用曲面’这两个独立能力维度。在构建过程中,研究团队面临将复杂的工作空间语义投影为可查询曲面、确保金标准答案的可审计性、以及设计严格的筛选流程以剔除泄漏线索等挑战。具体而言,需从原始数据中分离出493篇文档、207个可查询表视图与1,438条图边,并通过确定性规则与可验证的LLM辅助提议生成原子任务,最终经过三类模型自动筛查与三人独立人工审计,从2,000个候选任务中筛选出1,151个通过严格标准的任务。评估结果表明,即使路由F1达到98.7–99.8%,答案正确率仍仅56.1–75.3%,揭示了路由与推理之间存在显著鸿沟。
常用场景
经典使用场景
WorkSurface-Bench作为一项面向企业级智能体的基准测试,其核心经典使用场景在于评估智能体在面对异构知识源时的知识路由能力。在真实的商业运营中,一个智能体需要同时处理文档中的叙事性事实、表格中的计算性数据以及依赖图谱中的文件关联关系。该基准通过将企业工作空间投影到文档、表格和图谱三种知识表面上,精心设计了1151个原子任务,用以衡量智能体能否根据问题的内在需求,自主判断并优先选择正确的知识表示形式,进而完成信息的精准检索与综合推理。
解决学术问题
该数据集精准回应了当前学术研究中长期存在的一个盲区:现有的检索增强生成(RAG)基准和工具使用基准往往只关注最终答案的正确性或API的选择,却未能系统性地分离和评估智能体在“选择正确知识形式”与“正确使用该知识”这两个本质不同的能力维度。WorkSurface-Bench通过引入路由(Route)与答案(Answer)的双轨评分机制,首次将知识表面的选择决策从端到端的性能中剥离出来,使研究者能够精准诊断智能体失败的根本原因——是路径选择失当,还是后续的检索、计算或合成环节出现了偏差。
衍生相关工作
围绕WorkSurface-Bench所揭示的核心问题,一系列衍生工作正在或有望展开。该基准直接推动了关于“路由与回答解耦”的深入探讨,激励研究者开发更精细的诊断工具和模块化智能体架构。例如,基于其评分协议,后续工作可以探索在提示工程中融入“表面提示”来改善智能体的路由准确性,或者研究如何通过移除无关工具来提升效率而避免损害答案质量。此外,WorkSurface-Bench也为跨文档、表格和知识图谱的混合检索基准(如mmRAG)提供了参照,推动了多源信息检索领域从单一指标评估向多维能力诊断的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务