WorkSurface-Bench
收藏资源简介:
WorkSurface-Bench是由北京大学、中关村研究院和中国科学院大学联合创建的企业级多表面知识路由基准数据集。该数据集包含1,151个原子任务,源自五个角色限定工作区,并投影到文档、表格和图形三种可路由知识表面,旨在评估智能体在不同知识表示形式间的选择能力。数据集通过确定性规则和可验证的LLM辅助流程构建,所有参考答案均基于执行的DuckDB查询、验证的文本片段或源依赖图注释生成,确保可审计性。该数据集主要应用于企业智能体评估领域,旨在分离并量化表面路由选择与最终答案正确性,以诊断智能体在复杂知识检索与合成任务中的失败环节。
WorkSurface-Bench is an enterprise-grade multi-surface knowledge routing benchmark dataset jointly created by Peking University, Zhongguancun Research Institute, and University of Chinese Academy of Sciences. It contains 1,151 atomic tasks derived from five role-defined workspaces, projected onto three routable knowledge surfaces: documents, tables, and graphs, aiming to evaluate AI Agents' ability to select between different knowledge representation formats. The dataset is constructed via deterministic rules and verifiable LLM-aided workflows. All reference answers are generated based on executed DuckDB queries, verified text snippets or source dependency graph annotations to ensure auditability. Primarily applied in the field of enterprise AI Agent evaluation, this dataset aims to isolate and quantify surface routing choices and final answer correctness, so as to diagnose the failure points of AI Agents in complex knowledge retrieval and synthesis tasks.
WorkSurface-Bench 数据集概述
- 数据集名称: WorkSurface-Bench
- 许可证: CC-BY-4.0
- 语言: 英语
- 任务类别: 问答(question-answering)
- 标签: agents, benchmark, RAG, tables, knowledge-graphs, tool-use
- 数据集大小: 1,000 — 10,000 条
核心内容
WorkSurface-Bench 是一个用于评估企业智能体在多源信息检索场景下能力的基准测试。它测试智能体是否能够跨文档检索(RAG)、结构化表格和依赖图进行路由,获取正确证据并生成正确答案。
数据集规模与构成
- 原子任务: 1,151 个,衍生自 100 个 Workspace-Bench-Lite 源任务
- 工作区: 5 个基于人物角色的工作区
- 任务类型分布:
- 跨表面任务:488 个
- 仅表格任务:279 个
- 仅 RAG 任务:213 个
- 仅图任务:171 个
- 跨表面组合:
- RAG + 图:314 个
- 图 + 表格:100 个
- RAG + 表格:59 个
- RAG + 图 + 表格:15 个
- 保留轨迹: 27,624 条(4 个模型 × 6 种设置 × 1,151 个任务,无协议错误)
- 人工审核: 3 位标注员对 200 个分层抽样任务进行审核,全部通过六项标准,其中 192 个任务一致通过
数据文件与配置
数据集提供三个配置:
- tasks: 测试集,包含所有任务数据(Parquet/JSONL 格式)
- scores: 测试集,包含归一化轨迹评分
- human_audit: 测试集,包含人工审核的多数投票结果
仓库结构
data/: 可视化的 Parquet 文件和完整任务 JSONLresources/profiles/: 规范的 KB 文档、表格 Parquet 文件和图resources/skills/: 基准测试使用的技能元数据schema/: 任务 JSON Schematrajectories/: 24 个官方运行的原始模型轨迹results/: 归一化轨迹评分和完整评分报告audits/: 匿名化人工投票、多数结果和分歧记录release_manifest.json: 机器可读的计数和运行摘要
评估设置
六种评估设置:
- S1 — 闭卷: 无知识表面工具
- S2 — 仅 RAG: 仅暴露文档检索表面
- S3 — 单表面路由: 模型在回答前选择一个表面
- S4 — 所有工具: 向 ReAct 智能体暴露 RAG、表格和图工具
- S5 — 黄金约束: 提供黄金表面标签,仅暴露所需表面工具
- S6 — 黄金提示/所有: 提供黄金表面标签,同时暴露所有表面工具
总体评分公式: 0.35 * 答案得分 + 0.30 * 证据得分 + 0.25 * 路由得分 + 0.10 * 效率得分
人工评估
200 个任务的样本按表面组合分层:30 个图、40 个表格、30 个 RAG、25 个图+表格、35 个 RAG+图、25 个 RAG+表格、15 个三表面任务。标注员独立评估:问题自然性、证据可回答性、表面必要性、黄金答案正确性、原子性和表面泄漏。
数据来源与限制
WorkSurface-Bench 将英语 Workspace-Bench-Lite 版本投影到规范的文档、表格和图表面。任务场景和依赖标注由人工策划,工作区文件结合公共资源和生成产物。1,151 个基准项是原子衍生任务,而非 1,151 个独立源工作区。分布不均在 release_manifest.json 和论文中有说明,尤其是仅有 15 个任务需要所有三个表面。
该基准仅用于评估,不适用于训练或安全关键部署决策。
代码与引用




