遇见数据集

StartupBench

收藏
arXiv2026-08-18 更新2026-08-20 收录
数据链接:
官方服务:

资源简介:

StartupBench是由字节跳动Seed、南京大学等机构联合构建的端到端代理基准测试,旨在评估通用AI代理在真实市场验证工作流中的表现。该数据集包含97个任务,覆盖医疗健康、金融、法律、商业管理、STEM与计算机科学、教育与人文六大学科领域,输出格式涵盖DOCX、XLSX、PPTX等多类型文档。数据构建过程包括调查融资超百万美元的AI初创公司、访谈30余位深度用户获取真实场景,再由50余位领域专家将工作流标准化为可复现的评估实例,并经过多阶段质量控制和难度校准。该基准聚焦于检验AI代理能否可靠完成用户实际委托的端到端工作流,旨在揭示当前通用模型在复杂指令遵循和领域专业知识方面的局限性,为代理系统的实用化进展提供实证度量。

StartupBench is an end-to-end agent benchmark jointly developed by ByteDance Seed, Nanjing University and other institutions, aiming to evaluate the performance of general AI Agents in real-world market validation workflows. This dataset includes 97 tasks covering six major domains: healthcare, finance, law, business management, STEM and computer science, as well as education and humanities, with output formats spanning multiple document types such as DOCX, XLSX, PPTX and others. The dataset construction process involves surveying AI startups with over $1 million in funding, interviewing more than 30 power users to collect real-world scenarios, standardizing the workflows into reproducible evaluation instances by over 50 domain experts, and conducting multi-stage quality control and difficulty calibration. This benchmark focuses on examining whether AI Agents can reliably complete end-to-end workflows entrusted by actual users, aiming to reveal the limitations of current general models in complex instruction following and domain-specific expertise, and provide empirical metrics for the practical advancement of agent systems.

创建时间:
2026-08-18
原始信息汇总

StartupBench 数据集详情

概述

StartupBench 是一个用于评估通用型 AI 智能体在真实市场验证工作流程中表现的数据集。其核心目标是测试前沿智能体能否完成用户已委托给 AI 原生创业产品的实际任务,涵盖专业领域、需要长时间执行的工作,并通过多格式交付物而非孤立短答案进行评判。

数据集规模与结构

  • 任务数量:包含 97 个真实世界的工作流程任务。
  • 领域覆盖:跨越 6 个专业领域,具体分布如下:
    • 医疗与健康(21 个任务)
    • 金融(18 个任务)
    • 商业与管理(19 个任务)
    • 法律(16 个任务)
    • STEM 与计算机科学(16 个任务)
    • 教育与人文(7 个任务)
  • 评估维度:每项任务平均包含 25.3 个评分细则(rubrics),评估标准采用加权评分方式,重点关注交付物是否达到生产级标准。
  • 评估智能体数量:共评估了 9 个前沿智能体模型。

数据构建流程

数据集通过以下四步管道构建,确保任务源于市场需求且难度合理:

  1. 智能体选择:筛选有活跃演示、明确用户群和可部署工作流程场景的受资助产品。
  2. 访谈与任务范围界定:收集目标用户、业务约束、预期输出和参考资料。
  3. 数据生产:构建提示词、工作空间、标准答案交付物、评分细则和带有噪音的真实世界文件。
  4. 质量校准:审查任务清晰度、真实性、歧义性、评分细则有效性和区分难度。

评估方法与结果

  • 评分机制:采用“智能体即裁判”(Agent-as-Judge)框架,将每个提交转化为证据视图,根据细粒度加权标准进行评分,而非表面答案相似度。该框架的人工一致性高达 92%。
  • 性能指标
    • 平均分:最高平均分为 73.67(由 Kimi-k3 获得)。
    • Pass@1(严格标准):在得分 ≥ 90 的严格标准下,最高 pass@1 为 31.27(由 GPT-5.6-sol 获得),表明即使顶尖智能体仍难以完全达到生产就绪标准。
  • 动态排行榜(按平均分排序):
排名 模型 开发机构 平均分 Pass@1 差距(Gap)
1 Kimi-k3 Moonshot AI 73.67 29.55 44.12
2 GPT-5.6-sol OpenAI 73.61 31.27 42.34
3 GPT-5.5 OpenAI 72.79 26.80 45.99
4 Seed-2.1-Pro ByteDance Seed 67.19 22.34 44.85
5 DeepSeek-V4-Pro DeepSeek 61.11 16.49 44.62
6 GLM-5.1 Zhipu AI 60.79 16.49 44.30
7 Kimi-K2.6 Moonshot AI 59.95 13.06 46.89
8 Qwen-3.6-Max Alibaba Qwen 59.46 15.12 44.34
9 Gemini-3.1-Pro Google Gemini 49.73 6.53 43.20

失败模式分析

智能体在真实工作场景中的主要失败点包括:

  • 复杂指令遵循:只能部分满足密集的任务规格,导致请求的文件、章节或约束不完整。
  • 领域专业知识缺失:在金融、法律、医疗和商业工作流中,通用能力无法弥补专业规范知识的不足。
  • 长时程执行困难:多步骤工作流需要规划、检索、工件组装和长上下文一致性。
  • 交付物质量问题:输出可能看似合理,但缺少公式、缓存的电子表格值、引文、幻灯片润色或文件结构。
  • 自验证幻觉:智能体可能声称满足要求,但生成的工件未通过细则级检查。
  • 格式合规性差:真实工作流要求精确的后缀和多文件输出,缺失或格式错误的工件被视为操作失败。

示例任务

  • HR 薪资与人才盘点工作簿(商业与管理 / XLSX):要求构建包含 13 个 sheet 的 Excel 工作簿,包含公式驱动的薪资行、税务计算、人才评审输出、仪表板 KPI、图表和过滤器等,共 34 个评分细则。最佳得分为 1.0000(由 GPT-5.5 获得)。
  • 购物中心运营评审(商业与管理 / XLSX):关注公式、数据透视表和仪表板的差距,最佳得分为 0.8000。
  • 地震断层解释(工程与计算机科学 / DOCX + PNG):评估地学解释的遗漏,最佳得分为 0.3659。

引用信息

数据集相关论文的 BibTeX 引用格式如下:

bibtex @misc{startupbench2026, title = {StartupBench: Benchmarking General-Purpose Agents on Market-Validated Workflows}, year = {2026}, note = {Project page for StartupBench} }

更多资源

  • 论文全文:可通过项目页面访问 PDF。
  • 案例回放:提供详细的智能体轨迹、裁判评分和生成的工件,便于分析失败点。
搜集汇总
数据集介绍
StartupBench 数据集图片
构建方式
StartupBench的构建遵循一条严谨的调研与访谈驱动的多阶段流程。首先,研究者系统筛选获得市场验证的AI原生初创企业,以其融资规模及用户采纳情况作为市场需求的代理指标,锁定具备真实应用场景的智能体产品。继而,对超过30位深度用户进行访谈,捕获其使用情境、任务目标、预期交付物及关键约束。随后,招募逾50位领域专家,将访谈所得场景重构为标准化任务,每个任务以三元组(指令、工作空间、加权评分细则)形式呈现,确保任务既忠实于真实工作流,又具备可复现的评估条件。最后,通过专家交叉验证、试点执行与难度校准等质量控制环节,剔除未能有效区分模型能力的任务,最终形成涵盖六大领域、共计97项任务的高质量基准数据集。
特点
StartupBench的显著特征在于其任务源自市场验证的AI产品工作流,确保了评估内容与真实用户需求的高度契合。该基准强调端到端交付物的生成,每项任务均要求产出可直接用于专业场景的完整体文件,如报告、表格、演示文稿等,而非中间步骤或简化输出。其评估体系采用细粒度、多维度的评分标准,平均每项任务包含25.3条评分细则,覆盖功能性、结构性、格式规范及领域特定要求等多个维度,并依据重要性赋予不同权重,从而实现对复杂工作流完成质量的精准刻画。此外,基准涵盖医疗健康、金融、法律、商业管理等六大领域,任务多样性高,且难度经校准,能够有效区分当前最先进模型的性能差异。
使用方法
使用StartupBench时,研究者需在统一的智能体执行框架下运行待测模型,为每个任务提供预先构建的工作空间和输入查询,并将模型生成的交付物收集至指定输出目录。评估流程采用Agent-as-a-Judge范式,针对每条评分标准启动独立的评估智能体会话,通过检查原始交付物及其提取的文本和图像证据,做出二进制的满足与否判断并附文字说明。最终任务得分通过加权汇总所有评分标准的判定结果获得,成功阈值设定为得分不低于90分。该基准的评估方法已验证与人类专家一致性高达92.78%,且对通用智能体框架的选择具有鲁棒性,因此可作为衡量通用智能体在真实工作流上端到端任务完成能力的可靠标尺。
背景与挑战
背景概述
StartupBench是由字节跳动Seed、南京大学、M-A-P及TokenWave.AI等机构于2026年联合推出的端到端(E2E)智能体基准测试,旨在评估通用人工智能体在真实世界专业工作流程中的执行能力。该基准的核心理念在于,从市场验证的AI原生初创企业产品中提取任务,而非依赖研究者主观设定的任务,以确保评估内容反映用户的真实需求。通过系统调研获得融资且拥有实际用户采纳的AI产品,结合深度用户访谈,收集了覆盖医疗健康、金融、法律、商业管理、STEM及计算机科学、教育与人文六大领域的97项任务。每项任务要求生成完整的多格式交付物,并采用平均25.3条细粒度评分细则进行评估。实验表明,最强模型在严格标准下成功率仅约30%,揭示了当前通用智能体在复杂专业任务上的显著不足,为该领域提供了实证基准。
当前挑战
StartupBench面临的核心挑战在于,当前通用智能体在完成市场验证的真实工作流程时,可靠性和专业标准满足度严重不足。具体挑战包括:1) 复杂指令遵循能力欠缺,模型常满足表面可见要求却忽略关键约束,导致交付物看似完整但无法通过专业验收;2) 领域专业知识局限,尤其在金融、STEM等领域,模型难以满足行业规范、计算精度和事实一致性要求,如法律推理不完整、医疗决策缺乏临床可操作性;3) 自我验证幻觉问题,模型常将执行过程总结误认为交付物已验证,未能独立核查最终产物,导致细微但关键的错误遗漏;4) 构建过程中面临任务来源的现实性、可复现性与评估细粒度之间的平衡,需通过多阶段质量控制和难度校准,确保任务既反映真实需求又具备区分度。
常用场景
经典使用场景
StartupBench作为一项面向端到端智能体工作流评估的基准,其经典使用场景在于对通用型AI代理在真实职业任务中的表现进行系统性度量。该基准从经过市场验证的AI初创企业产品中提取实际工作流,构建了涵盖医疗健康、金融、法律、商业管理、STEM及教育人文学科的97项任务,要求代理生成符合专业标准的多样化交付物,如DOCX、XLSX、PPTX等文件。研究者可借助此基准,在统一的智能体框架下评估模型对复杂指令的理解、跨文档信息整合、领域专业知识应用及长周期任务执行能力,从而深入洞察当前通用代理在实现端到端专业工作流方面的实际水平与局限性。
实际应用
在实际应用层面,StartupBench为人工智能系统在专业办公场景中的落地提供了关键参考。企业可依据该基准评估通用型AI代理在撰写合规文件、编制财务报表、生成法律备忘录、设计教学方案等任务中的表现,判断其交付物是否达到直接可用的专业标准。同时,该基准也凸显了垂直领域专用代理在满足专业标准方面的优势,为AI产品开发者优化模型能力、设计工作流编排策略提供了数据支撑。通过揭示通用代理在核心要求上常出现的关键遗漏,StartupBench帮助实际部署者识别风险环节,从而更审慎地将AI集成至知识密集型工作流程中。
衍生相关工作
StartupBench的提出催生了多项衍生研究方向,推动了智能体评估方法论的演进。其构建流程启发了后续工作探索基于市场采纳证据的任务采集方式,促进了从研究者定义向需求驱动的工作流构建转变。在评估技术上,该基准验证了Agent-as-a-Judge范式的有效性,鼓励了更多关于细粒度交付物评估、复杂文件验证及证据检索机制的研究。此外,其失败模式分析(如复杂指令遵循不足、自我验证幻觉及领域专长欠缺)为改进模型的指令执行忠实度与自我校验能力提供了明确方向,相关结论已被后续研究引用,用于指导新一代基础模型与通用代理系统的设计,旨在弥合专业化系统与通用智能体之间的性能鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务