StartupBench
收藏资源简介:
StartupBench是由字节跳动Seed、南京大学等机构联合构建的端到端代理基准测试,旨在评估通用AI代理在真实市场验证工作流中的表现。该数据集包含97个任务,覆盖医疗健康、金融、法律、商业管理、STEM与计算机科学、教育与人文六大学科领域,输出格式涵盖DOCX、XLSX、PPTX等多类型文档。数据构建过程包括调查融资超百万美元的AI初创公司、访谈30余位深度用户获取真实场景,再由50余位领域专家将工作流标准化为可复现的评估实例,并经过多阶段质量控制和难度校准。该基准聚焦于检验AI代理能否可靠完成用户实际委托的端到端工作流,旨在揭示当前通用模型在复杂指令遵循和领域专业知识方面的局限性,为代理系统的实用化进展提供实证度量。
StartupBench is an end-to-end agent benchmark jointly developed by ByteDance Seed, Nanjing University and other institutions, aiming to evaluate the performance of general AI Agents in real-world market validation workflows. This dataset includes 97 tasks covering six major domains: healthcare, finance, law, business management, STEM and computer science, as well as education and humanities, with output formats spanning multiple document types such as DOCX, XLSX, PPTX and others. The dataset construction process involves surveying AI startups with over $1 million in funding, interviewing more than 30 power users to collect real-world scenarios, standardizing the workflows into reproducible evaluation instances by over 50 domain experts, and conducting multi-stage quality control and difficulty calibration. This benchmark focuses on examining whether AI Agents can reliably complete end-to-end workflows entrusted by actual users, aiming to reveal the limitations of current general models in complex instruction following and domain-specific expertise, and provide empirical metrics for the practical advancement of agent systems.
StartupBench 数据集详情
概述
StartupBench 是一个用于评估通用型 AI 智能体在真实市场验证工作流程中表现的数据集。其核心目标是测试前沿智能体能否完成用户已委托给 AI 原生创业产品的实际任务,涵盖专业领域、需要长时间执行的工作,并通过多格式交付物而非孤立短答案进行评判。
数据集规模与结构
- 任务数量:包含 97 个真实世界的工作流程任务。
- 领域覆盖:跨越 6 个专业领域,具体分布如下:
- 医疗与健康(21 个任务)
- 金融(18 个任务)
- 商业与管理(19 个任务)
- 法律(16 个任务)
- STEM 与计算机科学(16 个任务)
- 教育与人文(7 个任务)
- 评估维度:每项任务平均包含 25.3 个评分细则(rubrics),评估标准采用加权评分方式,重点关注交付物是否达到生产级标准。
- 评估智能体数量:共评估了 9 个前沿智能体模型。
数据构建流程
数据集通过以下四步管道构建,确保任务源于市场需求且难度合理:
- 智能体选择:筛选有活跃演示、明确用户群和可部署工作流程场景的受资助产品。
- 访谈与任务范围界定:收集目标用户、业务约束、预期输出和参考资料。
- 数据生产:构建提示词、工作空间、标准答案交付物、评分细则和带有噪音的真实世界文件。
- 质量校准:审查任务清晰度、真实性、歧义性、评分细则有效性和区分难度。
评估方法与结果
- 评分机制:采用“智能体即裁判”(Agent-as-Judge)框架,将每个提交转化为证据视图,根据细粒度加权标准进行评分,而非表面答案相似度。该框架的人工一致性高达 92%。
- 性能指标:
- 平均分:最高平均分为 73.67(由 Kimi-k3 获得)。
- Pass@1(严格标准):在得分 ≥ 90 的严格标准下,最高 pass@1 为 31.27(由 GPT-5.6-sol 获得),表明即使顶尖智能体仍难以完全达到生产就绪标准。
- 动态排行榜(按平均分排序):
| 排名 | 模型 | 开发机构 | 平均分 | Pass@1 | 差距(Gap) |
|---|---|---|---|---|---|
| 1 | Kimi-k3 | Moonshot AI | 73.67 | 29.55 | 44.12 |
| 2 | GPT-5.6-sol | OpenAI | 73.61 | 31.27 | 42.34 |
| 3 | GPT-5.5 | OpenAI | 72.79 | 26.80 | 45.99 |
| 4 | Seed-2.1-Pro | ByteDance Seed | 67.19 | 22.34 | 44.85 |
| 5 | DeepSeek-V4-Pro | DeepSeek | 61.11 | 16.49 | 44.62 |
| 6 | GLM-5.1 | Zhipu AI | 60.79 | 16.49 | 44.30 |
| 7 | Kimi-K2.6 | Moonshot AI | 59.95 | 13.06 | 46.89 |
| 8 | Qwen-3.6-Max | Alibaba Qwen | 59.46 | 15.12 | 44.34 |
| 9 | Gemini-3.1-Pro | Google Gemini | 49.73 | 6.53 | 43.20 |
失败模式分析
智能体在真实工作场景中的主要失败点包括:
- 复杂指令遵循:只能部分满足密集的任务规格,导致请求的文件、章节或约束不完整。
- 领域专业知识缺失:在金融、法律、医疗和商业工作流中,通用能力无法弥补专业规范知识的不足。
- 长时程执行困难:多步骤工作流需要规划、检索、工件组装和长上下文一致性。
- 交付物质量问题:输出可能看似合理,但缺少公式、缓存的电子表格值、引文、幻灯片润色或文件结构。
- 自验证幻觉:智能体可能声称满足要求,但生成的工件未通过细则级检查。
- 格式合规性差:真实工作流要求精确的后缀和多文件输出,缺失或格式错误的工件被视为操作失败。
示例任务
- HR 薪资与人才盘点工作簿(商业与管理 / XLSX):要求构建包含 13 个 sheet 的 Excel 工作簿,包含公式驱动的薪资行、税务计算、人才评审输出、仪表板 KPI、图表和过滤器等,共 34 个评分细则。最佳得分为 1.0000(由 GPT-5.5 获得)。
- 购物中心运营评审(商业与管理 / XLSX):关注公式、数据透视表和仪表板的差距,最佳得分为 0.8000。
- 地震断层解释(工程与计算机科学 / DOCX + PNG):评估地学解释的遗漏,最佳得分为 0.3659。
引用信息
数据集相关论文的 BibTeX 引用格式如下:
bibtex @misc{startupbench2026, title = {StartupBench: Benchmarking General-Purpose Agents on Market-Validated Workflows}, year = {2026}, note = {Project page for StartupBench} }
更多资源
- 论文全文:可通过项目页面访问 PDF。
- 案例回放:提供详细的智能体轨迹、裁判评分和生成的工件,便于分析失败点。




