EdgeBench
收藏资源简介:
EdgeBench是一个用于评估自主AI代理如何从真实世界环境中学习的基准数据集。它包含134个真实世界任务,覆盖六个能力类别:科学与机器学习、系统与软件工程、优化、知识、形式化与游戏。与传统的单次性能评估不同,EdgeBench将代理置于可执行的任务环境中,提供现实的多层次反馈,允许每个任务迭代12小时以上,从而追踪完整的改进轨迹而非最终得分。数据集公开了51个任务以及完整的评估框架。分析基于约38,000小时的代理交互,发现性能随交互时间遵循对数S型缩放定律。每个任务均设计为日尺度挑战,具有足够高的性能上限,当前尚无代理能完全达到。人类专家完成这些任务的平均努力为57.2小时。该数据集适用于评估AI代理在复杂、长期、真实世界场景中的学习与适应能力。
EdgeBench is a benchmark dataset for evaluating how autonomous AI agents learn from real-world environments. It contains 134 real-world tasks spanning six capability categories: Science & ML, Systems & Software Engineering, Optimization, Knowledge, Formalization, and Games. Unlike traditional one-shot performance evaluations, EdgeBench places agents in executable task environments, provides realistic multi-level feedback, allows over 12 hours of iteration per task, and tracks full improvement trajectories rather than final scores. The dataset releases 51 tasks along with a complete evaluation framework. Analysis based on approximately 38,000 hours of agent interactions reveals that performance follows a log-sigmoid scaling law with interaction time. Each task is designed as a day-scale challenge with a sufficiently high performance ceiling, which no current agent can fully achieve. Human experts require an average effort of 57.2 hours to complete these tasks. This dataset is suitable for evaluating AI agents learning and adaptation capabilities in complex, long-term, real-world scenarios.
数据集概述
EdgeBench 是一个用于评估自主 AI Agent 从真实环境中学习能力的基准测试,包含 134 个真实世界任务。该基准由 ByteDance Seed 团队构建,并公开发布了其中 51 个任务及完整的评估框架。
核心特性
- 评估方式:不同于一次性性能测试,EdgeBench 将 Agent 置于可执行的任务环境中,提供多层级的现实反馈,允许 Agent 在每个任务上迭代 12 小时以上,追踪其整个改进轨迹。
- 规模:记录了约 38,000 小时的 Agent 交互数据。
- 关键发现:Agent 的性能遵循以交互时间为变量的 对数-sigmoid 缩放定律 (R² = 0.998)。
任务分类
EdgeBench 的 134 个任务涵盖了 6 大能力类别:
- 科学与机器学习 (Scientific & ML)
- 系统与软件工程 (Systems & SE)
- 优化 (Optimization)
- 知识 (Knowledge)
- 形式化 (Formal)
- 游戏 (Games)
每项任务都被设计为“日级”挑战,性能上限很高,当前没有 Agent 能完全达到满分。记录的人类专家平均努力时间为 57.2 小时/任务(最高可达 320 小时)。
排行榜 (Leaderboard)
数据集提供了两个版本的排行榜:完整基准(134 个任务) 和 开源子集(51 个任务)。以下展示完整基准的结果。
完整基准 (134 个任务) - 总得分
| 模型 | @2h | @4h | @6h | @8h | @10h | @12h |
|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 39.0 | 45.7 | 48.1 | 49.8 | 50.9 | 51.3 |
| GPT-5.5 | 36.8 | 42.1 | 44.5 | 46.3 | 47.6 | 48.4 |
| GPT-5.4 | 29.7 | 34.0 | 36.5 | 38.0 | 38.9 | 39.3 |
| GLM-5.1 | 26.0 | 30.4 | 32.9 | 34.9 | 36.5 | 37.4 |
| DS-V4-Pro | 23.3 | 27.1 | 29.0 | 29.9 | 30.9 | 31.0 |
完整基准 (134 个任务) - @12h 各类别得分
| 模型 | 科学与机器学习 | 系统与软件工程 | 优化 | 知识 | 形式化 | 游戏 |
|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 48.5 | 67.4 | 36.5 | 47.0 | 55.0 | 39.3 |
| GPT-5.5 | 44.3 | 65.0 | 33.6 | 45.7 | 50.0 | 39.1 |
| GPT-5.4 | 33.5 | 54.1 | 27.9 | 38.8 | 40.8 | 29.0 |
| GLM-5.1 | 33.8 | 50.9 | 26.4 | 43.5 | 24.6 | 29.3 |
| DS-V4-Pro | 30.0 | 43.0 | 21.5 | 37.0 | 14.1 | 16.9 |
评估框架
EdgeBench 由 SForge 提供支持。SForge 是一个双容器评估框架,专为长时间跨度的 Agent 评估而设计。
许可协议
EdgeBench 任务数据集采用 CC BY 4.0 许可协议发布。
联系
如需在完整的 134 个任务套件上进行评估,请联系 zhongshu@bytedance.com。




