EdgeBench
收藏资源简介:
EdgeBench是一个包含134个真实世界任务的基准测试数据集,用于评估自主AI代理如何从真实世界环境中学习,它提供可执行的任务环境、现实的多层次反馈,并允许每个任务迭代12小时以上,以跟踪完整的改进轨迹。该仓库公开了51个任务以及完整的评估框架,并分析了约38,000小时的代理交互数据,发现性能遵循对数S形缩放定律。
EdgeBench is a benchmark dataset consisting of 134 real-world tasks to evaluate how autonomous AI Agents learn from real-world environments. It provides executable task environments, realistic multi-level feedback, and allows over 12 hours of iteration per task to track complete improvement trajectories. This repository releases 51 of the tasks along with the complete evaluation framework, analyzes approximately 38,000 hours of agent interaction data, and finds that performance follows a log-Sigmoid scaling law.
数据集概述
基本信息
- 名称: EdgeBench
- 发布方: ByteDance Seed
- 项目主页: edge-bench.org
- 技术报告: PDF
- 数据集下载: HuggingFace
- 评估框架文档: SForge Harness
核心定位
EdgeBench是一个包含 134个真实世界任务 的基准测试,用于评估自主AI代理从真实环境中学习的能力。不同于一次性性能测试,EdgeBench让代理在可执行的任务环境中迭代运行 12小时以上,跟踪其完整的改进轨迹,而非仅看最终得分。
任务组成
- 总任务数: 134个
- 开源任务数: 51个
- 能力类别: 6大类别
- Scientific & ML(科学与机器学习)
- Systems & SE(系统与软件工程)
- Optimization(优化)
- Knowledge(知识)
- Formal(形式化)
- Games(游戏)
- 人类专家平均耗时: 每个任务57.2小时(最高320小时)
关键研究发现
通过对全部134个任务约 38,000小时 的代理交互分析,发现代理性能随交互时间遵循 对数-S形缩放定律(Log-sigmoid scaling law,R² = 0.998)。
排行榜(12小时性能)
完整基准(134个任务)
| 模型 | @12h |
|---|---|
| Claude Opus 4.8 | 51.3 |
| GPT-5.5 | 48.4 |
| GPT-5.4 | 39.3 |
| GLM-5.1 | 37.4 |
| DS-V4-Pro | 31.0 |
开源子集(51个任务)
| 模型 | @12h |
|---|---|
| Claude Opus 4.8 | 43.6 |
| GPT-5.5 | 42.7 |
| GPT-5.4 | 34.3 |
| GLM-5.1 | 30.3 |
| DS-V4-Pro | 25.1 |
评估框架:SForge
EdgeBench使用 SForge 评估框架,其核心机制包括:
- 双容器隔离: 工作环境和判断环境完全分离,防止评估作弊
- 迭代式反馈评估: 代理在运行期间多次提交,接收细粒度反馈(通过率、失败测试、分数),闭环改进,最终得分为所有提交中的最佳结果
- 长周期执行: 支持停止钩子防止过早退出、自动恢复临时故障、Kubernetes后端支持并行运行
许可证
- EdgeBench任务数据集: CC BY 4.0
- SForge评估框架代码: Apache License 2.0
联系
如需评估完整的134个任务套件,请联系:zhongshu@bytedance.com




