遇见数据集

EdgeBench

收藏
github2026-07-02 更新2026-07-04 收录
官方服务:

资源简介:

EdgeBench是一个包含134个真实世界任务的基准测试数据集,用于评估自主AI代理如何从真实世界环境中学习,它提供可执行的任务环境、现实的多层次反馈,并允许每个任务迭代12小时以上,以跟踪完整的改进轨迹。该仓库公开了51个任务以及完整的评估框架,并分析了约38,000小时的代理交互数据,发现性能遵循对数S形缩放定律。

EdgeBench is a benchmark dataset consisting of 134 real-world tasks to evaluate how autonomous AI Agents learn from real-world environments. It provides executable task environments, realistic multi-level feedback, and allows over 12 hours of iteration per task to track complete improvement trajectories. This repository releases 51 of the tasks along with the complete evaluation framework, analyzes approximately 38,000 hours of agent interaction data, and finds that performance follows a log-Sigmoid scaling law.

创建时间:
2026-06-23
原始信息汇总

数据集概述

基本信息

核心定位

EdgeBench是一个包含 134个真实世界任务 的基准测试,用于评估自主AI代理从真实环境中学习的能力。不同于一次性性能测试,EdgeBench让代理在可执行的任务环境中迭代运行 12小时以上,跟踪其完整的改进轨迹,而非仅看最终得分。

任务组成

  • 总任务数: 134个
  • 开源任务数: 51个
  • 能力类别: 6大类别
    • Scientific & ML(科学与机器学习)
    • Systems & SE(系统与软件工程)
    • Optimization(优化)
    • Knowledge(知识)
    • Formal(形式化)
    • Games(游戏)
  • 人类专家平均耗时: 每个任务57.2小时(最高320小时)

关键研究发现

通过对全部134个任务约 38,000小时 的代理交互分析,发现代理性能随交互时间遵循 对数-S形缩放定律(Log-sigmoid scaling law,R² = 0.998)。

排行榜(12小时性能)

完整基准(134个任务)

模型 @12h
Claude Opus 4.8 51.3
GPT-5.5 48.4
GPT-5.4 39.3
GLM-5.1 37.4
DS-V4-Pro 31.0

开源子集(51个任务)

模型 @12h
Claude Opus 4.8 43.6
GPT-5.5 42.7
GPT-5.4 34.3
GLM-5.1 30.3
DS-V4-Pro 25.1

评估框架:SForge

EdgeBench使用 SForge 评估框架,其核心机制包括:

  • 双容器隔离: 工作环境和判断环境完全分离,防止评估作弊
  • 迭代式反馈评估: 代理在运行期间多次提交,接收细粒度反馈(通过率、失败测试、分数),闭环改进,最终得分为所有提交中的最佳结果
  • 长周期执行: 支持停止钩子防止过早退出、自动恢复临时故障、Kubernetes后端支持并行运行

许可证

  • EdgeBench任务数据集: CC BY 4.0
  • SForge评估框架代码: Apache License 2.0

联系

如需评估完整的134个任务套件,请联系:zhongshu@bytedance.com

搜集汇总
数据集介绍
EdgeBench 数据集图片
构建方式
EdgeBench由字节跳动Seed团队构建,是一个包含134项真实世界任务的基准测试,其中51项任务已开源。每个任务被设计为需要数天完成的挑战,人类专家平均投入57.2小时。任务执行环境采用双容器隔离架构:工作容器供智能体操作,评判容器运行隐藏测试,两者完全分离。智能体在长达12小时以上的迭代过程中可多次提交结果,每次获得细粒度反馈(通过率、失败测试、得分),形成闭环改进,最终以最佳成绩为评分依据。
特点
EdgeBench的核心特色在于衡量智能体从真实环境中学习的能力,而非单次推理性能。通过对约38,000小时智能体交互数据的分析,发现其性能遵循对数sigmoid缩放定律(R²=0.998),即随交互时间呈S型增长。六个能力类别涵盖科学机器学习、系统工程、优化、知识、形式化验证和游戏,每个任务均设有足够高的性能上限,确保当前无智能体能轻易饱和。开源子集包含51项任务,支持社区复现与扩展。
使用方法
使用SForge评估框架,用户需在Linux主机上运行Docker引擎,通过pip安装sforge包后执行sforge fetch-tasks edgebench下载任务定义,再用sforge pull拉取预构建镜像。启动评判服务器后,设置API密钥和模型参数运行智能体。支持本地单任务Docker运行和Kubernetes集群批量执行。用户可接入自有模型(通过配置API端点)或自定义智能体框架(继承Agent类并注册至工厂),文档详见bytedance-seed.github.io/EdgeBench。
背景与挑战
背景概述
EdgeBench是由字节跳动Seed团队于2026年创建的一个创新性基准测试,旨在评估自主AI代理从真实世界环境中学习的能力。该基准测试包含134个多样化现实任务,跨越科学机器学习、系统与软件工程、优化、知识、形式化证明和游戏六大能力范畴,其中51个任务已开源。核心研究问题在于,传统基准测试仅关注一次性表现,而EdgeBench则聚焦于代理在长时间尺度上通过多级反馈迭代改进的能力。通过分析约38,000小时的代理交互数据,研究者发现代理性能随交互时间遵循对数Sigmoid缩放定律。EdgeBench的出现为理解AI代理的持续学习能力提供了全新视角,对相关领域产生了深远影响。
当前挑战
EdgeBench所解决的领域挑战在于传统基准测试无法衡量AI代理在长期互动中的学习与改进能力,现有评价体系多停留在静态一次性的性能测量,忽略了真实世界任务中迭代优化的重要性。构建过程中面临的挑战包括:设计134个具有足够难度、性能上限高到任何现有代理都无法饱和的真实任务;实现长达12小时以上的评估周期,每个任务平均需要57.2小时的人类专家投入;开发SForge双容器隔离评估框架,确保工作环境和评判环境完全分离以防止评估作弊;以及管理大规模并行运行的后端基础设施,支持Kubernetes集群上的分布式执行。此外,确保评估过程中代理能持续接收细粒度反馈并形成闭环改进也是关键技术挑战。
常用场景
经典使用场景
EdgeBench作为一项专注于评估自主人工智能代理在真实世界中学习能力的基准测试,其经典使用场景在于衡量AI代理在长时间跨度内从多层级反馈中迭代改进的表现。该基准包含134项真实任务,覆盖科学计算、系统工程、优化算法、知识推理、形式化验证及游戏策略六大能力范畴,每项任务允许代理进行超过12小时的交互,并通过迭代提交机制追踪性能随时间的演变轨迹。研究者可借助该平台系统性地比较不同模型与代理框架在长期学习动态上的差异,尤其关注性能随交互时间呈现的对数S型标度律现象,从而深入理解AI系统在复杂真实环境中的适应性与进化潜力。
解决学术问题
EdgeBench解决了现有AI评估范式过度依赖一次性性能指标的学术缺陷,开创性地构建了衡量代理从真实环境中持续学习能力的基准体系。传统基准如MMLU或HumanEval仅考察模型的静态知识储备或单次推理能力,而EdgeBench通过长达12小时的迭代交互设计,揭示了性能随交互时间遵循对数S型标度律(R²=0.998)这一重要发现。该数据集使研究者能够探究模型在学习过程中的动态行为、反馈利用效率以及能力天花板,为理解大规模语言模型在长期任务中的学习动力学提供了实证基础,推动了从静态评估向动态学习能力评估的范式转变。
衍生相关工作
EdgeBench衍生了一系列重要学术工作,其中最突出的是基于其对数S型标度律发现的性能预测模型研究,该模型以R²=0.998的拟合精度描述了代理性能随交互时间的变化规律。此外,该基准推动了长时间跨度代理评估方法论的发展,其SForge评估框架所采用的双容器隔离架构和迭代反馈机制被后续多项研究采纳并扩展。相关工作还探讨了不同模型家族(如Claude、GPT、GLM等)在134项任务上的学习曲线差异,揭示了模型容量、推理效率与长期学习能力之间的复杂关联,为设计下一代具备持续学习能力的AI系统提供了理论指导。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务