遇见数据集

EdgeBench

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

EdgeBench是一个用于评估自主AI代理如何从真实世界环境中学习的基准数据集。它包含134个真实世界任务,覆盖六个能力类别:科学与机器学习、系统与软件工程、优化、知识、形式化与游戏。与传统的单次性能评估不同,EdgeBench将代理置于可执行的任务环境中,提供现实的多层次反馈,允许每个任务迭代12小时以上,从而追踪完整的改进轨迹而非最终得分。数据集公开了51个任务以及完整的评估框架。分析基于约38,000小时的代理交互,发现性能随交互时间遵循对数S型缩放定律。每个任务均设计为日尺度挑战,具有足够高的性能上限,当前尚无代理能完全达到。人类专家完成这些任务的平均努力为57.2小时。该数据集适用于评估AI代理在复杂、长期、真实世界场景中的学习与适应能力。

EdgeBench is a benchmark dataset for evaluating how autonomous AI agents learn from real-world environments. It contains 134 real-world tasks spanning six capability categories: Science & ML, Systems & Software Engineering, Optimization, Knowledge, Formalization, and Games. Unlike traditional one-shot performance evaluations, EdgeBench places agents in executable task environments, provides realistic multi-level feedback, allows over 12 hours of iteration per task, and tracks full improvement trajectories rather than final scores. The dataset releases 51 tasks along with a complete evaluation framework. Analysis based on approximately 38,000 hours of agent interactions reveals that performance follows a log-sigmoid scaling law with interaction time. Each task is designed as a day-scale challenge with a sufficiently high performance ceiling, which no current agent can fully achieve. Human experts require an average effort of 57.2 hours to complete these tasks. This dataset is suitable for evaluating AI agents learning and adaptation capabilities in complex, long-term, real-world scenarios.

创建时间:
2026-06-24
原始信息汇总

数据集概述

EdgeBench 是一个用于评估自主 AI Agent 从真实环境中学习能力的基准测试,包含 134 个真实世界任务。该基准由 ByteDance Seed 团队构建,并公开发布了其中 51 个任务及完整的评估框架。

核心特性

  • 评估方式:不同于一次性性能测试,EdgeBench 将 Agent 置于可执行的任务环境中,提供多层级的现实反馈,允许 Agent 在每个任务上迭代 12 小时以上,追踪其整个改进轨迹。
  • 规模:记录了约 38,000 小时的 Agent 交互数据
  • 关键发现:Agent 的性能遵循以交互时间为变量的 对数-sigmoid 缩放定律 (R² = 0.998)。

任务分类

EdgeBench 的 134 个任务涵盖了 6 大能力类别

  • 科学与机器学习 (Scientific & ML)
  • 系统与软件工程 (Systems & SE)
  • 优化 (Optimization)
  • 知识 (Knowledge)
  • 形式化 (Formal)
  • 游戏 (Games)

每项任务都被设计为“日级”挑战,性能上限很高,当前没有 Agent 能完全达到满分。记录的人类专家平均努力时间为 57.2 小时/任务(最高可达 320 小时)。

排行榜 (Leaderboard)

数据集提供了两个版本的排行榜:完整基准(134 个任务)开源子集(51 个任务)。以下展示完整基准的结果。

完整基准 (134 个任务) - 总得分

模型 @2h @4h @6h @8h @10h @12h
Claude Opus 4.8 39.0 45.7 48.1 49.8 50.9 51.3
GPT-5.5 36.8 42.1 44.5 46.3 47.6 48.4
GPT-5.4 29.7 34.0 36.5 38.0 38.9 39.3
GLM-5.1 26.0 30.4 32.9 34.9 36.5 37.4
DS-V4-Pro 23.3 27.1 29.0 29.9 30.9 31.0

完整基准 (134 个任务) - @12h 各类别得分

模型 科学与机器学习 系统与软件工程 优化 知识 形式化 游戏
Claude Opus 4.8 48.5 67.4 36.5 47.0 55.0 39.3
GPT-5.5 44.3 65.0 33.6 45.7 50.0 39.1
GPT-5.4 33.5 54.1 27.9 38.8 40.8 29.0
GLM-5.1 33.8 50.9 26.4 43.5 24.6 29.3
DS-V4-Pro 30.0 43.0 21.5 37.0 14.1 16.9

评估框架

EdgeBench 由 SForge 提供支持。SForge 是一个双容器评估框架,专为长时间跨度的 Agent 评估而设计。

许可协议

EdgeBench 任务数据集采用 CC BY 4.0 许可协议发布。

联系

如需在完整的 134 个任务套件上进行评估,请联系 zhongshu@bytedance.com

搜集汇总
数据集介绍
EdgeBench 数据集图片
构建方式
EdgeBench是由字节跳动Seed团队构建的一项基准测试,旨在评估自主AI代理从真实世界环境中学习的能力。该数据集精心设计了134项真实任务,涵盖科学机器学习、系统软件工程、优化、知识推理、形式化验证和游戏六大能力类别,其中51项任务已开源发布。每项任务均被构造为跨日尺度的挑战,性能天花板高至尚无现有代理能够完全达到,而人类专家平均需投入57.2小时(最高320小时)方可完成。构建过程中,团队收集了约38,000小时的代理交互数据,通过对全部134项任务的分析,揭示了代理性能与交互时间之间遵循对数S形缩放定律(R²=0.998)的深刻规律。
特点
EdgeBench的核心特征在于其独特的评估范式:不聚焦于单次性能,而是让代理在具有真实多级反馈的可执行环境中反复迭代超过12小时,完整追踪其改进轨迹而非仅记录最终分数。数据集中的任务高度多样且现实,从强化学习、代码优化到形式化定理证明一应俱全,每个任务都设计了足够高的性能上限以避免代理轻易饱和。此外,EdgeBench提供了全排行榜和分时得分机制(@2h至@12h),使得研究人员能够精细观察不同模型随时间的学习曲线,而开源子集(51项任务)则为社区提供了可复现的实验基础。
使用方法
使用EdgeBench时,研究人员需借助其配套的两容器评估框架SForge(简称SForge Harness),该框架专为长期自主代理评估设计,相关安装与使用指南可在其GitHub仓库及文档页面获取。用户可直接在公开的51项任务子集上进行测试,通过标准化的交互接口让代理运行至多12小时,并利用框架自动记录各时间点的性能得分。若要评估完整的134项任务套件,则需联系数据集维护团队获取访问权限。最终结果可与已发布的模型排行榜进行对比,涵盖Claude Opus 4.8、GPT-5.5等前沿模型在不同类别和时长下的表现数据,便于进行科学研究与模型改进。
背景与挑战
背景概述
EdgeBench是由字节跳动Seed团队于2026年发布的一项开创性基准测试,旨在衡量自主AI代理在真实世界环境中的学习能力。不同于传统评估一次性的性能,EdgeBench设计了134个现实任务,覆盖科学、系统工程、优化、知识、形式化验证和游戏六大能力类别,允许代理在12小时以上的迭代中持续改进,并追踪完整的提升轨迹。通过对约38,000小时代理交互数据的分析,研究团队发现性能与交互时间遵循对数S形缩放定律(R²=0.998),这为理解AI学习机制提供了全新的理论视角。该项目公开发布51个任务和完整的评估框架,已成为长期自主代理研究领域的重要参考。
当前挑战
EdgeBench所解决的领域问题核心在于,现有的AI基准测试多聚焦于一次性或短时任务,无法揭示代理在迭代学习中的动态演化过程与长期适应能力。这导致对真实世界复杂场景的模拟严重不足。在构建过程中,研究团队面临双重挑战:设计134项高难度任务以确保现有模型无法轻易达到性能天花板,同时保证任务的可复现性和公平评估;开发两容器评估框架SForge以支持超过12小时的稳定交互,并记录多级反馈,这要求极高的工程稳定性和资源调度效率。此外,如何公正比较不同模型在开放式任务中的表现也是一项关键难点。
常用场景
经典使用场景
EdgeBench作为一个专为评估自主AI代理从真实世界环境中学习能力而设计的基准测试,其经典使用场景聚焦于长时间跨度的智能体性能追踪。该数据集包含134项真实世界任务,涵盖科学计算、系统工程、优化问题、知识推理、形式化验证和游戏交互六大能力范畴。研究者可借助SForge评估框架,让AI代理在每项任务中迭代超过12小时,记录完整的性能提升轨迹,而非仅关注最终得分。这种设置使得EdgeBench成为衡量智能体在复杂、动态环境中持续学习能力的标杆工具。
实际应用
在实际应用层面,EdgeBench为智能代码编程助手、自动化系统调优工具、科学模拟器及游戏AI的开发提供了关键的验证平台。例如,在系统工程领域,它可评估代理对编译器优化、漏洞检测和流水线配置等任务的持续改进能力;在优化问题中,则可测试代理在车辆路径规划、仓储物流调度等真实场景下的决策质量。此外,该基准还支持形式化定理证明的自动化验证,为数学辅助工具的研发提供了可靠参考,其开源子集为工业界与学术界构建可复现的智能系统提供了标准化评估手段。
衍生相关工作
EdgeBench的发布催生了一系列围绕长时程学习与智能体评估的衍生工作。其一,研究者基于其对数S形缩放定律,提出了时间感知的模型性能预测方法,用于优化智能体的计算资源分配。其二,SForge评估框架被多个团队采纳,作为构建自定义长周期基准测试的基础设施。其三,EdgeBench的任务分类体系启发了跨领域能力谱系的构建,例如将其六大能力类别映射到具体的职业任务中,形成了面向自动化软件开发、科学发现和博弈决策的专业化评估工具集。此外,该工作也推动了关于代理学习过程中反馈机制设计的后续研究,如多层级环境反馈的有效性分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务