遇见数据集

ma-bench

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

MA-bench sweep results 数据集是MA-bench元优化器扫描结果的专用存储库,替代了之前分散在simonycl/temp_file_1中的工件。该数据集包含了2026年8月22日14:06的快照,共有156个密封的cell(其中121个带有有效性标志)。每个cell是一个(benchmark × method × seed-agent tier × proposer arm × RNG seed)的运行组合,其中method是唯一变化的因素;worker模型、budget和evaluator保持固定。数据集的目录结构如下:ma-bench/根目录下包含RESULTS.md文件(记录每个cell的分数、花费和有效性)、cells/live/和cells/cro/子目录(分别存放不同类型的tar.gz归档文件,命名格式为<arm>_<bench>_<tier>_<method>_seed<N>.tar.gz或<bench>_<tier>_<arm>_seed<N>.tar.gz)、以及recovery/目录(用于恢复codex CLI会话记录)。每个tar.gz归档文件是一个完整的运行目录,包含summary.json(分数、花费、来源、有效性标志)、trace/*.jsonl(完整的事件流:回放、评估、方法日志、LLM效果)、trace/codex-*.jsonl(原始codex提议者会话流,仅sol arm)、以及workspace/(智能体源码、候选、history/、RESUME.json)。Proposer arm分为两种:sol(使用gpt-5.6-sol模型,通过codex CLI运行)和opus5(使用claude-opus-5模型,通过Claude Code运行)。所有cell中的worker模型(被优化的智能体)固定为gpt-5.6-luna。数据集覆盖了三个基准测试:charxiv、gpqa、tau2,以及四种方法:adaevolve、cro、gepa、mh,具体cell数量分布见覆盖表格。此外,README还提供了多项阅读结果的注意事项,包括:method_launch:TimeoutExpired表示达到72小时墙钟上限,其分数是合法的随时结果;搜索深度不均匀,因基础设施事故导致部分cell时间损失;invalid非空需先读取原因,存在假阳性;rescored标记的cell最终测试评估在桥接中断后重新运行,原始摘要保存在tar.gz内;CRO的genesis_test_score为0.0,绝对测试分数可用但基于genesis的改进增量不可用;tau2用户模拟器使用gpt-5.4-mini而非论文中的gpt-4.1。recovery/目录提供了sol arm的codex提议者内部恢复方法。

The MA-bench sweep results dataset is a dedicated repository for the sweep results of the MA-bench meta-optimizer, replacing previously scattered artifacts in simonycl/temp_file_1. It contains a snapshot taken on August 22, 2026 at 14:06, with 156 sealed cells (121 of which have validity flags). Each cell is a run combination of (benchmark × method × seed-agent tier × proposer arm × RNG seed), where method is the only varying factor; worker model, budget, and evaluator are fixed. The directory structure is as follows: the ma-bench/ root directory contains RESULTS.md (recording scores, costs, and validity for each cell), subdirectories cells/live/ and cells/cro/ (containing different types of tar.gz archives, named in formats <arm>_<bench>_<tier>_<method>_seed<N>.tar.gz or <bench>_<tier>_<arm>_seed<N>.tar.gz), and a recovery/ directory (for recovering codex CLI session records). Each tar.gz archive is a complete run directory containing summary.json (scores, costs, source, validity flags), trace/*.jsonl (full event streams: replay, evaluation, method logs, LLM effects), trace/codex-*.jsonl (original codex proposer session streams, only for sol arm), and workspace/ (agent source code, candidates, history/, RESUME.json). Proposer arms are of two types: sol (using gpt-5.6-sol model via codex CLI) and opus5 (using claude-opus-5 model via Claude Code). The worker model (the agent being optimized) is fixed to gpt-5.6-luna for all cells. The dataset covers three benchmarks: charxiv, gpqa, tau2, and four methods: adaevolve, cro, gepa, mh, with specific cell count distributions given in the coverage table. Additionally, the README provides several notes for reading results: method_launch:TimeoutExpired indicates reaching the 72-hour wall clock limit, and its score is a valid anytime result; search depth is uneven due to infrastructure incidents causing time loss for some cells; non-empty invalid fields require reading the reason first, as there are false positives; rescored-marked cells have final test evaluation rerun after a bridge interruption, with original summaries saved in the tar.gz; CROs genesis_test_score is 0.0, absolute test scores are usable but improvement deltas based on genesis are not; tau2 user simulator uses gpt-5.4-mini instead of the gpt-4.1 mentioned in the paper. The recovery/ directory provides methods for recovering sol arms codex proposer internals.

创建时间:
2026-08-18
原始信息汇总

数据集概述:MA-bench 扫描结果数据集

该数据集是 MA-bench 元优化器扫描 的专用存档,收录了 2026-08-22 14:06 的快照,包含 156 个密封单元(其中 121 个有效)。

核心概念与固定配置

  • 单元(Cell):一个单元代表一次完整的运行组合,由 基准 × 方法 × 种子代理层级 × 提议者分支 × RNG种子 唯一确定。
  • 变量控制:仅方法不同,工作模型、预算和评估器在所有单元中固定不变。
  • 工作模型:所有单元中被优化的代理均为 gpt-5.6-luna

目录结构

数据集按以下结构组织:

  • RESULTS.md — 各单元得分、花费与有效性记录
  • cells/live/ — 活体单元压缩包(命名规则:<arm>_<bench>_<tier>_<method>_seed<N>.tar.gz
  • cells/cro/ — CRO 方法单元压缩包
  • recovery/ — codex CLI 会话回放记录

每个压缩包包含完整运行目录:

路径 内容
summary.json 得分、花费、来源、有效性标志
trace/*.jsonl 完整事件流:回放、评估、方法日志、LLM 效果
trace/codex-*.jsonl 原始 codex 提议者会话流(仅 sol 分支)
workspace/ 代理源码、候选方案、历史记录、RESUME.json

提议者分支(Arm)定义

  • sol = gpt-5.6-sol,通过 codex CLI 提议
  • opus5 = claude-opus-5,通过 Claude Code 提议

数据集覆盖范围

基准 方法 单元数
charxiv adaevolve 6
charxiv cro 18
charxiv gepa 18
charxiv mh 6
gpqa adaevolve 6
gpqa cro 13
gpqa gepa 18
gpqa mh 18
tau2 cro 18
tau2 gepa 18
tau2 mh 17

数据解读的重要注意事项

  1. 超时并非失败method_launch:TimeoutExpired 表示单元达到 72 小时墙钟上限,其得分是截断搜索的合法 "任意时间" 结果。
  2. 搜索深度不统一:2026-08-10 至 08-17 期间的基础设施事件导致部分单元损失时间,恢复后重新获得 72 小时上限。比较时应先同种子内比较方法,再跨种子比较。
  3. 有效性标志需谨慎解读invalid 非空时先读原因。它可能误报——当方法提出确定性失败的候选时,该标志会被触发(守卫比较的是运行间的重复次数,而非候选内的重复)。
  4. rescored 标记单元:其最终测试评估在桥接中断损坏原始测量后重新运行。搜索过程本身未受影响;修复前的摘要保留在压缩包内(summary.pre-rescore.json)。
  5. CRO 的 genesis_test_score 为 0.0:绝对测试得分可用,但基于 genesis 计算的改进增量不可用。
  6. tau2 用户模拟器gpt-5.4-mini,而非论文中的 gpt-4.1(该通道配额耗尽后不可用)。本快照中所有 tau2 单元保持一致。

恢复目录说明

sol 分支的 codex 提议者内部会话在 2026-08-15 之前未被归档(解析器将会话流汇总为计数器并丢弃了内容)。这些内容可通过 codex 自身持久化的回放记录恢复,其中 session_meta.cwd 标识单元名称,session_id 与 mab2 trace 中的 llm_response_received.usage_details.session_id 匹配。

数据清理

  • 所有 charxiv 图片已替换为 <IMAGE_STRIPPED:NB> 占位符
  • 所有归档已进行凭证擦除处理
搜集汇总
数据集介绍
ma-bench 数据集图片
构建方式
MA-bench数据集源自针对MA-bench元优化器的系统扫描,收录了2026年8月22日快照的156个密封数据单元,其中121个附带有效性标记。每个单元代表一次完整的运行,涵盖基准(charxiv、gpqa、tau2)、优化方法(adaevolve、cro、gepa、mh)、种代理层级、提案臂(sol或opus5)以及随机种子。构建过程中,工作模型固定为gpt-5.6-luna,预算和评估器保持一致,仅方法变量变动。数据以压缩归档形式存储,包含summary.json记录分数与溯源信息,trace目录保存完整事件流,workspace包含代理源代码与历史记录。所有归档均经脱敏处理,图像替换为占位符,移除凭证。
使用方法
使用MA-bench数据集时,研究者应依据README指引访问归档目录,每个单元包含完整的运行轨迹,便于复现与分析。解读结果需遵循列出的注意点:超时结果作为合法任意时间分数;搜索深度比较应限于同一随机种子;有效性标志异常时先查阅原因;重新评分的单元参考预处理摘要。对于sol臂的codex会话记录,可通过session_meta.cwd与trace中的session_id关联恢复。tau2单元需注意模拟器差异,避免与外部基准直接对比时产生偏差。数据集支持对元优化器性能的多维评估,并鼓励在既定约束下进行方法间比较。
背景与挑战
背景概述
MA-bench 数据集由 simonycl 团队于 2026 年创建,旨在系统评估不同元优化器(meta-optimizer)在多种基准测试上的性能。该数据集的核心研究问题在于,如何在固定工作模型、预算和评估器的条件下,通过对比不同提案模型(如 gpt-5.6-sol 和 claude-opus-5)的优化效果,揭示元优化方法在自动化机器学习中的潜力。通过记录 156 个密封单元(cell)的完整运行轨迹,包括分数、花费、有效性标志以及代码执行会话,MA-bench 为元优化研究提供了透明、可复现的基准。其影响力体现在为后续研究者提供了标准化的比较框架,促进了元优化器设计中的可解释性和鲁棒性研究。
当前挑战
MA-bench 数据集面临的挑战涵盖领域问题与构建过程两方面。就领域问题而言,元优化器的性能评估常受限于搜索深度不统一、基础设施故障导致的中断,以及绝对改进量难以跨种子公平比较。构建过程中,主要挑战包括:方法启动超时(TimeoutExpired)被视为有效结果而非失败,需谨慎解读;CRO 方法的 genesis_test_score 为零,导致基于其计算改进量失效;无效标志可能因方法提出确定性失败候选而产生误报;此外,sol 臂的代码x提议器会话流在早期未存档,需依赖恢复机制,增加了数据完整性和可解释性的难度。这些挑战要求使用者在分析时细致甄别,以确保结论的可靠性。
常用场景
经典使用场景
MA-bench数据集为元优化器(meta-optimizer)的算法评估提供了标准化的基准测试平台。其核心结构围绕“细胞”(cell)展开,每个细胞代表一个唯一的(基准、方法、种子代理层级、提议者臂、随机种子)组合,确保在固定工作模型、预算和评估器条件下,仅方法维度可变,从而构建了严格受控的实验环境。该数据集覆盖charxiv、gpqa、tau2三个基准,并集成adaevolve、cro、gepa、mh四种代表性元优化方法,每个方法在对应基准上拥有多个重复细胞,支持统计稳健的性能比较。研究者可借助其完整的运行目录(含摘要、事件流、原始会话轨迹和工作区快照)复现实验、分析搜索动态及验证优化策略的有效性,是推动自动机器学习与算法搜索领域发展的关键资源。
解决学术问题
该数据集直面元优化领域长期存在的可复现性危机与评估碎片化难题。传统研究常因实验配置不透明、随机种子缺失或评估协议不一,导致结果难以横向比较。MA-bench通过标准化的细胞定义、统一的工作代理(gpt-5.6-luna)及详尽的元数据归档,构建了首个大规模、多基准、多方法的元优化比较体系,使研究者能可靠地量化不同提议者(如sol与opus5)和优化策略(如遗传编程、协同进化)的性能差异。其精心标注的注意事项(如超时非失败、搜索深度不均、无效标志的语义)提供了对实验局限性的深度洞察,引导学术社区超越肤浅的性能排行,更关注算法在不同约束下的鲁棒性与收敛行为,从而推动元优化理论向实证科学范式演进。
实际应用
在实际应用中,MA-bench为人工智能系统的自主优化提供了直接的工程参考。其记录完整的代理优化过程(包括代码执行、评估反馈和LLM交互流)可作为训练数据或提示模板,用于开发更高效的自我改进算法。例如,工程师可借鉴cro方法的恢复机制,设计弹性训练管线;或利用gpqa基准上的结果,指导大语言模型在复杂推理任务中的策略调整。数据集中的工作区快照和恢复文件,使得实践者能在生产环境中复现或续跑优化进程,支持自动化机器学习平台在有限预算下实现持续模型改进。此外,其多臂提议者(codex CLI与Claude Code)的对比数据,为选择不同LLM作为优化引擎提供了实证依据,加速了智能体从学术原型到工业部署的转化。
数据集最近研究
最新研究方向
该数据集聚焦于元优化器在多种基准上的系统化比较,其前沿研究方向在于评估不同提议模型(如gpt-5.6-sol与claude-opus-5)对优化性能的影响,并细致控制工作模型、预算和评估器以隔离方法差异。数据集的快照涵盖156个封闭实验单元,涉及charxiv、gpqa和tau2等基准,方法包括adaevolve、cro、gepa和mh,体现了对元优化器鲁棒性和泛化能力的深入探索。特别地,数据集对超时、搜索深度不均、评估重打分等复杂情况提供了详尽的解释和修正,反映了在长时间运行和大规模实验中的实际挑战。该资源对于推动元优化算法的实证研究、促进可复现的基准测试以及理解不同AI代理在优化任务中的行为具有重要意义,为未来设计更高效、适应性更强的优化策略提供了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务