遇见数据集

MESSIER

收藏
github2026-09-29 更新2026-10-01 收录
官方服务:

资源简介:

MESSIER是一个用于跨基准测试的AI代理评估的高分辨率语料库,存储和比较代理评估结果,包含模型、支架、任务、验证器和评分信息。

MESSIER is a high-resolution corpus for cross-benchmark AI Agent evaluation, which stores and compares agent evaluation results, encompassing information related to models, backbones, tasks, validators, and scoring.

创建时间:
2026-09-27
原始信息汇总

MESSIER 数据集概述

基本信息

  • 名称:MESSIER
  • 全称:A High-Resolution Corpus for Cross-Benchmark Agent Evaluation(面向跨基准智能体评估的高分辨率语料库)
  • 仓库地址:https://github.com/Andromede-AI/messier
  • 数据集地址:https://huggingface.co/datasets/Andromede-AI/messier
  • 项目主页:https://andromede-ai.github.io/messier/
  • 论文:https://arxiv.org/abs/2607.25891
  • 许可证:MIT

数据集简介

MESSIER 是一个用于存储和比较智能体评估结果的语料库,包含理解每个已发表结果如何产生所需的模型、脚手架(scaffold)、任务、验证器(verifier)和评分信息。该项目旨在枚举智能体评估的各个要素,并在不同基准之间统一其定义与表示。

数据规模

类别 数量
基准(Benchmarks) 31
智能体(Agents) 725
任务(Tasks) 11,999
验证器(Verifiers) 72,000
记录(Records) 902,338
轨迹(Trajectories) 118,089

数据内容

  • 包含五张数据表:tasks、records、verifiers、trajectories、classifications
  • 每个任务均带有 SOC 和 NAICS 分类,支持跨职业与行业的细粒度分析
  • 在可用的情况下提供完整轨迹,以支持对智能体行为的深入分析
  • 数据模型涵盖:多种动作空间类型、环境状态与访问、最终验证与顺序验证、模型推理努力程度等

主要功能与用途

  • 支持误差分析
  • 研究性能随时间、任务难度、模型与脚手架、不同验证器类型等维度的变化
  • 通过 SOC 和 NAICS 分类进行职业与行业层面的分析
  • 通过完整轨迹分析智能体行为

使用方法

安装

bash git clone https://github.com/Andromede-AI/messier.git cd messier uv sync

如需包含构建器、分析与验证工具:

uv sync --group dev

uv run python

下载数据

从 Hugging Face 下载全部五张表(需超过 9 GB 磁盘空间,轨迹占大部分): python from huggingface_hub import hf_hub_download

for table in ("tasks", "records", "verifiers", "trajectories", "classifications"): hf_hub_download( "Andromede-AI/messier", f"{table}.jsonl", repo_type="dataset", local_dir="data/artifacts" if table == "classifications" else "data/processed", )

Python 加载

python import messier

tasks = messier.tasks() records = messier.records() verifiers = messier.verifiers() trajectories = messier.trajectories()

流式加载(Hugging Face datasets)

python import json from datasets import load_dataset

tasks = load_dataset( "text", data_files="hf://datasets/Andromede-AI/messier/tasks.jsonl", split="train", streaming=True, ).map(lambda row: json.loads(row["text"]), remove_columns=["text"])

快速上手示例

  • 收集单个任务的全部存储信息:通过 (benchmark, task_id) 键关联五张表
  • 在各基准内比较智能体:使用带评分的试验计算成功率
  • 按模型发布季度追踪各基准最佳观测结果:运行 analysis/frontier_progress/run.py

文档

  • 数据格式与术语:docs/data.md
  • 添加基准:docs/builders.md
  • 发布指南:docs/publishing.md
  • 贡献指南:CONTRIBUTING.md

更新动态

  • [26/10/2026] 将在 EMNLP 2026 主会议展示 MESSIER
  • [09/10/2026] 论文 Predicting Task Difficulty Without Rollouts 将在 COLM 2026 Agent Behavior Workshop(WAB)以海报形式展示
  • [26/09/2026] 发布 MESSIER 首个公开版本
  • [13/09/2026] 数据模型更新,新增 extra_context,添加来自 HarveyAI-Lab、GDPval、DABStep、OSWorld、Toolathlon 的任务文件
  • [05/09/2026] 更新 MathArena 至更新的固定源版本,并将 APEX 移至完整三片发布
  • [27/08/2026] 新增 Toolathlon,包含 32 个应用的 108 个任务与 604 个工具,以及 22 个模型配置的 7,116 条结果
  • [12/08/2026] 扩展数据模型以区分多种动作空间类型、环境状态与访问、最终与顺序验证及模型推理努力程度;修订 SOC 与 NAICS 分类
  • [01–02/08/2026] 在 Berkeley RDI Summit 以海报形式展示 MESSIER
  • [28/07/2026] 发布并公开 MESSIER 第一版

引用

bibtex @article{krsteski2026messier, title={Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation}, author={Krsteski, Stefan and Meyer, Charlotte and Allegre, Guillaume and OHalloran, Tony and Sallinen, Alexandre}, journal={arXiv preprint arXiv:2607.25891}, year={2026} }

后续扩展论文: bibtex @article{krsteski2026predicting, title={Predicting Task Difficulty Without Rollouts}, author={Krsteski, Stefan and Meyer, Charlotte}, journal={arXiv preprint arXiv:2608.05797}, year={2026} }

免责声明

MESSIER 包含来自原始基准和结果提供方的材料,其所有权和知识产权受到尊重。第三方材料仍受其原始条款约束,并记录于 THIRD_PARTY_NOTICES.md 中。

搜集汇总
数据集介绍
MESSIER 数据集图片
构建方式
在智能体评估日益繁杂而标准各异的背景下,MESSIER以跨基准对齐与要素枚举为理念,通过模块化的数据加载器与构建器,将不同来源的评估材料统一整合为tasks、records、verifiers、trajectories与classifications五类数据表。构建流程涵盖对原始基准任务的导入与版本钉扎,对模型响应、评分与轨迹的采集与规范化,以及对任务难度、职业与行业属性的细粒度标注。数据经校验工具审核后发布于Hugging Face,并通过持续贡献机制吸纳新的基准、模型与运行结果,从而在统一的标识体系下实现多源评估信息的聚合与可比。
特点
该语料库汇聚31个基准、725个智能体、11999项任务、72000个验证器、逾90万条记录与11.8万条轨迹,规模宏大且结构精细。其数据模型区分动作空间类型、环境状态与访问方式、单次与序列验证以及模型推理强度,并通过SOC与NAICS分类支持跨职业与行业的细粒度分析。完整轨迹的保存使智能体行为得以深入考察,而统一的benchmark与task_id键值体系则确保跨基准的检索与对照成为可能,为能力与安全研究、评估设计反思提供高分辨率证据。
使用方法
使用者可通过克隆代码仓库并以uv安装数据加载器,从Hugging Face下载全部五类数据表后,借助messier库将tasks、records与verifiers加载为pandas数据框,并逐条流式读取trajectories。亦可采用Hugging Face datasets库进行在线流式加载,但分析脚本依赖本地文件。典型用法包括汇总单个任务的全部关联信息、按基准比较不同智能体的成功率、以及运行前沿进展分析脚本追踪各基准随模型发布季度的最优结果,从而支持错误分析、难度研究与性能演变的系统考察。
背景与挑战
背景概述
智能体评估已成为衡量大模型自主任务执行能力的关键环节,然而各基准在任务定义、评分协议与验证机制上各行其是,致使跨基准比较难以实现。MESSIER由Andromede-AI团队于2026年发布,是一个面向跨基准智能体评估的高分辨率语料库,收录31个基准、725个智能体、11,999项任务及逾九十万条评估记录,并整合模型、脚手架、任务、验证器与评分信息,辅以SOC与NAICS职业产业分类及完整轨迹数据。该语料库为追踪智能体能力演进、剖析评估设计提供了统一的数据基础,对推动该领域方法论规范化具有重要影响。
当前挑战
智能体评估领域长期缺乏统一的本体论框架,不同基准对动作空间、环境状态、验证时机与推理强度的刻画方式互不兼容,导致跨基准结果难以对齐,也阻碍了错误分析与时间趋势研究的开展。构建MESSIER面临多重挑战:需在保留原始基准语义的前提下,将异构的任务描述、评分逻辑与轨迹格式映射至统一数据模型;需处理跨来源数据在粒度、许可与质量上的参差,并应对海量轨迹带来的存储与解析负担;同时,随着新基准与模型持续涌现,如何维护数据模型的扩展性与导入流程的可复现性,亦是持续性的难题。
常用场景
经典使用场景
在智能体评估研究领域,跨基准的横向比较长期受制于评测协议异构、结果记录碎片化等难题。MESSIER以高分辨率语料库的形态,将31个基准、725个智能体、近1.2万项任务及其对应的7.2万个验证器与逾90万条记录汇于统一数据模型之下,为智能体评测提供经典使用范式。研究者借此可在同一框架内检索模型、脚手架、任务、验证器与评分信息,比较不同基准下智能体的成功率,追踪各基准在模型发布季度上的前沿进展,并利用任务所附的SOC与NAICS分类开展职业与行业的细粒度剖析,亦可借助完整轨迹深入探究智能体的行为模式。
解决学术问题
智能体评测研究常面临结果不可追溯、跨基准结论难以对齐、评测要素定义含混等学术困境。MESSIER通过枚举智能体评估的基本构成要素并统一其定义与表示,有效缓解了上述问题。其精心构建的数据结构支持误差分析、性能随时间的演化研究,以及任务难度、模型、脚手架与验证器类型等多维度的比较分析。该数据集使研究者得以系统考察智能体的能力与安全属性,反思评测设计本身的合理性,从而为智能体评估从孤立走向可比、从结果走向过程提供了关键基础设施,对推动该领域方法论规范化具有深远意义。
衍生相关工作
作为智能体评估领域的一项基础性资源,MESSIER已催生并支撑了若干后续研究。其论文第5.4节的分析被延伸为《Predicting Task Difficulty Without Rollouts》,该工作在COLM 2026智能体行为研讨会上以海报形式发表,探索了无需执行轨迹即可预测任务难度的路径。同时,MESSIER团队持续吸纳HarveyAI-Lab、GDPval、DABStep、OSWorld、Toolathlon等基准的任务与结果,并更新MathArena、APEX等来源的版本,形成以开放协作方式不断扩展的衍生生态,为跨基准智能体评估研究提供了可复用的数据基础与方法参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务