遇见数据集

what-ai-benchmarks-actually-measure

收藏
arXiv2026-09-08 更新2026-09-10 收录
官方服务:

资源简介:

该数据集由多所顶尖研究机构联合创建,旨在系统性地探究AI基准测试的构念效度。数据集囊括了53个模型在56个能力与安全基准上的逐项输出与评分,涵盖了来自SafetyPrompts与HELM等权威来源的基准测试项。创建过程中,研究团队对超过1000项的基准进行等量采样,并以零样本、温度1的设定收集模型响应,随后依据各基准既定指标进行评分。这一数据集为揭露基准测试是否真正测量其声称概念提供了实证基础,尤其适用于验证基准的收敛效度与判别效度,并揭示了诸如BBQ-accuracy等基准可能测量非预期概念的潜在问题。

This dataset was jointly created by multiple top-tier research institutions, aiming to systematically investigate the construct validity of AI benchmarks. It contains itemized outputs and scores of 53 models across 56 capability and safety benchmarks, including benchmark items from authoritative sources such as SafetyPrompts and HELM. During the dataset's development, the research team performed equal sampling across over 1,000 benchmarks, collected model responses under the zero-shot setting with temperature set to 1, and subsequently scored the responses in accordance with the predefined metrics of each respective benchmark. This dataset offers an empirical basis for verifying whether benchmarks actually measure the concepts they claim to evaluate, and is particularly applicable for validating the convergent and discriminant validity of benchmarks, while uncovering potential issues where benchmarks like BBQ-accuracy may measure unintended concepts.

创建时间:
2026-09-08
原始信息汇总

What AI Benchmarks Actually Measure 数据集概述

数据集简介

What AI Benchmarks Actually Measure 是一个用于评估AI基准测试有效性的数据集,对应论文 What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks(Desai et al., 2026)。数据集包含53个语言模型56个基准测试上的逐项(item-level)模型输出和评分结果,许可证为 CC-BY-4.0,语言为英文。

数据内容与结构

该数据集不直接发布基准测试的提示词(prompts),而是通过 item id 引用原始基准。用户可通过 GitHub 仓库(github.com/madesai22/what-ai-benchmarks-actually-measure)中的代码重新生成提示词和评分结果。

路径 形状 内容
data/<benchmark>/ 行 = (模型, 条目) 逐项响应、标签、评判器输出和逐项得分
scores/<benchmark> 行 = 条目, 列 = 模型 每个模型在每个条目上的得分矩阵(大多为二值正确/错误,少数为连续得分)
aggregate/model_scores 行 = 模型, 列 = 基准 每个模型的基准级得分
metadata/benchmarks.csv 每个 (基准, 子集) 一行 图表标签、评分策略、评判器信息

行数据结构

每行数据包含以下核心列:

model_id benchmark paper_status item_id subset response cleaned_response label score

  • response:模型原始输出
  • cleaned_response:解析后的答案
  • score:逐项得分
  • subset:用于区分共享同一基准配置的行(如 or_bench、xstest 和 sgxs_test 的 refusaloverrefusal 取值)

另有 paper_status 列标记因过饱和或格式不符合而被排除分析的数据。

模型覆盖

数据集涵盖来自以下机构的53个模型:

  • Alibaba:Qwen 系列(包括 Qwen 1.5/2/2.5/3 多个规模版本)
  • AllenAI:OLMo 2 系列和 OLMoE
  • Anthropic:Claude 3.5 Haiku、Claude Sonnet 4.5
  • AI21:Jamba Mini
  • Databricks:DBRX Instruct
  • DeepSeek:DeepSeek V3、V4-flash
  • Google:Gemma 2/3 系列
  • Meta:Llama 2、Llama 3.2、Llama 3.3 系列
  • Microsoft:Phi-3.5 和 Phi-4 系列
  • Mistral:Mistral 7B、Mixtral、Mistral Nemo/Small/Large 等
  • Moonshot AI:Moonlight 16B-A3B
  • 01.AI:Yi 系列
  • OpenAI:GPT-3.5 Turbo、GPT-4 Turbo、GPT-4o mini、GPT-5 nano、o1、o1-mini、o3-mini
  • TII:Falcon3 系列
  • xAI:grok-4-1-fast-reasoning

LLM 评判器

经过安全评判的基准测试包含每位评判器的输出,包括 judge_<name>_raw_outputjudge_<name>_verdictjudge_<name>_full_refusal_accjudge_<name>_indirect_refusal_acc 列。其中:

  • 提示型评判器(Qwen、Llama)包含 raw_output 和解析出的 verdict
  • 微调分类器评判器(如 LLaMA-2-CLS、Mistral、WildGuard、MD-Judge、LlamaGuard、WalledGuard)仅输出标签,raw_output 始终为空
  • 论文主要使用 Qwen3-30B 评判器;Llama-3.3-70B 评判器的输出也被包含以供比较
  • *_refusal_acc 是准确率而非拒绝率,其极性随提示词的 label 翻转

内容警告

数据集中 HarmBench、SorryBench、SG-Bench-jailbreak、OR-Bench、XSafety、SALAD-Bench 和 WildGuard 包含模型对对抗性和有害提示的响应(包括成功的越狱)。RealToxicityPrompts 和 BOLD 包含有毒内容生成。personal_info_leak 子集包含模型回忆出的真实电子邮件地址(来自 Enron 公共语料库)。

配置列表

数据集包含超过100个配置(config),主要包括三类:

  • 数据配置(64个):各基准测试的模型响应数据,如 aegisbabibbqgsm8kmmluhellaswagtruthful_qawmdp 等,每个配置对应一个 data/<benchmark>/data.parquet 文件
  • 评分配置(50个):以 scores__ 为前缀的各基准测试评分矩阵,对应 scores/<benchmark>.parquet 文件
  • 聚合与元数据配置(2个):model_scores(模型基准级得分)和 metadata__benchmarks(基准元数据)
搜集汇总
数据集介绍
what-ai-benchmarks-actually-measure 数据集图片
构建方式
该数据集源于一项针对AI基准测试效度的大规模实证研究,由多所顶尖大学与微软研究院联合构建。研究者从SafetyPrompts与HELM等权威来源出发,系统筛选并扩展至涵盖能力与安全两大范畴的56个基准测试,涉及推理、知识、偏见、拒绝等11个概念类别。为保障数据质量,数据集排除了无许可证、需人工评分或多轮对话的基准,并对超过1000条项目的基准进行分层抽样。通过调用53个覆盖开源与闭源、参数规模从0.5B至685B的指令微调模型,研究者以零样本、温度设置为1的方式收集了所有模型在项目级与基准级上的输出与分数,并辅以定制系统提示以确保可评分性。整个流程经过与HELM数据的交叉验证及饱和性筛查,最终保留48个可靠的基准用于核心分析。
特点
该数据集的核心特点在于其规模、精细度与多维度效度检验视角。它收录了56个基准与53个模型的丰富输出和评分,项目级与基准级数据兼具,为探索基准测试的建构效度提供了宏大的数据支撑。数据集设计紧扣收敛效度与区分效度的社会科学理论,通过模型排名相关性与基于项目反应理论的潜在特质建模,分析同概念基准间的趋同程度与异概念基准间的区分度。尤为独特的是,数据集支持对基准设计元素(如任务结构、评分格式)与人口统计属性子群体的效应审视,并可用于检验单个基准是否真正测得其宣称的概念,例如BBQ-accuracy与推理基准的相关性高于其同属的偏见基准。这种层次分明的结构使数据集超越了传统性能对比,成为剖析基准测试内在效度的珍贵工具。
使用方法
该数据集适用于多种研究与实践场景。研究者可利用其探索不同基准间的相关性结构,验证或质疑现有基准的概念效度,并识别那些可能测度了非预期概念的基准。本数据集可作为评估新基准的参照系,开发者可针对数据集中已有模型子集运行新基准并比对成绩,检验其收敛与区分效度,从而优化基准设计。数据分析可采用Spearman相关分析、层次聚类、部分Mantel检验以及IRT模型等统计手段。此外,该数据集亦可作为训练集或测试集,用于开发预测基准表现或评估模型能力的新方法。研究者可按基准、模型或概念标签筛选子集,以适应特定研究问题,其详细文档和代码库为复现与扩展原论文发现提供了便利。
背景与挑战
背景概述
该数据集由来自密歇根大学、斯坦福大学、微软研究院等机构的研究人员于2026年创建,旨在系统性地审视AI基准测试的有效性问题。研究团队借鑑社会科学中的聚合效度与区分效度概念,对56个能力与安全基准及53个模型进行了大规模实证分析。此数据集的核心研究问题在于探究这些基准是否真正测量了其声称衡量的概念(如推理、拒绝等),并揭示基准之间模型排名相关性的内在结构。其影响力在于为AI基准的有效性评估提供了新方法论,并发布了一个涵盖项目级与基准级模型输出和评分的丰富数据集,为后续研究奠定了坚实基础。
当前挑战
该数据集面临的挑战主要涵盖两方面。其一,领域内普遍存在基准概念界定模糊的问题,导致同一概念在不同基准中可能被不同地概念化,低相关性难以区分是测量失效还是概念理解分歧。其二,构建过程中难度重重,需从大量候选基准中筛选并标注其声称衡量的概念,还需跨53个模型收集零样本输出,并处理输出格式不一致、模型饱和及人工评估不可行等问题,确保数据质量与排名可靠性,工程复杂度极高。
常用场景
经典使用场景
在人工智能评测的广袤领域中,基准测试作为衡量模型能力与安全性的黄金标尺,其有效性却常如雾里看花,难以捉摸。what-ai-benchmarks-actually-measure数据集应运而生,它犹如一面明镜,映照出56项能力与安全基准的真实面貌。此数据集汇聚了53个模型在各项基准上的项目级与基准级得分,其经典使用场景在于运用汇聚效度与区分效度这两种社会科学透镜,系统性地审视基准测试的建构效度。研究者可借此剖析基准所宣称衡量的概念(如推理、拒答)是否与实际测量内容相符,从而在纷繁复杂的评测体系中,拨云见日,洞悉基准测试间错综复杂的相关结构,为AI评测的可靠性与有效性提供实证基石。
衍生相关工作
在学术的传承与创新中,该数据集如同一颗种子,催生了一系列枝繁叶茂的后续研究。其衍生的相关工作首先体现在评测方法的革新上,例如,研究者借鉴其汇聚与区分效度框架,进一步提出了更为精细的基准失效模式分析与重标注检验方法,深化了对特定基准内在结构的理解。其次,该数据集推动了关于LLM评判者效应的探究,启发了针对评分格式如何影响模型排名的系统研究,从而促进了对评测中方法变异来源的重视。此外,它与既有如HELM等评测体系的对话,激发了对跨模型评测稳定性与可迁移性的探讨,并催生了致力于构建标准化、社区贡献的模型得分数据库的努力。这些衍生工作不仅在理论上丰满了评测科学的内涵,也在实践上推动了更严谨的AI基准设计与验证流程的发展。
数据集最近研究
最新研究方向
该数据集从测量学的视角出发,援引社会科学中聚合效度与区分效度的经典方法,系统性地审查了56项AI能力与安全基准对53个模型的实际度量效果。最新研究方向聚焦于基准效度拷问,即通过模型排名相关性与项目反应理论模型,探究各基准是否真正测量了其宣称的构念。研究揭示出安全类基准间的排名相关性普遍薄弱,而能力类基准间的区分度不足,且部分基准的得分模式受任务结构与评分格式的影响更甚于其声称的概念。这一路径为AI评估领域敲响警钟,凸显了基准建构效度在模型开发与治理决策中的核心地位,并呼吁建立更为严谨、可互证的评估框架。
相关研究论文
  • 1
    What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks密歇根大学; 斯坦福大学; 耶鲁大学; 微软研究院; Abridge; 康奈尔科技 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务