遇见数据集

BenchMIRT-item-statistics

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

该数据集是BenchMIRT项目的一部分,提供每个项目的统计信息,用于测量大型语言模型(LLM)的潜在安全性和一般推理得分。数据仅可用于基准测试和评估,并遵循Ai2负责任使用指南。请注意,数据中包含的提示和输出可能含有偏见、有毒或有害内容,这些内容来源于现有基准测试和第三方模型,其原始许可证条款适用。数据集整合了多个现有基准测试,包括BBH、GPQA、MMLU-Pro、MATH、MuSR、IFEval、BBQ、Do-Anything-Now、HarmBench、StrongReject、ToxiGen、TrustLLM-JailbreakTrigger、WildGuardTest、WildJailbreak、WMDP、XSTest。此数据集适用于研究LLM安全性和推理能力的研究人员,可用于评估和比较不同模型的性能。

This dataset is part of the BenchMIRT project, providing statistical information for each item to measure the potential safety and general reasoning scores of large language models (LLMs). The data is only available for benchmarking and evaluation and follows the Ai2 Responsible Use Guidelines. Please note that the prompts and outputs contained in the data may contain biased, toxic, or harmful content, which originates from existing benchmarks and third-party models, and their original license terms apply. The dataset integrates multiple existing benchmarks, including BBH, GPQA, MMLU-Pro, MATH, MuSR, IFEval, BBQ, Do-Anything-Now, HarmBench, StrongReject, ToxiGen, TrustLLM-JailbreakTrigger, WildGuardTest, WildJailbreak, WMDP, XSTest. This dataset is suitable for researchers studying LLM safety and reasoning capabilities, and can be used to evaluate and compare the performance of different models.

提供机构:
Allen Institute for AI
创建时间:
2026-09-02
原始信息汇总

BenchMIRT-item-statistics 数据集总结

该数据集为 BenchMIRT 项目的逐项统计数据,用于评估大语言模型(LLMs)的潜在安全性与通用推理能力,仅供研究及教育用途,需遵循 Ai2 负责任使用指南。

数据来源涵盖多个现有基准测试及第三方模型,可能包含偏颇、有毒或有害内容。原始基准共 16 项,具体如下:

基准名称 论文 数据来源
BBH arXiv:2210.09261 GitHub 链接
GPQA arXiv:2311.12022 Hugging Face 链接
MMLU-Pro arXiv:2406.01574 GitHub 链接
MATH arXiv:2103.03874 GitHub 链接
MuSR arXiv:2310.16049 GitHub 链接
IFEval arXiv:2311.07911 GitHub 链接
BBQ arXiv:2110.08193 GitHub 链接
Do-Anything-Now arXiv:2308.03825 GitHub 链接
HarmBench arXiv:2402.04249 GitHub 链接
StrongReject arXiv:2402.10260 ReadTheDocs 链接
ToxiGen arXiv:2203.09509 GitHub 链接
TrustLLM-JailbreakTrigger arXiv:2401.05561v2 GitHub 链接
WildGuardTest arXiv:2406.18495 Hugging Face 链接
WildJailbreak arXiv:2406.18510 Hugging Face 链接
WMDP arXiv:2403.03218 官方网站链接
XSTest arXiv:2308.01263 GitHub 链接

特殊说明:GPQA 基准的提示词未在此数据集中复制,仅包含来自 OpenLLM Leaderboard 数据中的文档 ID(doc_id)。所有来源均应遵守原基准的许可条款。

搜集汇总
数据集介绍
BenchMIRT-item-statistics 数据集图片
构建方式
BenchMIRT-item-statistics数据集源自于对大型语言模型潜在安全性与通用推理能力的系统化评估框架。该数据集构建于汇集多个权威基准测试任务的基础上,涵盖BBH、GPQA、MMLU-Pro、MATH、MuSR、IFEval、BBQ、Do-Anything-Now、HarmBench、StrongReject、ToxiGen、TrustLLM-JailbreakTrigger、WildGuardTest、WildJailbreak、WMDP及XSTest等共16个先进基准。项目团队通过统一的任务范式对这些基准中的原始提示词进行模型评估,并逐一记录每个测试项上的模型响应得分。最终将各项的统计结果整合为结构化的元数据,形成该数据集,其构建过程严谨且复用性强,为后续的大规模智能化评估提供了坚实的数据基础。
特点
该数据集的核心特质在于其聚焦于测试项级别的细粒度分析,而非仅提供整体得分。每条记录携带对应的Prompt ID和Model ID,便于精确溯源。数据包含大量来自不同领域的复杂任务,不仅测试模型的知识储备,更侧重于衡量其在面对有害、偏见或越狱性提示时的防御与推理能力。出于安全考量,数据中隐含了可能引发不当内容的提示样本,却为研究模型在极端情况下的行为提供了难得素材。这种高度细分且覆盖安全与推理双重维度的特性,使其成为测评大模型内在风险与性能的独特工具。
使用方法
使用者可借助该数据集开展模型的横向对比研究,通过分析各测试项的得分分布识别特定模型在安全或推理方向上的薄弱环节。同时,统计信息便于研究者探索不同基准间模型的共性表现,进而验证评测手段的效度与区分度。建议结合原始的提示文本和模型输出进行深层次归因分析,但需严格遵循AI2负责任使用指南,仅用于学术与教育目的。数据中的元数据(如来源基准标识)为筛选子集、构建细分评价指标或校准综合安全评分提供了便利,最大化挖掘该资源的科研价值。
背景与挑战
背景概述
BenchMIRT-item-statistics数据集由艾伦人工智能研究所(Ai2)创建,旨在评估大型语言模型(LLMs)的内在安全性与通用推理能力。该数据集诞生于LLMs安全对齐研究迅速发展的时期,整合了BBH、GPQA、MMLU-Pro、MATH等推理基准以及BBQ、HarmBench、ToxiGen等安全基准,通过细粒度的逐项统计,揭示了模型在安全约束下的性能表现。作为BenchMIRT项目的一部分,该数据集不仅为研究者提供了跨基准的对比分析工具,还推动了LLMs评估从单一性能指标向多维安全-能力联合评估的转变,对AI安全领域具有重要的方法论贡献,并促进了负责任的AI发展。
当前挑战
该数据集面临的核心挑战涵盖两个层面。在领域问题上,现有评估往往将安全性与推理能力割裂,缺乏对两者交互的深入探究,BenchMIRT需设计能够同时触发模型推理潜力与安全边界的测试框架。在构建过程中,整合来自多样化来源的基准数据带来了严峻的技术挑战,包括不同基准的格式与评分标准统一、提示词版权与许可证合规性处理(如GPQA提示词无法直接复制)、以及确保数据集不因来源偏见而歪曲模型真实能力的代表性难题。此外,其内在的高风险语义内容要求严格遵循伦理与法律准则,进一步增加了数据处理的复杂度。
常用场景
经典使用场景
BenchMIRT-item-statistics数据集作为大规模语言模型(LLM)安全性与推理能力测评的标准化参照体系,其核心应用场景聚焦于模型行为的细粒度量化分析。该数据集提供多个权威基准(如BBH、GPQA、MATH等)逐题统计量,使研究者能够深入剖析模型在复杂推理、知识整合及安全约束下的表现差异。通过对比模型在不同题目上的得分分布与难度参数,可精准定位能力薄弱环节,为模型迭代优化提供数据驱动的决策依据。此外,该数据集支持跨模型、跨任务的横向对比,有助于揭示模型能力涌现的规律,是构建可靠、可复现的LLM评估协议的重要基础设施。
实际应用
在实际应用中,该数据集为AI系统的安全部署与质量保障提供了关键支撑。开发团队可利用其逐题统计结果构建模型能力仪表盘,实时监测生产环境中模型的行为漂移,及时发现由更新或微调引发的性能退化或安全隐患。同时,该数据助力构建对抗性样本库,用于强化模型的红队测试,提升其对恶意提示的抵御能力。此外,数据集所涵盖的多样化任务类型为智能教育、法律咨询、医疗问答等垂直领域的大模型适配提供了基准参考,帮助企业基于证据选择或定制模型,确保其在真实场景中的可靠性、合规性与用户信任。
衍生相关工作
该数据集催生了一系列开创性后续研究,极大丰富了大模型评估生态。其一,基于题目级难度与区分度参数,研究者开发了自适应测试算法,动态选择最能判定模型能力边界的题目,显著降低评估成本并提升测试效率。其二,该统计信息助力构建能力预测模型,利用题目特征预测模型在各知识子域的表现,为大模型架构设计提供反馈闭环。其三,将安全性题目与推理题目的得分进行关联分析,衍生出“安全-能力”联合优化框架,为对齐训练中的奖励建模与数据采样策略提供新思路。这些衍生工作共同推动了从静态榜单向动态、个性化评估体系的转型,引领了后续安全性基准的设计潮流。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务