遇见数据集

BenchMIRT-model-statistics

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

该数据集是BenchMIRT项目的一部分,提供了每个模型的统计信息。BenchMIRT旨在测量大型语言模型(LLM)的潜在安全性和一般推理能力。数据集涵盖了来自16个不同基准测试的分析结果,包括BBH、GPQA、MMLU-Pro、MATH、MuSR、IFEval、BBQ、Do-Anything-Now、HarmBench、StrongReject、ToxiGen、TrustLLM-JailbreakTrigger、WildGuardTest、WildJailbreak、WMDP和XSTest。这些基准测试覆盖了广泛的任务,如推理、知识、指令遵循、偏见、越狱攻击、有害内容检测等。数据仅供基准测试和评估使用,适用于研究和教育目的。请注意,数据中包含的提示和输出可能含有偏见、有毒或有害内容,用户应参考原始来源的许可证信息。

This dataset is part of the BenchMIRT project, providing statistical information for each model. BenchMIRT aims to measure the potential safety and general reasoning capabilities of large language models (LLMs). The dataset covers analysis results from 16 different benchmarks, including BBH, GPQA, MMLU-Pro, MATH, MuSR, IFEval, BBQ, Do-Anything-Now, HarmBench, StrongReject, ToxiGen, TrustLLM-JailbreakTrigger, WildGuardTest, WildJailbreak, WMDP, and XSTest. These benchmarks cover a wide range of tasks such as reasoning, knowledge, instruction following, bias, jailbreak attacks, harmful content detection, etc. The data is only for benchmarking and evaluation purposes, suitable for research and educational use. Note that the prompts and outputs contained in the data may contain biased, toxic, or harmful content, and users should refer to the license information of the original sources.

提供机构:
Allen Institute for AI
创建时间:
2026-09-02
原始信息汇总

数据集概述:BenchMIRT-model-statistics

本数据集(allenai/BenchMIRT-model-statistics)是 BenchMIRT 项目的组成部分,旨在为大型语言模型(LLMs)的潜在安全性和通用推理能力提供基准评估数据。

相关规定

  • 允许用途:仅限基准测试与评估用途,供科研和教育使用,需遵循 Ai2 的负责任使用准则。
  • 内容免责声明:数据可能包含具有偏见、毒性或有害性的提示及输出。这些内容由现有基准和第三方模型生成,其原始来源许可证条款适用,具体来源可参考 Prompt IDModel ID 及元数据。

包含的基准测试来源

数据集中涉及多类开源基准,用于分析模型的推理与安全表现。其主要来源如下:

类别 基准名称 简介 数据来源
通用推理 BBH 评估大规模多任务语言理解与推理 GitHub: suzgunmirac/BIG-Bench-Hard
GPQA 科学问答与知识推理 Hugging Face: Idavidrein/gpqa
MMLU-Pro 专业领域与通用知识理解 GitHub: TIGER-AI-Lab/MMLU-Pro
MATH 数学问题求解 GitHub: hendrycks/math
MuSR 多步符号推理 GitHub: Zayne-Sprague/MuSR
IFEval 指令遵循能力 GitHub: google-research(instruction_following_eval)
安全与风险 BBQ 偏见风险与公平性评估 GitHub: nyu-mll/BBQ
Do-Anything-Now 越狱与风险提示测试 GitHub: verazuo/jailbreak_llms
HarmBench 有害行为基准 GitHub: centerforaisafety/HarmBench
StrongReject 拒绝有害请求的能力 文档: strong-reject.readthedocs.io
ToxiGen 毒性内容检测 GitHub: microsoft/ToxiGen
TrustLLM-JailbreakTrigger 越狱触发风险评估 GitHub: HowieHwong/TrustLLM
WildGuardTest 安全防护测试 Hugging Face: allenai/wildguardmix
WildJailbreak 越狱行为分析 Hugging Face: allenai/wildjailbreak
WMDP 恶意知识双向评估 官方网站: wmdp.ai
XSTest 安全性边界测试 GitHub: paul-rottger/xstest

数据用途

本数据集主要提供逐模型统计结果,便于研究者横向对比不同LLMs在安全性和推理能力上的表现。分析基于上述多个权威基准进行综合评估,适合用于模型性能评测或安全审计相关研究。

搜集汇总
数据集介绍
BenchMIRT-model-statistics 数据集图片
构建方式
BenchMIRT-model-statistics数据集是在大语言模型(LLM)安全性与推理能力评估背景下构建的,旨在提供模型在多种基准测试上的逐模型统计量。构建过程整合了多个公开基准,如BBH、GPQA、MMLU-Pro、MATH等用于推理能力测试,以及BBQ、HarmBench、StrongReject、ToxiGen等用于安全性测试。数据由Prompt ID、Model ID和元数据关联至原始来源,并遵循Ai2负责任使用指南。统计量通过运行现有基准和第三方模型生成,涵盖提示和输出,尽管这些内容可能包含偏见或有害信息,但仅供基准评估和学术研究使用。
特点
该数据集的核心特点在于其综合性和可追溯性。它汇集了16个多样化基准,跨越推理(如BBH、GPQA)与安全(如Jailbreak、ToxiGen)两大维度,为评估LLM的潜在安全性和通用推理能力提供了多角度统计。每条记录均关联原始基准的论文与数据源,支持深度溯源,同时遵循许可条款。数据集明确标示可能包含的敏感内容,确保使用者伦理合规。此外,作为BenchMIRT项目的一部分,它提供模型统计而非原始文本,便于聚焦性能对比与趋势分析,降低了处理敏感数据的负担。
使用方法
使用本数据集时,研究者应首先通过Prompt ID和Model ID识别具体模型与测试项,依据元数据追溯原始基准以获取完整上下文。在评估中,可统计分析不同模型在安全性(如HarmBench、StrongReject得分)与推理(如BBH、MATH准确率)上的表现,进行横向或纵向比较。数据仅供研究和教育用途,使用时需遵循Ai2负责任使用指南及原始数据源许可。对于包含有害内容的提示和输出,建议在研究报告中谨慎引用,并采取脱敏或过滤措施,以符合伦理标准。通过标准化统计,可便捷地复现BenchMIRT项目中的结论或扩展至新模型。
背景与挑战
背景概述
BenchMIRT-model-statistics数据集由艾伦人工智能研究所(Ai2)创建,旨在系统评估大型语言模型(LLMs)的潜在安全性与通用推理能力。随着LLMs在真实世界中的广泛应用,模型的安全对齐与推理鲁棒性成为亟需解决的关键问题。该数据集汇集了16个权威基准测试(如BBH、GPQA、MMLU-Pro、MATH、MuSR、IFEval等)的模型级统计结果,核心研究问题在于通过多维度基准的联合分析,揭示模型在不同任务上的性能差异及其与安全指标的关联。该数据集为模型开发者提供了标准化的评估工具,助力于识别模型弱点、优化训练策略,对提升LLMs的可靠性和可信度具有重要影响力。
当前挑战
该数据集面临多重挑战。领域层面,通用推理与安全评估的基准设计本身存在难度,例如如何确保基准间维度正交以避免冗余,以及如何准确量化“潜在”安全风险而不受显式攻击测试的局限。构建过程中,整合多个来源的基准(涵盖不同许可协议与数据格式)需要解决兼容性问题,同时需处理部分基准(如WMDP)的敏感内容,确保符合伦理与合规要求。此外,模型输出的毒性或有害内容可能影响统计结果的客观性,需借助元数据追溯与过滤机制。最后,跨模型比较时,计算资源与评估成本的平衡也是一大挑战。
常用场景
经典使用场景
BenchMIRT-model-statistics数据集是基准评测领域的宝贵资源,旨在量化大型语言模型(LLMs)的潜在安全性与通用推理能力。该数据集涵盖了从BBH、GPQA、MMLU-Pro到MATH、MuSR等多项主流推理基准的模型级统计信息,并整合了如HarmBench、StrongReject、ToxiGen等安全评测基准的数据。其核心使用场景为对LLMs进行全面的性能剖析,研究者可依据模型ID和基准类别,便捷地提取各模型在推理、知识掌握、指令遵循及安全拒答等维度的细致指标,从而构建多维度的能力对比分析框架。
解决学术问题
该数据集有效解决了学术界在评估LLMs时面临的关键难题:即缺乏统一的、涵盖多维度(安全与推理)的模型性能基准。传统评测往往割裂于特定任务,难以综合反映模型在潜在有害内容上的拒答能力与在复杂逻辑推理中的表现。BenchMIRT-model-statistics通过提供一个标准化、汇聚多源基准统计的数据集,使得研究者能够剖析模型的安全性与推理能力之间是否存在权衡(trade-off),进而探讨不同训练范式对模型综合素养的影响。这不仅提升了评测的全面性与可靠性,也为安全对齐研究提供了大规模实证基础。
衍生相关工作
围绕BenchMIRT-model-statistics所衍生的经典工作主要体现在对LLM评测方法的深化与拓展。一方面,研究者基于该数据集的基础统计,发展了融合多维指标的综合评分体系,如加权调和平均或基于风险收益权衡的模型排序算法,催生了诸如安全-能力帕累托前沿分析的研究。另一方面,数据集的发布促进了对不同安全基准间的一致性与互补性的元评测,推动了如安全对齐评估理论框架的构建。此外,它激发了若干后续研究,例如利用模型统计信息训练代理模型来预测未知新基准的性能,从而减少评测成本。这些衍生工作共同推进了LLM评测向着更系统化、更具洞察力的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务