BenchMIRT-model-statistics
收藏资源简介:
该数据集是BenchMIRT项目的一部分,提供了每个模型的统计信息。BenchMIRT旨在测量大型语言模型(LLM)的潜在安全性和一般推理能力。数据集涵盖了来自16个不同基准测试的分析结果,包括BBH、GPQA、MMLU-Pro、MATH、MuSR、IFEval、BBQ、Do-Anything-Now、HarmBench、StrongReject、ToxiGen、TrustLLM-JailbreakTrigger、WildGuardTest、WildJailbreak、WMDP和XSTest。这些基准测试覆盖了广泛的任务,如推理、知识、指令遵循、偏见、越狱攻击、有害内容检测等。数据仅供基准测试和评估使用,适用于研究和教育目的。请注意,数据中包含的提示和输出可能含有偏见、有毒或有害内容,用户应参考原始来源的许可证信息。
This dataset is part of the BenchMIRT project, providing statistical information for each model. BenchMIRT aims to measure the potential safety and general reasoning capabilities of large language models (LLMs). The dataset covers analysis results from 16 different benchmarks, including BBH, GPQA, MMLU-Pro, MATH, MuSR, IFEval, BBQ, Do-Anything-Now, HarmBench, StrongReject, ToxiGen, TrustLLM-JailbreakTrigger, WildGuardTest, WildJailbreak, WMDP, and XSTest. These benchmarks cover a wide range of tasks such as reasoning, knowledge, instruction following, bias, jailbreak attacks, harmful content detection, etc. The data is only for benchmarking and evaluation purposes, suitable for research and educational use. Note that the prompts and outputs contained in the data may contain biased, toxic, or harmful content, and users should refer to the license information of the original sources.
数据集概述:BenchMIRT-model-statistics
本数据集(allenai/BenchMIRT-model-statistics)是 BenchMIRT 项目的组成部分,旨在为大型语言模型(LLMs)的潜在安全性和通用推理能力提供基准评估数据。
相关规定
- 允许用途:仅限基准测试与评估用途,供科研和教育使用,需遵循 Ai2 的负责任使用准则。
- 内容免责声明:数据可能包含具有偏见、毒性或有害性的提示及输出。这些内容由现有基准和第三方模型生成,其原始来源许可证条款适用,具体来源可参考
Prompt ID、Model ID及元数据。
包含的基准测试来源
数据集中涉及多类开源基准,用于分析模型的推理与安全表现。其主要来源如下:
| 类别 | 基准名称 | 简介 | 数据来源 |
|---|---|---|---|
| 通用推理 | BBH | 评估大规模多任务语言理解与推理 | GitHub: suzgunmirac/BIG-Bench-Hard |
| GPQA | 科学问答与知识推理 | Hugging Face: Idavidrein/gpqa | |
| MMLU-Pro | 专业领域与通用知识理解 | GitHub: TIGER-AI-Lab/MMLU-Pro | |
| MATH | 数学问题求解 | GitHub: hendrycks/math | |
| MuSR | 多步符号推理 | GitHub: Zayne-Sprague/MuSR | |
| IFEval | 指令遵循能力 | GitHub: google-research(instruction_following_eval) | |
| 安全与风险 | BBQ | 偏见风险与公平性评估 | GitHub: nyu-mll/BBQ |
| Do-Anything-Now | 越狱与风险提示测试 | GitHub: verazuo/jailbreak_llms | |
| HarmBench | 有害行为基准 | GitHub: centerforaisafety/HarmBench | |
| StrongReject | 拒绝有害请求的能力 | 文档: strong-reject.readthedocs.io | |
| ToxiGen | 毒性内容检测 | GitHub: microsoft/ToxiGen | |
| TrustLLM-JailbreakTrigger | 越狱触发风险评估 | GitHub: HowieHwong/TrustLLM | |
| WildGuardTest | 安全防护测试 | Hugging Face: allenai/wildguardmix | |
| WildJailbreak | 越狱行为分析 | Hugging Face: allenai/wildjailbreak | |
| WMDP | 恶意知识双向评估 | 官方网站: wmdp.ai | |
| XSTest | 安全性边界测试 | GitHub: paul-rottger/xstest |
数据用途
本数据集主要提供逐模型统计结果,便于研究者横向对比不同LLMs在安全性和推理能力上的表现。分析基于上述多个权威基准进行综合评估,适合用于模型性能评测或安全审计相关研究。




