Jinesis/gt-harmbench
收藏资源简介:
GT-HarmBench是一个博弈论的AI安全基准测试数据集,旨在评估大型语言模型在现实、基于AI风险的场景中是否能够进行战略推理。每个场景都包含一个2×2的收益矩阵,嵌入在从真实AI风险背景中提取的第一人称叙述中。数据集评估模型的能力包括:识别和玩纳什均衡(个体理性)、选择最大化功利福利(收益总和)的行动、选择最大化罗尔斯福利(最小收益,公平性)的行动、选择最大化纳什社会福利(收益乘积)的行动。数据集包含2,009个场景,19列数据,来源于MIT AI风险数据库,包含6种游戏类型(如囚徒困境、斗鸡、猎鹿游戏、协调游戏、巴赫或斯特拉文斯基游戏、无冲突),并按照风险级别(1-10级)分布,其中风险级别6和7的占比较多。数据集结构包括ID、MIT AI风险数据库事件ID、风险类别、故事叙述、行动标签、收益矩阵和目标列等。数据来源主要是MIT AI风险数据库,经过质量过滤(得分≥8/10)和均衡一致性检查。使用方式包括通过HuggingFace的datasets库加载数据集,以及通过命令行运行基准测试评估模型。
language: - 英语 license: 知识共享署名4.0许可(CC BY 4.0) task_categories: - 问答 - 文本分类 tags: - 博弈论 - AI安全 - 基准测试 - 策略推理 - 纳什均衡(Nash equilibrium) - 社会福利 pretty_name: GT-HarmBench size_categories: - 1000 < n < 10000 # GT-HarmBench **GT-HarmBench**是一款博弈论视角下的AI安全基准测试集,用于评估大语言模型(Large Language Model,LLM)能否在贴合真实AI风险的现实场景中开展策略推理。 每个场景都以第一人称叙事的形式,为两名玩家呈现嵌入了2×2收益矩阵的剧情,剧情取材自真实的AI风险场景。模型将从以下维度接受评估: - 识别并执行**纳什均衡(Nash equilibrium)**(个体理性), - 选择能够最大化**功利主义社会福利**(收益总和)的行动, - 选择能够最大化**罗尔斯主义社会福利**(最小收益,公平性)的行动, - 选择能够最大化**纳什社会福利**(收益乘积)的行动。 ## 数据集概览 | | | |---|---| | 总场景数 | 2,009 | | 字段数 | 19 | | 源自MIT AI风险数据库(MIT AI Risk Database) | 2,009 | | 游戏类型 | 6种 | ### 游戏类型分布 | 游戏类型 | 数量 | |---|---| | 囚徒困境(Prisoner's Dilemma) | 654 | | 斗鸡博弈(Chicken) | 491 | | 猎鹿博弈(Stag hunt) | 403 | | 协调博弈(Coordination) | 252 | | 巴赫或斯特拉文斯基博弈(Bach or Stravinski) | 170 | | 无冲突博弈(No conflict) | 39 | ### 风险等级分布 场景按1-10的严重程度量表进行评级。 | 风险等级 | 数量 | |---|---| | 3 | 8 | | 4 | 139 | | 5 | 144 | | 6 | 673 | | 7 | 771 | | 8 | 177 | | 9 | 89 | | 10 | 8 | ## 数据集结构 ### 字段说明 | 字段 | 描述 | |---|---| | `id` | 整数型行标识符。 | | `ev_id` | MIT AI风险数据库(MIT AI Risk Database)事件ID。合成场景此字段为空。 | | `risk_category` | MIT AI风险数据库(MIT AI Risk Database)的顶级风险类别。合成场景此字段为空。 | | `risk_subcategory` | MIT AI风险数据库(MIT AI Risk Database)的子风险类别。合成场景此字段为空。 | | `description` | MIT AI风险数据库(MIT AI Risk Database)中的原始风险描述。合成场景此字段为空。 | | `formal_game` | 标准游戏类型:可选值为囚徒困境、斗鸡博弈、猎鹿博弈、协调博弈、巴赫或斯特拉文斯基博弈、无冲突博弈。 | | `story_row` | 提供给行玩家的第一人称叙事,描述当前策略场景。 | | `story_col` | 提供给列玩家的第一人称叙事。 | | `actions_row` | 行玩家可选择的两个行动标签的Python列表字符串。 | | `actions_column` | 列玩家可选择的两个行动标签的Python列表字符串。 | | `1_1_payoff` | 两名玩家均选择行动1时的收益向量[行玩家收益,列玩家收益]。 | | `1_2_payoff` | 行玩家选择行动1、列玩家选择行动2时的收益向量[行玩家收益,列玩家收益]。 | | `2_1_payoff` | 行玩家选择行动2、列玩家选择行动1时的收益向量[行玩家收益,列玩家收益]。 | | `2_2_payoff` | 两名玩家均选择行动2时的收益向量[行玩家收益,列玩家收益]。 | | `risk_level` | 底层AI风险的1-10整数严重程度评级。 | | `target_nash_equilibria` | 以竖线分隔的纯策略纳什均衡,格式为(行行动, 列行动)元组。 | | `target_utility_maximizing` | 以竖线分隔的行动组合,可最大化收益总和(功利主义福利)。 | | `target_rawlsian` | 以竖线分隔的行动组合,可最大化最小收益(罗尔斯主义公平性)。 | | `target_nash_social_welfare` | 以竖线分隔的行动组合,可最大化收益乘积(纳什议价解)。 | ### 收益矩阵约定 数据集中的每一行均编码一个2×2博弈。四个收益字段(`1_1_payoff` 至 `2_2_payoff`)均包含一个二元列表`[行玩家收益, 列玩家收益]`。矩阵布局如下: col action 1 col action 2 row action 1 1_1_payoff 1_2_payoff row action 2 2_1_payoff 2_2_payoff ### 目标字段说明 目标字段以竖线分隔的Python元组字符串编码最优行动组合,例如: ('go bold', 'go bold')|('play safe', 'play safe') 当存在平局时会出现多个行动组合。每个元组格式为`(行行动, 列行动)`。 ## 数据来源 1. **MIT AI风险数据库(MIT AI Risk Database)**(`ev_id`非空,共2009条):MIT AI风险库中的风险描述经分类为博弈论场景后,通过大语言模型流水线转化为第一人称策略叙事。 场景在纳入前需通过质量评分(≥8/10)与均衡一致性评分(≥8/10)的筛选。匹配便士博弈(仅存在混合策略,无纯策略纳什均衡)已被排除。 ## 使用方法 python from datasets import load_dataset ds = load_dataset("causalNLP/gt-harmbench") print(ds[0]) ### 运行基准测试 bash # 评估模型 uv run python3 -m eval.eval --model-name openai/gpt-4o --dataset data/gt-harmbench-hf.csv --times 1 --temperature 1.0 --experiment-name my-eval 完整评估工具链请参阅[GitHub仓库](https://github.com/causalNLP/gt-harmbench)。 ## 引用 bibtex @dataset{gt-harmbench, title = {GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory}, year = {2026}, url = {https://huggingface.co/datasets/causalNLP/gt-harmbench} } ## 许可协议 [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)



