GAMA-Bench
收藏资源简介:
GAMA-Bench是一个性别镜像基准,用于评估大型语言模型在男性和女性演员条件下对相同负面行为是否应用一致的道德、情感和行为框架标准。它包含1,298个实例,涵盖亲密关系冲突和公共社会冲突两个轨道、十个冲突维度和三个严重级别,每个维度通过控制严重级别和修辞风格进行实例化,以比较模型在匹配的不当行为下仅改变演员性别条件时的响应。
GAMA-Bench is a gender mirror benchmark designed to evaluate whether large language models (LLMs) apply consistent moral, emotional, and behavioral framing standards to identical negative behaviors under male and female actor conditions. It contains 1,298 instances covering two tracks: intimate relationship conflict and public social conflict, ten conflict dimensions and three severity levels. Each dimension is instantiated by controlling the severity level and rhetorical style, to compare model responses when only the actor's gender is changed under matched misconduct.
GAMA-Bench 数据集概述
GAMA-Bench 是一个用于评估大语言模型在性别镜像条件下,对相同负面行为是否采用一致的道德、情感和行为框架标准的基准测试集。
基准组成
- 总实例数:包含 1,298 个实例。
- 两大测试轨道:
- 亲密关系轨道 (Intimate Track):涵盖财务控制、隐私侵犯、情感勒索、轻度暴力或身体胁迫、人生道路干涉等场景。
- 公共社交轨道 (Public Track):涵盖诬告、公共空间误解、职场霸凌与功劳窃取、应急资源分配、公共纠纷等场景。
- 结构化维度:每个轨道包含 5 个冲突维度,总计 10 个维度。
- 严重等级:每个维度进一步细分为 3 个严重等级。
- 核心机制:通过在匹配的提示词中仅改变行为主体的性别(男/女),比较模型的回应差异。
主要发现
- 普遍模式:在相同的不当行为背景下,模型对男性行为主体的回应更倾向于惩罚性、纠正性、升级性和责备中心;对女性行为主体的回应则更倾向于治疗性、情境化、缓和性和共情导向。
- 性别差距指标:使用
Δ = 女性主体 - 男性主体来衡量差距,涵盖六个指标:- Puni.(惩罚性措辞)
- Ther.(治疗性措辞)
- Sev.(严重性评级)
- Emp.-Agg.(对侵犯者的共情)
- Instr.(指导性/指责性框架)
- Full-Bl.(完全归咎)
评估模型与关键结果
在 GAMA-Bench 上评估了 10 个代表性大语言模型,以下是部分结果示例:
| 模型 | 轨道 | 关键差距模式 |
|---|---|---|
| GPT-5.4 | 亲密关系 | Δ为负(偏向男性惩罚),例如 Full-Bl. Δ = -22.3 pp |
| Doubao-Seed-2.0-Pro | 亲密关系 | 性别差距最显著,Full-Bl. Δ = -37.4 pp |
| Kimi-2.5 | 亲密关系 | 性别差距相对较小,Full-Bl. Δ = -7.5 pp |
| Qwen3 | 公共社交 | Ther. Δ = +2.45 pp(偏向女性),Full-Bl. Δ = -9.4 pp |
| Kimi-2.5 | 公共社交 | 公共轨道差距最小,Full-Bl. Δ = -1.8 pp |
发布计划
该基准测试集的完整版本正在准备中,将包含:
- 数据集文件
- 提示词模板与镜像构建流程
- 模型回复收集脚本
- 指标计算代码
- 复现指南
引文
如需引用 GAMA-Bench,请参考以下 BibTeX 格式: bibtex @misc{si2026harshermaleevaluatingllms, title={Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios}, author={Guangzong Si and Dong Wang and Zhenhao Li and Yifan Yu and Panwang Pan and Wentao Zhu}, year={2026}, eprint={2606.14068}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2606.14068}, }




