遇见数据集

GAMA-Bench

收藏
github2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

GAMA-Bench是一个性别镜像基准,用于评估大型语言模型在男性和女性演员条件下对相同负面行为是否应用一致的道德、情感和行为框架标准。它包含1,298个实例,涵盖亲密关系冲突和公共社会冲突两个轨道、十个冲突维度和三个严重级别,每个维度通过控制严重级别和修辞风格进行实例化,以比较模型在匹配的不当行为下仅改变演员性别条件时的响应。

GAMA-Bench is a gender mirror benchmark designed to evaluate whether large language models (LLMs) apply consistent moral, emotional, and behavioral framing standards to identical negative behaviors under male and female actor conditions. It contains 1,298 instances covering two tracks: intimate relationship conflict and public social conflict, ten conflict dimensions and three severity levels. Each dimension is instantiated by controlling the severity level and rhetorical style, to compare model responses when only the actor's gender is changed under matched misconduct.

创建时间:
2026-06-06
原始信息汇总

GAMA-Bench 数据集概述

GAMA-Bench 是一个用于评估大语言模型在性别镜像条件下,对相同负面行为是否采用一致的道德、情感和行为框架标准的基准测试集。

基准组成

  • 总实例数:包含 1,298 个实例。
  • 两大测试轨道
    • 亲密关系轨道 (Intimate Track):涵盖财务控制、隐私侵犯、情感勒索、轻度暴力或身体胁迫、人生道路干涉等场景。
    • 公共社交轨道 (Public Track):涵盖诬告、公共空间误解、职场霸凌与功劳窃取、应急资源分配、公共纠纷等场景。
  • 结构化维度:每个轨道包含 5 个冲突维度,总计 10 个维度。
  • 严重等级:每个维度进一步细分为 3 个严重等级。
  • 核心机制:通过在匹配的提示词中仅改变行为主体的性别(男/女),比较模型的回应差异。

主要发现

  • 普遍模式:在相同的不当行为背景下,模型对男性行为主体的回应更倾向于惩罚性、纠正性、升级性和责备中心;对女性行为主体的回应则更倾向于治疗性、情境化、缓和性和共情导向。
  • 性别差距指标:使用 Δ = 女性主体 - 男性主体 来衡量差距,涵盖六个指标:
    • Puni.(惩罚性措辞)
    • Ther.(治疗性措辞)
    • Sev.(严重性评级)
    • Emp.-Agg.(对侵犯者的共情)
    • Instr.(指导性/指责性框架)
    • Full-Bl.(完全归咎)

评估模型与关键结果

在 GAMA-Bench 上评估了 10 个代表性大语言模型,以下是部分结果示例:

模型 轨道 关键差距模式
GPT-5.4 亲密关系 Δ为负(偏向男性惩罚),例如 Full-Bl. Δ = -22.3 pp
Doubao-Seed-2.0-Pro 亲密关系 性别差距最显著,Full-Bl. Δ = -37.4 pp
Kimi-2.5 亲密关系 性别差距相对较小,Full-Bl. Δ = -7.5 pp
Qwen3 公共社交 Ther. Δ = +2.45 pp(偏向女性),Full-Bl. Δ = -9.4 pp
Kimi-2.5 公共社交 公共轨道差距最小,Full-Bl. Δ = -1.8 pp

发布计划

该基准测试集的完整版本正在准备中,将包含:

  • 数据集文件
  • 提示词模板与镜像构建流程
  • 模型回复收集脚本
  • 指标计算代码
  • 复现指南

引文

如需引用 GAMA-Bench,请参考以下 BibTeX 格式: bibtex @misc{si2026harshermaleevaluatingllms, title={Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios}, author={Guangzong Si and Dong Wang and Zhenhao Li and Yifan Yu and Panwang Pan and Wentao Zhu}, year={2026}, eprint={2606.14068}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2606.14068}, }

搜集汇总
数据集介绍
GAMA-Bench 数据集图片
构建方式
GAMA-Bench的构建根植于对社会认知中性别不对称现象的深刻洞察,旨在系统性地探究大语言模型在面对相同负面行为时,是否会因行为主体性别的不同而展现出差异化的道德、情感和行为框架标准。该基准包含两个核心轨道:亲密关系冲突与公共社会冲突。亲密轨道涵盖了经济控制、隐私侵犯、情感勒索、轻度暴力或身体胁迫以及人生道路干预五个维度;公共轨道则囊括了虚假指控、公共空间误解、职场功劳窃取与欺凌、紧急资源分配及公共争执五大场景。每个维度均被细化为不同的严重等级和修辞风格,通过严格的行为主体性别对照实验设计,确保了在仅改变行为人性别条件的前提下,能够准确评估模型反应的差异。
使用方法
GAMA-Bench的使用流程明确而结构化。研究者首先从基准中获取配对好的男性与女性行为主体提示实例,利用提供的提示模板和镜像构建管线,调用模型收集响应。随后,基于涵盖惩罚性语气、治疗性语气、严重等级评分、对攻击者共情、指示性指控框架及完全归责等六项指标的计算代码,对模型输出进行量化分析。通过计算男性与女性条件下的指标差异(Δ = 女性条件 − 男性条件),能够直观地识别模型在不同冲突场景和严重等级下的性别偏见模式。完整的复制指南和数据集文件将使研究者得以独立验证和拓展本研究的发现。
背景与挑战
背景概述
GAMA-Bench是由Guangzong Si、Dong Wang等研究者在2026年提出的一个面向大语言模型性别镜像公平性的基准测评数据集。随着大语言模型在社会交互中的广泛应用,其在道德判断、情感归因与行为框架上是否存在基于性别的偏见,逐渐成为人工智能伦理领域的核心关切。该数据集通过构建1,298个严格镜像的冲突场景,涵盖亲密关系冲突与公共社会冲突两类情境,系统性地评估不同模型在面对相同不当行为时,因行为者性别不同而产生的回应差异。GAMA-Bench的提出为揭示大语言模型在性别维度上的隐性偏倚提供了可靠工具,对推动公平、无歧视人工智能系统的发展具有重要影响力。
当前挑战
GAMA-Bench所解决的领域核心挑战在于,现有评估体系鲜有聚焦于相同不当行为因行为者性别不同而引发模型迥异响应的现象,即模型在道德框架与情感策略上呈现的系统性性别不对称。构建过程中的挑战主要体现在三个方面:首先,需要设计十个冲突维度并对应三个严重级别,确保每个场景在保持行为内容一致的前提下仅改变行为者性别,这对场景描述与措辞控制提出了极高要求。其次,为全面捕捉模型偏倚,数据集设计了六种评价指标,包括惩罚性措辞、治疗性措辞、严重性评级、对攻击者的共情以及全责备归因等,这些指标的量化与校准难度较大。此外,在维持亲密与公共两条轨道的场景多样性与跨领域迁移性之间取得平衡,也是数据集构建中的显著困难。
常用场景
经典使用场景
在自然语言处理与计算伦理学交叉领域,GAMA-Bench被广泛用于评测大语言模型在面对相同负面行为时,是否因行为主体性别差异而呈现不一致的道德、情感与行为框架。该基准通过构建亲密关系冲突与公共社会冲突两大轨道,涵盖财务控制、隐私侵犯、情感勒索、职场霸凌等十个冲突维度,并严格匹配除演员性别外的所有上下文变量。研究者在控制严重程度与修辞风格后,利用1,298个镜像实例评估模型输出在惩罚性、治疗性、严重性评级、对攻击者共情、指令性框架及完全归责六个关键指标上的性别差距,从而系统揭示模型隐含的性别偏见倾向。
解决学术问题
GAMA-Bench直面大语言模型在道德评判中存在的性别不对称框架这一核心学术问题。过往研究多聚焦于显性偏见,而该基准通过精巧的镜像设计,从行为与框架分离的角度揭示了模型对相同负面行为因主体性别不同而施加不同道德推理标准的深层现象。实验表明,主流模型普遍对男性行为人施加更多惩罚性、指责性和升级性框架,对女性行为人则倾向于使用治疗性、情境化和共情性语言。这一发现不仅为AI公平性研究提供了可重复的量化评估工具,更推动了学界对算法中隐性性别刻板印象的系统性认识,其研究范式已引发生成式AI伦理审计领域的重要范式转变。
实际应用
在AI系统部署的前沿实践中,GAMA-Bench的应用场景遍布智能内容审核、自动化心理咨询和公共服务机器人等敏感领域。内容审核平台可借助该基准评估其推荐算法与违规判断机制是否对不同性别的用户行为存在差异化处理,从而修正可能加剧社会不平等的算法偏差。在心理健康支持对话系统中,开发团队利用GAMA-Bench的亲密轨情景验证模型在处理家庭冲突、情感勒索等议题时的共情分配是否均衡,避免无意中强化性别化的应对模板。该类应用确保了AI决策在司法辅助、社会服务分配等关键环节中的公平性与道德一致性,切实提升了技术系统的社会可信度。
数据集最近研究
最新研究方向
在人工智能伦理与公平性研究领域,大语言模型在道德判断与情感回应中潜藏的性别偏见已成为前沿焦点。GAMA-Bench作为一项创新性的性别镜像基准,针对当前大语言模型在相同负面行为下,因行为主体性别不同而呈现出截然不同的道德、情感与行为归因框架这一隐性问题,提供了系统性的评估工具。该基准覆盖亲密关系冲突与公共社会冲突两大维度,涵盖经济控制、隐私侵犯、职场霸凌等十类常见争议场景,并通过精细化的严重程度与修辞风格控制,揭示了模型在男性与女性行为主体条件之间存在的系统性差距。实验表明,主流大语言模型在面对相同的不当行为时,对男性角色倾向采取更严厉的惩罚性、指责性回应,而对女性角色则表现出更多的治疗性、情境化与共情导向的语言框架。这一发现不仅凸显了当前模型在性别公平性方面的深层缺陷,也为构建更加公正、中立的AI系统提供了重要的评测标准与改进方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务