遇见数据集

m-a-p/GIEBench

收藏
Hugging Face2024-06-23 更新2024-06-22 收录
官方服务:

资源简介:

GIE-Bench数据集是一个综合性的基准测试,包含11个身份维度,覆盖97个群体身份,总共有999个与特定群体身份相关的单选题。该数据集旨在评估大型语言模型(LLMs)在面对特定群体身份(如性别、年龄、职业和种族)时的共情能力,强调其从特定群体立场回应的能力。数据集通过使用网络资源、手动选择和GPT-4生成有争议的话题,并从这些身份的视角标注态度标签。此外,还使用GPT-4为每个话题生成四个回答,确保只有一个回答符合身份的立场。最后,设计了三种类型的提示(COT-Prompt、ID-Prompt和Raw-Prompt)来测试LLMs选择最合适回答的能力。

GIE-Bench is a comprehensive benchmark that includes 11 identity dimensions, covering 97 group identities with a total of 999 single-choice questions related to specific group identities. The dataset is designed to evaluate the empathy of large language models (LLMs) when presented with specific group identities such as gender, age, occupation, and race, emphasizing their ability to respond from the standpoint of the identified group. The dataset is developed using web resources, manual selection, and GPT-4 to generate controversial topics, each corresponding to a specific identity, and annotates attitude labels from the perspectives of these identities. Additionally, GPT-4 is used to generate four responses for each topic, ensuring that only one response aligns with the identitys stance. Finally, three types of prompts (COT-Prompt, ID-Prompt, and Raw-Prompt) are designed to test LLMs ability to select the most appropriate response.

提供机构:
m-a-p
原始信息汇总

数据集概述

数据集名称

  • GIE-Bench

数据集描述

  • GIEBench 是一个综合基准测试,包含 11 个身份维度,涵盖 97 个群体身份,共有 999 道单选题,涉及特定群体身份,如性别、年龄、职业和种族。该基准旨在评估大型语言模型(LLMs)在面对特定群体身份时的同理心,强调其从所识别群体的立场出发进行回应的能力。

数据集构建过程

  1. 话题开发:通过网络资源、人工筛选和 GPT-4 开发一系列争议话题,每个话题对应一个特定身份。
  2. 态度标签标注:从这些身份的角度对话题进行态度标签标注。
  3. 生成回应:利用 GPT-4 为每个话题生成四个回应,确保只有一个回应符合该身份的立场。
  4. 设计提示类型:使用建立的身份、话题和回应,设计三种类型的提示供 LLMs 选择最合适的回应:
    • COT-Prompt:提供思维链(Chain of Thought, COT)和身份信息。
    • ID-Prompt:仅披露身份信息。
    • Raw-Prompt:不提供额外信息。

分析方法

  • 理解身份立场:通过比较 CoT-Prompt 和 Raw-Prompt 之间的准确性差异,分析 LLMs 对给定身份立场的理解程度。
  • 同理心分析:通过比较 ID-Prompt 和 Raw-Prompt 之间的准确性差异,分析 LLMs 对给定身份立场的同理心。

研究结果

  • 尽管某些 LLMs 能够大致理解用户的身份立场,但在未明确指示考虑用户视角的情况下,它们不会自发地表现出同理心。这凸显了当前对齐技术的不足。
搜集汇总
数据集介绍
构建方式
GIEBench的构建始于利用网络资源、人工筛选与GPT-4辅助,收集一系列具有争议性的话题,每个话题均对应特定的群体身份。随后,从这些身份的视角出发,为话题标注态度标签,确保标签与身份立场一致。借助GPT-4为每个话题生成四个候选回答,其中仅有一个与身份立场相符。基于已确立的身份、话题与回答,设计三种提示类型:COT-Prompt(附带身份信息与思维链)、ID-Prompt(仅披露身份)以及Raw-Prompt(无额外信息),以评估大语言模型(LLMs)在不同信息条件下的表现。
特点
该数据集覆盖11个身份维度、97种群体身份,包含999道单选题,聚焦于性别、年龄、职业、种族等多元身份。其独特之处在于通过对比COT-Prompt与Raw-Prompt的准确率差异,衡量LLMs对给定身份立场的理解程度;通过对比ID-Prompt与Raw-Prompt的准确率差异,评估模型对身份立场的共情能力。实验揭示,尽管部分LLMs能理解用户身份立场,但在未明确指示时缺乏自发共情,凸显当前对齐技术的不足。
使用方法
使用GIEBench时,研究者可加载数据集中的单选问题,通过三种提示范式评估模型。Raw-Prompt作为基线,直接提供问题与选项;ID-Prompt在问题前添加身份描述(如“你是一名女性工程师”);COT-Prompt则进一步包含身份相关的思维链推理。通过计算模型在Raw-Prompt与ID-Prompt、COT-Prompt间的准确率差异,量化其对身份立场的理解与共情能力。该基准适用于测试各类LLMs的对齐效果与身份敏感性。
背景与挑战
背景概述
在大型语言模型(LLMs)日益融入日常交互的背景下,模型对用户身份立场的理解与共情能力成为衡量其社会智能的关键维度。为此,研究团队于近期提出了GIEBench基准数据集,由多个机构联合创建,旨在系统评估LLMs在面对性别、年龄、职业、种族等11个身份维度、涵盖97种群体身份时的共情表现。该数据集包含999道与特定群体身份相关的单选题,通过对比模型在原始提示、身份提示与思维链提示下的回答准确性,揭示模型是否能够自发地从指定群体立场出发做出回应。GIEBench的提出填补了现有基准在身份共情评估方面的空白,为理解当前对齐技术的局限性提供了重要实证基础。
当前挑战
GIEBench所面对的挑战体现在两个层面。首先,核心领域问题在于当前LLMs尽管能够理解用户的身份立场,但缺乏自发共情能力,即仅在明确要求时才会从该立场出发作出回应,暴露出对齐技术的不足。其次,数据集构建过程面临多重困难:需要从网络资源、人工筛选及GPT-4辅助中提炼出富有争议且与身份紧密关联的话题;为每个话题从特定身份视角标注态度标签,确保答案与群体立场一致;设计三类提示模板以区分模型对身份信息的理解与共情表现,并保证实验的可比性与科学性。这些步骤要求精细的语义把控与身份知识,显著增加了数据集的构建复杂度。
常用场景
经典使用场景
GIEBench最经典的使用场景在于评估大语言模型(LLMs)在特定群体身份下的共情能力。该基准涵盖性别、年龄、职业、种族等11个身份维度,共97种群体身份与999道单选题。研究者通过设计三种提示类型——原始提示(Raw-Prompt)、身份提示(ID-Prompt)和思维链提示(CoT-Prompt),系统性地测试模型从指定身份立场出发进行回应的能力,从而揭示模型对群体立场理解与自发共情的差异。
衍生相关工作
GIEBench的发布催生了多项相关研究,包括基于身份立场的数据增强方法、共情驱动的提示工程策略以及多模态共情评估框架。例如,研究者借鉴其身份维度划分,开发了动态身份感知微调技术,使模型能在对话中自适应切换立场。此外,该基准还启发了对LLM公平性与偏见检测的深入探讨,推动了更全面的社会智能评估体系的构建。
数据集最近研究
最新研究方向
在大语言模型伦理与对齐研究领域,GIEBench作为一项综合性基准测试,聚焦于评估模型在多元身份维度下的共情能力。当前前沿方向集中在探索模型如何理解并内化特定群体身份立场(如性别、年龄、职业等),尤其是在争议性话题中的态度一致性。该研究揭示了现有对齐技术的局限性:尽管模型能够识别身份立场,但在缺乏显式指令时,其自发共情反应仍显不足。这一发现与AI伦理治理热点紧密关联,推动学界重新审视模型的社会感知机制与价值对齐策略,对于构建更具包容性与责任感的智能系统具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务