遇见数据集

llm-council/emotional_application

收藏
Hugging Face2024-07-15 更新2024-06-15 收录
官方服务:

资源简介:

LMC-EA数据集旨在展示如何通过LLM委员会的集体共识来评估基础模型在情感智能等高度主观任务上的表现。数据集包含四个子集:1) test_set_formulation:由20个不同LLM生成的详细故事,描述人际冲突;2) response_collection:20个不同LLM对100个人际冲突的对话响应;3) response_judging:LLM对每个非参考LLM响应与参考LLM响应的成对比较评分;4) response_judging_human:人类对9个LLM和120个随机采样的困境-响应对的成对比较评分。数据集收集于2024年4月和5月,涉及多个LLM提供商和API,并且详细描述了人类评分者的背景和补偿情况。

The LMC-EA dataset is designed to demonstrate how to evaluate foundation models' performance on highly subjective tasks such as emotional intelligence via the collective consensus of an LLM committee. The dataset comprises four subsets: 1) test_set_formulation: Detailed stories depicting interpersonal conflicts generated by 20 distinct LLMs; 2) response_collection: Dialogue responses from 20 distinct LLMs to 100 interpersonal conflict scenarios; 3) response_judging: Pairwise comparison scoring performed by LLMs between each non-reference LLM response and the reference LLM response; 4) response_judging_human: Pairwise comparison scoring conducted by human raters on 120 randomly sampled dilemma-response pairs associated with 9 LLMs; The dataset was collected in April and May 2024, involving multiple LLM providers and APIs, and provides detailed descriptions of the background and compensation information of the human raters.

提供机构:
llm-council
原始信息汇总

LMC-EA 数据集概述

数据集配置

默认配置

  • 特征:
    • emobench_id: 整数类型
    • problem: 字符串类型
    • relationship: 字符串类型
    • scenario: 字符串类型
    • detailed_dilemma: 字符串类型
    • llm_author: 字符串类型
  • 分割:
    • council: 378036 字节, 200 个样本
  • 下载大小: 228230 字节
  • 数据集大小: 378036 字节

响应收集配置

  • 特征:
    • emobench_id: 整数类型
    • problem: 字符串类型
    • relationship: 字符串类型
    • scenario: 字符串类型
    • detailed_dilemma: 字符串类型
    • response_string: 字符串类型
    • llm_responder: 字符串类型
  • 分割:
    • council: 12889489 字节, 4000 个样本
  • 下载大小: 3775450 字节
  • 数据集大小: 12889489 字节

响应评判配置

  • 特征:
    • emobench_id: 整数类型
    • llm_judge: 字符串类型
    • judging_response_string: 字符串类型
    • first_completion_by: 字符串类型
    • second_completion_by: 字符串类型
    • pairwise_choice: 字符串类型
  • 分割:
    • council: 85613515 字节, 76000 个样本
  • 下载大小: 27616919 字节
  • 数据集大小: 85613515 字节

人工响应评判配置

  • 特征:
    • emobench_id: 整数类型
    • question_id: 整数类型
    • annotator_id: 字符串类型
    • response: 字符串类型
    • first_completion_by: 字符串类型
    • second_completion_by: 字符串类型
    • eq: 布尔类型
    • e1: 布尔类型
    • e3: 布尔类型
    • e4: 布尔类型
    • e5: 布尔类型
    • u1: 布尔类型
    • u2: 布尔类型
    • u3: 布尔类型
    • u4: 布尔类型
    • action: 布尔类型
    • clarity: 布尔类型
    • concise: 布尔类型
    • qualitative: 字符串类型
    • winner: 字符串类型
    • consistency: 字符串类型
    • reject: 布尔类型
    • pairwise_choice: 字符串类型
  • 分割:
    • train: 300246 字节, 1343 个样本
  • 下载大小: 41869 字节
  • 数据集大小: 300246 字节

测试集制定配置

  • 特征:
    • emobench_id: 整数类型
    • problem: 字符串类型
    • relationship: 字符串类型
    • scenario: 字符串类型
    • detailed_dilemma: 字符串类型
    • llm_author: 字符串类型
  • 分割:
    • council: 378036 字节, 200 个样本
  • 下载大小: 228230 字节
  • 数据集大小: 378036 字节

数据集组成

  • test_set_formulation: 包含 200 个人际冲突。
  • response_collection: 包含 100 个人际冲突 x 20 个 LLM = 2000 个响应。
  • response_judging: 包含 100 个人际冲突 x 19 个非参考 LLM 响应 x 20 个 LLM 评判 x 2 个位置交换 = 76000 个响应。
  • response_judging_human: 包含 1343 个人类评判。

数据集收集过程

  • LLM 输出通过多种提供者和 API 获取。
  • 对话响应收集使用默认温度,响应评判使用温度 0。

数据集收集时间

  • 数据集在 2024 年 4 月和 5 月收集。
搜集汇总
数据集介绍
构建方式
在情感智能这一高度主观的评估领域,llm-council/emotional_application数据集应运而生,旨在通过多模型共识机制为基座模型提供基准测试。该数据集基于EmoBench的EA数据集进行合成扩展,由20种不同的大型语言模型各自生成200个详细的第一人称人际冲突故事,构成test_set_formulation子集。在此基础上,针对其中100个冲突场景,收集了20种模型生成的对话回应,每个回应长度限制在250词以内,形成response_collection子集。为评估回应质量,采用两轮位置交换的配对比较设计,由每个模型对其他19个模型的回应进行评判,得到response_judging子集。此外,还招募了142名母语为英语的参与者,对9个模型在120个随机冲突-回应对上的表现进行人工评分,构成response_judging_human子集。整个数据集于2024年4月至5月间通过多个API提供商收集,其中回应评判使用温度参数0以确保一致性。
特点
该数据集的核心特色在于其多维度、多视角的评估架构。test_set_formulation子集包含200个由不同模型创作的人际冲突故事,确保了场景的多样性与覆盖广度。response_collection子集则汇聚了2000条来自20种前沿模型的对话回应,涵盖OpenAI、Mistral、Meta、Google、Anthropic等主流体系,体现了模型能力的广泛代表性。尤为突出的是response_judging子集,通过76,000条配对评判数据(100冲突×19非参考模型×20评判模型×2位置交换),有效缓解了位置偏差,构建了稳健的集体共识评估机制。而response_judging_human子集引入的1,343条人工评分,不仅包含胜者选择,还细粒度评估了回应在情商、行动力、清晰度等十个维度的表现,为机器评判提供了宝贵的人类校准基准。数据集规模虽在1K至10K之间,但其设计精巧,兼顾了统计效度与评估深度。
使用方法
用户可通过HuggingFace数据集库便捷加载该资源,数据以config_name参数区分四个子集:test_set_formulation、response_collection、response_judging和response_judging_human。例如,使用`load_dataset('llm-council/emotional_application', 'response_collection')`即可获取模型回应数据。每个子集均包含emobench_id字段以关联原始冲突问题,便于跨子集整合分析。对于response_judging子集,pairwise_choice字段已通过正则表达式和启发式规则提取出精确的配对评级(如A>>B),直接可用于模型排名计算。研究者在进行情感智能评估时,可参考配套的完整排行榜(https://huggingface.co/spaces/llm-council/emotional-intelligence-arena)进行结果可视化与比较。该数据集特别适用于探索大型语言模型在主观任务上的集体智能、人类与机器评判的一致性分析,以及多模型协商机制的优化研究。
背景与挑战
背景概述
在人工智能领域,情感智能作为人机交互的核心维度,长期以来缺乏系统性的评估基准。2024年4月至5月间,由LLM Council研究团队构建的LMC-EA数据集应运而生,旨在通过大规模语言模型(LLM)的集体共识,对基础模型在高度主观的情感认知任务上进行标准化评测。该数据集基于EmoBench框架,由20种不同LLM生成200个详细的人际冲突叙事场景,并收集了2000条对话响应,涵盖GPT-4、Claude-3、Gemini-1.5等主流模型。其核心创新在于引入‘LLM议会’机制,通过76000条成对比较评判和142名人类标注者的验证,为情感智能的自动化评估提供了可复现的量化范式。该工作发表于arXiv,开创性地将主观情感任务纳入大模型基准测试体系,推动了情感计算与自然语言处理的交叉研究。
当前挑战
LMC-EA数据集面临的核心挑战体现于三个层面:首先,情感智能本质上的主观性使得传统客观指标失效,如何通过LLM集体共识达成可靠评判标准成为关键难题,研究中发现不同模型对同一冲突场景的情感理解存在显著分歧。其次,数据构建过程面临质量控制的挑战,200个测试场景虽经多样性筛选,但由20个模型生成的故事扩展可能引入叙事偏差,且响应收集时仅采用默认温度参数,未能全面探索模型输出空间。此外,成对评判的自动提取依赖正则表达式与启发式规则,虽经人工核查仍存在边缘错误案例。最后,人类标注环节虽招募142名母语者,但样本主要集中于英美地区,文化背景的局限性可能影响情感判断的普适性,且标注者平均每对响应仅14人,统计效力有待提升。
常用场景
经典使用场景
在情感计算与人工智能交叉领域,llm-council/emotional_application数据集为评估大语言模型在高度主观任务上的表现提供了基准平台。该数据集以EmoBench为基础,通过20种不同大语言模型对人际冲突场景的合成扩展,构建了200个详尽的困境故事,用于测试模型在情感理解、共情回应及冲突解决方面的能力。研究者可借助该数据集中的response_collection子集,分析模型对人际冲突的对话回应质量,而response_judging子集则通过成对比较与多模型评判,量化不同语言模型在情感智能维度上的相对优势。这一设计使得数据集成为探究模型情感推理深度的理想工具,尤其适用于对比不同架构与训练策略下模型的情感表达能力。
衍生相关工作
该数据集衍生了一系列开创性学术工作,其中最具代表性的是基于LMC-EA的情感智能排行榜(Emotional Intelligence Arena),该排行榜通过众包模型评判动态更新,成为衡量大语言模型情感能力的权威参照。研究者还利用test_set_formulation子集开发了情感困境生成器,探索模型在叙事创作中的情感一致性。response_judging_human中的精细标注维度(如共情、清晰度、行动导向)催生了情感回应质量的多维度评估框架,被后续工作用于改进模型的奖励建模与强化学习策略。此外,数据集的收集方法论——即通过模型委员会共识实现主观任务基准化——已被延伸至伦理决策、创意写作等其他主观性领域,推动了人工智能评估范式的革新。
数据集最近研究
最新研究方向
该数据集聚焦于通过大型语言模型(LLM)构成的“委员会”对情感智能这一高度主观任务进行基准测试,代表了当前AI情感理解与共情能力评估的前沿方向。研究热点在于利用多模型共识替代传统人工标注,通过构建包含200个复杂人际冲突场景的测试集、多模型响应收集及成对比较评判机制,系统性地探究不同LLM在情感困境中的反应质量与一致性。这一方法不仅揭示了如GPT-4o、Claude-3等先进模型在情感推理上的细微差异,还通过引入人类评判子集(含142名参与者),为验证LLM共识与人类感知的契合度提供了关键实证。该数据集的意义在于推动情感AI从简单情绪识别迈向深层社交认知评估,为构建更具共情力的对话系统提供了标准化评测框架,其影响已延伸至人机交互伦理、心理健康辅助等热点领域,成为衡量LLM社会智能的重要标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务