Zoe0104/NICE
收藏资源简介:
NICE(Norm, Interaction, Cognition, Experience)是一个基于理论框架的诊断基准,用于评估大型语言模型的社会智能。该基准建立在源自心理测量学原理和专家验证的理论基础之上,将社会智能组织为4个类别、11个维度和34个能力方面,从而支持超越聚合分数的细粒度诊断。
--- license: cc-by-4.0 --- # NICE:面向大语言模型(Large Language Model)社会智能的理论驱动诊断基准 NICE(**规范(Norm)**、**交互(Interaction)**、**认知(Cognition)**、**体验(Experience)**)是一款用于评估大语言模型社会智能的诊断基准。该基准基于心理测量学原理与专家验证构建的理论驱动框架,将社会智能划分为**4大类别**、**11个维度**与**34个能力子维度**,支持超越总分的精细化诊断。 ## 数据集结构 测试集(`test.csv`)包含**137个条目**,均基于典型中国社会场景构建,每个条目对应一个预定义的能力子维度。 | 列名 | 说明 | |--------|-------------| | `Dimension` | 维度编号(1–11) | | `ID` | 唯一条目标识符(例如`1_1`) | | `Context` | 描述场景的社会情境 | | `Question` | 关于恰当社会行为的问题 | | `Opt1` | 候选回复1 | | `Opt2` | 候选回复2 | | `Opt3` | 候选回复3 | > 本次公开发布版本未包含真实标注排序。 该基准包含的11个维度分别为:D1 社会感知、D2 社会理解与洞察、D3 沟通能力、D4 情绪运用、D5 关系管理、D6 自我一致性、D7 观察模仿、D8 适应性学习、D9 社会文化智能、D10 社会责任、D11 道德与伦理智能。 ## 任务格式 每个条目呈现一个情境、一个问题与3个候选回复,这些回复分别从最优、次优与违反社交边界的回复库中采样得到。模型需将3个选项按从优到劣的顺序进行排序。 预测结果为一个3位字符串,用于表示Opt1、Opt2、Opt3的排序顺序。例如: - `231` → Opt2为最优,Opt3为次优,Opt1为最差 - `123` → Opt1为最优,Opt2为次优,Opt3为最差 ## 评估指标 **精确匹配准确率**:仅当预测的完整排序与黄金标注排序完全一致时,该预测才被判定为正确,部分匹配不计分。报告将同时涵盖整体准确率与各维度准确率。 ## 使用方法 python from datasets import load_dataset dataset = load_dataset("Zoe0104/NICE") df = dataset["train"].to_pandas() ## 提交要求 请准备一个包含两列的CSV文件并发送至作者进行评估,格式示例如下: ID,prediction 1_1,231 1_2,123 ...





