遇见数据集

CHARM

收藏
arXiv2026-09-01 更新2026-09-03 收录
数据链接:
官方服务:

资源简介:

CHARM是一个多文化角色扮演基准数据集,由成均馆大学和Adobe研究院联合创建,涵盖40个来自五个文化语言区域(英语、西班牙、中国、韩国、印度尼西亚)的真实与虚构角色。数据集包含680个边界意识问题、1332个边界遵循问题和736个知识验证问题,总计2748个多选题,所有问题均采用弃权选项并经过本土审校员验证。数据通过构建时间边界(历史人物不应知晓现代概念)和跨宇宙边界(角色不应知晓其叙事宇宙外的实体)两类问题,分别评估模型对边界的识别与遵循能力。该数据集旨在诊断大语言模型在角色扮演中的知识边界违反问题,揭示角色幻觉主要源于遵循失败而非认知缺失,并系统分析文化差异对模型行为的影响。

CHARM is a multilingual cultural role-playing benchmark dataset co-created by Sungkyunkwan University and Adobe Research. It covers 40 real and fictional characters from five cultural and linguistic regions: English-speaking, Spanish-speaking, Chinese, South Korean, and Indonesian. The dataset contains 680 boundary-awareness questions, 1,332 boundary-following questions, and 736 knowledge validation questions, totaling 2,748 multiple-choice questions. All questions include an abstention option and have been verified by native reviewers. Two types of questions are constructed to respectively evaluate models' capabilities of boundary recognition and boundary adherence: temporal boundaries (e.g., historical figures should not be aware of modern concepts) and cross-universe boundaries (e.g., characters should not be aware of entities outside their narrative universe). This benchmark aims to diagnose knowledge boundary violations of large language models (LLMs) during role-playing, reveal that role hallucinations mainly stem from adherence failures rather than cognitive deficits, and systematically analyze the impact of cultural differences on model behavior.

创建时间:
2026-09-01
原始信息汇总

CHARM 数据集详情

一、数据集简介

CHARM(Character Hallucination for Multicultural Role-Play Benchmark)是一个用于诊断角色扮演语言模型中角色幻觉问题的多文化基准数据集。该数据集将模型能力拆分为两个独立维度进行评估:

  • 边界感知(Boundary-Awareness, BA)——模型是否知道某条信息超出其角色的知识边界。
  • 边界遵从(Boundary-Compliance, BC)——模型是否基于该感知采取正确行为(如拒绝回答或适当回避),而非在角色内产生幻觉。

该数据集覆盖5个文化语言区域中的40个角色,评测范围包括6个大型语言模型(涵盖闭源与开源模型)。相关论文已被 EMNLP 2026 Findings 接收(将于 EMNLP 2026 布达佩斯会议展示)。


二、数据内容

基准数据存放于 data/CHARM/source_data/ 目录下。每个角色沿两个维度进行探测,评估过程将**感知(awareness)行为(behavior)**区分开。数据类型包括:

  • 多项选择感知探测数据(*_mc.json*_awareness_binary.json
  • 行为/遵从数据(2stage_dataset_refusable.json
  • 覆盖五个区域的辅助问答(QA)及选项文件

评测数据集样例data/CHARM/source_data/test_data_check_fin/2stage_dataset_refusable.json


三、评测模型

数据集评测了6个大型语言模型,涵盖闭源与开源两类:

类型 模型
闭源 GPT-4o
闭源 GPT-5.5
闭源 Gemini-3.5-flash
开源 Llama-3.1-8B-Instruct
开源 Gemma-3-12B-IT
开源 Qwen3-8B

开源模型通过 vLLM 在本地提供服务,模型路由配置位于 src/evaluation/2stepMethod/config.py


四、数据集构建流程

数据集构建流程存放于 src/construction/ 下,采用 2stepMethod 方法。该步骤为可选操作(数据已直接提供),可通过运行 bash src/construction/run_all_construction_sample.sh 执行完整构建流程。


五、评估方法与使用

1. 两阶段评估流程(BA → BC)

对单个模型/任务运行:

bash python src/evaluation/2stepMethod/2stage_run_experiment.py --model gpt-4o --task awareness --data data/CHARM/source_data/test_data_check_fin/2stage_dataset_refusable.json

或跨全部模型与任务运行完整批量测试:

bash bash src/evaluation/2stepMethod/2stage_run_all.sh

2. 结果分析

bash python src/evaluation/2stepMethod/2stage_analyze_results.py python src/evaluation/2stepMethod/2stage_analyze_by_culture.py

3. 辅助实验

仓库中还包含心智理论(Theory-of-Mind)补充实验,代码位于 src/evaluation/tom_experiment/


六、许可证

  • 代码:MIT License
  • 数据:CC BY 4.0
搜集汇总
数据集介绍
CHARM 数据集图片
构建方式
CHARM基准的构建旨在系统性地诊断角色扮演大语言模型中的角色幻觉现象。为确保文化多样性与代表性,研究者从英语(美/英)、西班牙、中国、韩国和印度尼西亚五个文化语言区域精心挑选了40个真实与虚构角色,涵盖历史与现代时期,并经由各区域本土评审者严格验证。基准聚焦于两类知识边界:时间边界(历史角色不应知晓现代概念)与跨宇宙边界(角色不应掌握其叙事或历史宇宙之外的实体知识)。针对每条边界,构建了成对的两阶段问题:边界意识阶段采用二元是/非提问,直接考察模型是否明确识别查询超出角色知识范围;边界遵从阶段则采用允许弃权的五选一选择题,正确答案为弃权选项,用以考察模型在实际作答时是否克制自身。此外,为验证参数化覆盖现象,额外构建了知识验证问题,通过切换角色身份询问事实性内容,以确认模型是否在参数中存储了相关事实。全部数据包含680道意识题、1332道遵从题及736道验证题,经双重本土评审者验证并计算一致性指标,确保了内容的准确性与文化适当性。
特点
CHARM基准的核心特色在于其解耦式两阶段评估框架,区别于传统仅关注输出结果的幻觉检测方法。该基准通过边界意识与边界遵从的独立测量,构建了一个二维诊断矩阵,能够精确区分角色幻觉的四种亚型:一致行为、合规缺口、偶然拒答与识别失败。这一设计揭示了幻觉产生的本质——模型经常能够正确认知知识边界,却在实际作答时未能抑制越界知识,即合规失败而非意识缺失。基准还创新性地引入参数化覆盖验证机制,通过角色转换与知识验证问题的配合,确认了大量合规缺口案例源于模型参数中存储的事实无法在角色约束下被抑制,而非随机猜测。此外,CHARM的多文化角色设置突显了不同区域角色在幻觉模式上的系统性差异,西方角色(如英语区与西班牙区)展现出更高的合规缺口率,反映了模型知识库中文化表征的不均衡性。
使用方法
使用CHARM基准时,研究者需遵循标准化的两阶段评估协议。在边界意识阶段,模型被赋予指定角色,回答关于现代概念或外部实体的二元是/非问题,正确响应为“否”。在边界遵从阶段,模型需以该角色身份回答五选一选择题,其中正确选项为弃权表述,其余四项为精心构造的干扰项。两项评估采用独立运行设置,避免上下文中先前回答对后续行为的干扰,从而保守估计真实的合规能力。对于跨宇宙问题,研究者还可执行参数化覆盖验证流程:先确认模型边界意识正确,再检查其在遵从题中是否选择了事实正确的非弃权选项,最后以目标角色身份询问同一事实性问题,三重条件符合即判定为参数化覆盖案例。评估结果可按照二维矩阵计算合规缺口率与识别失败率,亦可按文化区域划分子集分析文化差异性。该基准支持对大语言模型进行系统性诊断,为改进角色扮演模型的约束感知解码或微调策略提供实证依据。
背景与挑战
背景概述
CHARM基准由成均馆大学与Adobe Research的研究人员于2026年提出,旨在系统评估角色扮演大语言模型(LLM)中的角色幻觉现象。该基准覆盖五个文化语言区域中的40个真实与虚构角色,重点关注时间边界与跨宇宙边界两大知识边界类型。研究核心在于区分模型无法识别知识边界与虽识别但未能恪守的两种失败模式,通过两阶段评估框架分别衡量边界意识与边界遵循。CHARM的构建填补了现有评估集中于西方角色且未细化失败原因的空白,其蕴含的文化多样性与诊断性框架为角色扮演系统提供了全新评测维度,对提升跨文化背景下模型角色一致性具有重要推动作用。
当前挑战
CHARM基准所面临的核心挑战涵盖双重维度:在领域问题层面,现有角色幻觉检测方法鲜少剖析模型究竟是未能识别还是识而不守,且角色样本多集中于西方,忽视了文化差异对知识边界遵循的系统性影响;在构建过程中,数据集需兼顾40个角色的文化多样性与认知代表性,由来自五区域的本土评审验证内容准确性及干扰项合理性,涉及细致的文化敏感性把控与语义区分度评估,同时须设计出既稳健又具备诊断力的两阶段评估体系,以精准分离意识与遵从的差异,并验证参数覆盖等认知机制,构建难度显著。
常用场景
经典使用场景
CHARM作为一项多文化基准测试,其核心用途在于系统性地评估角色扮演大语言模型在知识边界上的表现。它巧妙地将角色幻觉划分为时间边界与跨宇宙边界两种类型,并运用支持弃权的多项选择题,从边界认知与边界遵从两个维度剖析模型的错误根源。该基准覆盖五个文化语言区域的四十个角色,为跨文化模型行为差异研究提供了严谨且可复现的评测平台。
衍生相关工作
CHARM的发布为角色扮演与知识边界研究开辟了新的探索路径。其两阶段诊断框架及参数性覆盖验证方法可直接被衍生工作采用,例如发展开放式交互评估协议、构建动态知识边界探测任务或设计文化感知的遵从性优化算法。此外,该基准所揭示的文化区域差异现象,亦有望催生针对非西方角色知识表征平衡性的专门研究,推动相关评测资源向更广阔的文化版图延展。
数据集最近研究
最新研究方向
CHARM基准的提出标志着角色扮演大语言模型幻觉评估从结果导向向诊断导向的范式转变。其前沿研究方向聚焦于解耦知识边界意识与边界遵从,通过精细化的两阶段评估框架揭示模型在角色约束下产生越界回答的深层机制。研究创新性地引入跨文化与跨宇宙双重边界类型,覆盖五大文化语言区,突破了既有评测集中于西方角色的局限。实验表明,角色幻觉主要源于服从失败而非识别失败,并经参数覆盖验证确认了模型虽具备相关知识却未能有效抑制的认知失调现象。该工作不仅为多文化角色扮演智能体的可信赖性提供了系统化评测工具,更为后续开发角色条件化遵从干预策略奠定了方法论基础,对构建具有文化敏感性和认知边界的对话系统具有重要推动意义。
相关研究论文
  • 1
    CHARM: Character Hallucination for Multicultural Role Play Benchmark成均馆大学; Adobe研究院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务