遇见数据集

launch/MCLASH

收藏
Hugging Face2026-07-20 更新2026-06-14 收录
官方服务:

资源简介:

MCLASH是CLASH(基于角色视角的高风险情境下LLM评估)的多语言扩展,是一个包含长篇人工撰写高风险困境的基准,从多个角色视角进行评估。MCLASH将相同的困境和角色视角方法扩展到5种额外语言:西班牙语、印地语、韩语、马来语和中文。该数据集强调文化适应而非直接翻译,每个CLASH场景都经过改编以适应目标语言的文化背景,使用Qwen3-32B进行初始改编并由人工检查。仅涵盖静态角色视角类别(直接、简单对比、受影响的对比),动态(时间价值转移)类别未适配,仅限英语。

MCLASH is the multilingual extension of CLASH (Character perspective-based LLM Assessments in Situations with High-stakes), a benchmark of long-form, human-written high-stakes dilemmas evaluated from multiple character perspectives. MCLASH carries the same dilemmas and character-perspective methodology into 5 additional languages — Spanish, Hindi, Korean, Malay, and Chinese. The dataset emphasizes cultural adaptation rather than direct translation, with each CLASH scenario adapted to fit the cultural context of the target language using Qwen3-32B for initial adaptation and human inspection. It covers only the static character-perspective categories (Straightforward, Simple Contrast, Swayed Contrast), while dynamic (temporal value-shift) categories were not adapted and remain English-only.

提供机构:
launch
搜集汇总
数据集介绍
launch/MCLASH 数据集图片
构建方式
MCLASH是基于CLASH基准的多语言扩展,专为评估大语言模型在高风险道德困境中的角色视角推理能力而设计。其构建过程并非简单地将英文场景翻译为目标语言,而是采用文化适应策略:首先利用Qwen3-32B模型对每个CLASH场景进行初始适配,替换其中具有美国中心色彩的实体(如将“Amazon”替换为韩语语境下的“Naver”或“Kakao”),再由人工审查员仔细检验结果,确保场景在目标语言文化中具有合理性与可比性。数据集覆盖英语、西班牙语、印地语、马来语、韩语和中文六种语言,仅包含CLASH中的静态角色视角类别,而动态价值转变类别则保留为英文独有。
特点
MCLASH的核心特点在于其文化敏感性与多语言覆盖的有机融合。不同于直接翻译带来的文化语境错位,该数据集通过精心设计的文化适应流程,使每个场景在目标语言中仍能保持原有的人际冲突张力和道德挑战本质。数据集包含六种语言共数千个测试样本,每个样本均延续CLASH的高质量人工编写风格,从多个角色视角提供长期、细致的高风险困境描述。此外,其仅聚焦静态角色视角类别,确保了跨语言评估的一致性与可比较性,为研究语言模型在多文化环境下的道德推理能力提供了独特且严谨的基准。
使用方法
MCLASH的使用方式与CLASH类似,主要面向文本分类与文本生成任务。用户可通过HuggingFace Datasets库按语言配置加载数据,例如使用load_dataset('MCLASH', 'English')加载英文子集,或选择'Spanish'、'Hindi'等语言。数据集仅提供测试集,每个子集以CSV文件存储,包含相同的静态角色视角类别(Straightforward、Simple Contrast、Swayed Contrast)。研究人员可基于这些场景,对模型进行多视角的道德判断评估,或生成符合特定角色立场的回应。此外,数据集还附带Values配置(wvs_values.txt),用于关联世界价值观调查中的价值标签,支持更深入的文化维度分析。
背景与挑战
背景概述
MCLASH数据集作为CLASH基准的多语言扩展,由Lee、Kwon等研究人员于2026年提出,旨在评估大语言模型在高风险困境中的道德推理能力。该数据集覆盖英语、西班牙语、印地语、韩语、马来语和中文六种语言,核心研究问题聚焦于跨文化语境下语言模型对多角色视角的道德判断一致性。其创新之处在于通过文化适应而非直接翻译构建样本,引入Qwen3-32B进行初步改编并由人工核验,显著提升了跨语言道德推理基准的文化敏感性。该数据集为比较语言学、道德心理学与人工智能交叉领域提供了重要评估工具,推动了多语言模型在复杂伦理情境中的性能研究。
当前挑战
MCLASH数据集面临的挑战集中于领域问题与构建过程两方面。领域层面,现有道德推理基准多基于单一文化视角(如美国),难以评估模型在不同文化语境下的泛化能力,且静态角色分类(如直接对比、摇摆对比)无法捕捉时间维度上的价值变迁,动态类别(如价值转变)未纳入多语言版本。构建过程中,直接翻译策略会保留源语言文化元素(如美国科技公司名),导致目标语言语境失真;文化适应需人工逐条审核,成本高昂且依赖专家判断,同时跨语言角色视角的语义等价性难以保证,可能引入隐含偏见影响评估公平性。
常用场景
经典使用场景
MCLASH作为多语言道德困境基准数据集,其经典使用场景聚焦于评估大型语言模型在多语言、跨文化情境下的道德推理能力。该数据集精心设计了高风险的道德困境,并引入角色视角的评估范式,要求模型从直接、简单对比及摇摆对比等静态视角出发,对复杂伦理情境做出判断。研究者可借助MCLASH深入探究模型在西班牙语、印地语、韩语、马来语和中文等语言环境中,面对文化适应后的道德挑战时呈现的推理路径与决策偏好,从而系统性地衡量不同语言模型在跨文化道德认知上的表现差异。
衍生相关工作
MCLASH的发布催生了若干重要的衍生研究工作。基于其多语言文化适应方法论,研究者进一步探索了动态价值偏移(如时间性伦理观念变化)对模型判断的影响,尽管MCLASH本身仅聚焦静态视角。此外,该数据集与原始CLASH基准共同构成了系统的评估框架,激励了多项关于文化嵌入对语言模型道德推理影响机制的实证研究。相关工作还包括利用MCLASH数据训练更鲁棒的跨文化道德推理模型,以及结合世界价值观调查(WVS)数据,分析模型输出与不同文化群体真实伦理偏好之间的一致性,推动了多语言AI伦理领域的纵深发展。
数据集最近研究
最新研究方向
MCLASH数据集的前沿研究方向聚焦于多语言道德推理中的文化适应性问题。该数据集超越传统的直接翻译方法,通过对英语高风险困境进行文化适配(如将美国科技公司场景替换为韩国本土的Naver或Kakao),以避免源语言中心偏见。当前研究热点包括利用大型语言模型(如Qwen3-32B)进行初始文化适配并结合人工审查,以构建更真实、文化敏感的道德评估基准。这一工作与AI伦理领域对文化多样性的关注紧密相关,推动了跨语言道德推理模型的发展,其影响在于为多语言AI系统的公平性与可用性提供了更坚实的评估基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务