MUREL
收藏资源简介:
MUREL是一个精心策划的数据集,包含8520万个token,跨越六个不同的文化,用于评估语言模型的文化能力。该数据集由公共资源构建,并按照Liu等人(2025年)提出的分类法系统组织,涵盖了思想、语言和社会三个主要维度,以实现对文化特定和语言现象的有针对性分析。数据集涵盖了从概念、知识、价值观、规范和道德到人工制品的广泛内容,旨在帮助研究人员更好地理解和分析多语言语言模型中的文化知识编码。
MUREL is a curated dataset containing 85.2 million tokens spanning six distinct cultures, designed to evaluate the cultural competence of language models. Constructed from public resources, this dataset is systematically organized according to the taxonomy proposed by Liu et al. (2025), covering three core dimensions: thought, language, and society, enabling targeted analysis of culture-specific and linguistic phenomena. The dataset covers a wide range of content spanning concepts, knowledge, values, norms, ethics to artifacts, aiming to help researchers better understand and analyze the encoding of cultural knowledge within multilingual language models.
数据集概述
基本信息
- 数据集名称:MUREL (Multilingual Cultural Representation in Language Models)
- 数据规模:85.2 million tokens
- 覆盖文化:6种不同文化(english, german, danish, chinese, russian, persian)
- 覆盖语言:6种语言(en, de, da, zh, ru, fa)
- 关联论文:"Isolating Culture Neurons in Multilingual Large Language Models"
数据集用途
- 用于定位和隔离多语言大语言模型中的文化特定神经元
- 研究文化特定神经元与语言特定神经元的交互作用
- 促进多语言语言模型的公平性、包容性和对齐性研究
数据处理流程
-
数据准备:
- 使用
prepare_language_corpora.py和prepare_culture_corpora.py脚本准备语言和文化语料库 - 输出格式:
data/train/id.{LANG}.train.{mdl}
- 使用
-
激活计算:
- 使用
activation_language_transformers.py和activation_cultural_transformers.py计算语言和文化特定激活
- 使用
-
神经元识别:
- 使用
identify.py识别语言和文化特定神经元 - 生成每种语言和文化的掩码文件
- 使用
-
性能评估:
- 使用
ppl.py评估不同掩码条件下的模型性能 - 包括基线、零语言神经元、零文化神经元、零纯文化神经元和零语言∧文化神经元等条件
- 使用
依赖环境
-
主要工具:
- PyTorch
- Transformers库
- Datasets库
- Accelerate库
-
环境设置:
- 通过
setup.sh脚本设置环境 - 使用pyenv管理Python环境
- 通过
结果分析工具
count_neurons.py:统计神经元数量combine_results.py:合并实验结果plot_all_heatmaps.py:绘制热图可视化结果
支持模型
- Llama-2-7b
- Llama-3.1-8b
- Gemma-3-12b
- Qwen2.5-7b

- 1Isolating Culture Neurons in Multilingual Large Language ModelsUniversity of Tehran · 2025年



