MSQA
收藏资源简介:
MSQA(多语言与跨文化问答)是一个基准数据集,包含1,064个原生问题,旨在评估大语言模型是否具备真实、本地化的文化知识,而非仅表面上的文化流利度。所有问题均直接来源于11种语言的本地化资料(非英语翻译),每个问题对应一个单一可验证的答案。数据集仅提供测试集,涵盖英语、中文、葡萄牙语、泰语、俄语、韩语、法语、日语、马来语、印尼语和西班牙语共11种语言,样本量在80至151之间。每个样本包含ID、会话ID、语言(BCP-47格式)、文化圈、文化类别、原生语言问题、答案、问题与答案的中文参考翻译(可能为空)、来源URL及描述等字段。数据涵盖五大文化维度:历史与集体记忆、语言表达与传播艺术、文化产品与符号、信仰价值观与知识体系、社会规范与习俗。数据集以JSONL和CSV格式提供,采用CC BY 4.0许可证发布,适用于多语言文化知识问答、跨文化理解评估及大语言模型文化能力基准测试等任务。
MSQA (Multilingual and Cross-Cultural Question Answering) is a benchmark dataset containing 1,064 native questions, designed to evaluate whether large language models (LLMs) possess authentic, localized cultural knowledge rather than merely superficial cultural fluency. All questions are directly sourced from localized materials in 11 languages (not English translations), with each question corresponding to a single verifiable answer. The dataset only provides a test set, covering 11 languages including English, Chinese, Portuguese, Thai, Russian, Korean, French, Japanese, Malay, Indonesian and Spanish, with the sample size ranging from 80 to 151 per language. Each sample includes fields such as ID, conversation ID, language (in BCP-47 format), cultural sphere, cultural category, native-language question, answer, Chinese reference translation of the question and answer (which may be empty), source URL and description. The dataset covers five cultural dimensions: history and collective memory, linguistic expression and communication arts, cultural products and symbols, belief systems, values and knowledge frameworks, as well as social norms and customs. It is provided in JSONL and CSV formats, released under the CC BY 4.0 license, and is applicable to tasks such as multilingual cultural knowledge question answering, cross-cultural understanding evaluation and benchmark testing of LLM cultural capabilities.
数据集概述:MSQA
MSQA(多语言多文化简单问答数据集) 是一个用于评估大型语言模型是否具备真实的、基于本土文化知识的基准数据集。它包含 1,064 道由母语者创作或从本土源材料(非英文翻译)中精选的问题,每道问题都有唯一可验证的答案。
- 许可证:CC BY 4.0
- 任务类别:问答(question-answering)
- 语言:共 11 种语言(英语、中文、泰语、俄语、韩语、法语、日语、马来语、印度尼西亚语、西班牙语、葡萄牙语),每种语言的具体数量见下方表格。
- 数据集规模:1K < n < 10K(实际为 1,064 条)
- 配置:仅提供
default配置,包含test一个拆分(1,064 条数据,存储于msqa.jsonl文件)。
数据字段
每条数据包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 唯一标识符(以语言前缀开头,例如 PT-01) |
session_id |
string | 来源创作/会话 ID |
language |
string | BCP-47 风格的语言代码(例如 pt-PT、zh-ZH、en-EN) |
culture_circle |
string | 问题所针对的文化圈(例如 Portuguese、Latin American) |
category |
string | 文化维度分类(共 5 类,见下方) |
question |
string | 原始语言的问题 |
answer |
string | 唯一的正确答案 |
question_zh |
string | 问题的中文翻译(可能为空,仅作参考) |
answer_zh |
string | 答案的中文翻译(可能为空,仅作参考) |
source_url |
string | 主要来源 URL(可能为空) |
source_url_desc |
string | 来源的简短描述(可能为空) |
数据构成
- 语言分布(共 11 种语言,1,064 条):
| 语言 | 数量 | 语言 | 数量 | |
|---|---|---|---|---|
英语 (en-EN) |
151 | 日语 (ja-JP) |
83 | |
中文 (zh-ZH) |
150 | 马来语 (ms-MY) |
82 | |
泰语 (th-TH) |
95 | 印度尼西亚语 (id-ID) |
81 | |
俄语 (ru-RU) |
92 | 西班牙语 (es-ES) |
80 | |
韩语 (ko-KR) |
86 | 葡萄牙语 (pt-PT) |
80 | |
法语 (fr-FR) |
84 |
- 文化维度分布(共 5 类):
| 维度 | 数量 |
|---|---|
| 历史与集体记忆 | 261 |
| 语言表达与传播艺术 | 220 |
| 文化产品与符号 | 208 |
| 信仰、价值观与知识体系 | 189 |
| 社会规范与习俗 | 186 |
数据来源与引用
- 问题来源于母语参考资料(如百科全书、官方资料、文化文献),
source_url字段记录了可用时的主要来源。 - 数据集以 CC BY 4.0 许可证发布,但引用第三方来源时请同时尊重原始来源的条款。
- 如需引用,请参阅仓库中的
README.md文件。
加载方式
python
从 Hugging Face Hub 加载
from datasets import load_dataset ds = load_dataset("m-a-p/MSQA", split="test")
从本地文件加载(需要仓库中的 msqa.data 模块)
from msqa.data import load_dataset items = load_dataset(path="data/msqa.jsonl", language="pt-PT")




