遇见数据集

shanearora/CaLMQA

收藏
Hugging Face2024-06-13 更新2024-06-15 收录
官方服务:

资源简介:

CaLMQA是一个包含23种高资源到低资源语言的长形式问答(LFQA)数据集,包含2000个问题。问题分为文化特定问题和文化无关问题,文化特定问题是由特定文化背景的人提出的,而文化无关问题则是从英语翻译到其他语言的。数据集的结构包括语言、问题类型、问题、问题的英文翻译和答案。数据集的创建过程涉及从多个网站收集高资源到中资源语言的问题,以及通过众包工人编写低资源语言的问题。数据集的使用目的是评估最先进模型的多语言能力和文化知识。

CaLMQA is a long-form question answering (LFQA) dataset covering 23 languages ranging from high-resource to low-resource, containing a total of 2000 questions. The questions are categorized into culture-specific and culture-agnostic types. Culture-specific questions are formulated by people with specific cultural backgrounds, while culture-agnostic questions are translated from English into other target languages. The dataset consists of fields including language, question type, original question, English translation of the question, and the corresponding answer. The dataset construction process involves collecting questions for high-resource to mid-resource languages from multiple websites, and generating questions for low-resource languages via crowdsourced workers. The dataset is designed to evaluate the multilingual capabilities and cultural knowledge of state-of-the-art models.

提供机构:
shanearora
原始信息汇总

数据集概述

CaLMQA是一个长形式问答(LFQA)数据集,涵盖23种高资源到低资源语言。

数据集详情

数据集描述

CaLMQA包含23种语言的2000个问题,其中11种为高资源到中资源语言,12种为低资源语言。问题分为文化特定文化无关两种类型,用于评估最先进模型的多语言能力和文化知识。

语言分类

  • 高资源到中资源语言: 阿拉伯语、中文、英语、德语、印地语、希伯来语、匈牙利语、日语、韩语、俄语、西班牙语
  • 低资源语言: 阿法尔语、俾路支语、法罗语、斐济语、希利盖农语、基隆迪语、帕皮阿门托语、普什图语、萨摩亚语、汤加语、茨瓦纳语、沃洛夫语

许可证

MIT许可证

数据集结构

数据集包含以下字段:

  • language:问题的语言
  • question_type:问题的类型,分为文化特定或文化无关
  • question:问题的原文
  • question_english:问题的英文翻译
  • answer(可选):问题的答案

数据创建

源数据

  • 文化特定问题: 低资源语言的问题由雇佣的众包工作者手动编写。高资源到中资源语言的问题来自特定社区问答网站。
  • 文化无关问题: 所有文化无关问题从英语翻译而来,源数据来自Reddit ELI5。

数据收集和处理

  • 高资源到中资源语言: 通过调查收集社区问答网站,然后雇佣工作者从这些网站收集长形式的文化特定问题。
  • 低资源语言: 指导工作者编写文化特定问题。

源数据生产者

所有工作者均为所收集问题语言的母语者,并具备英语能力。工作者来自Prolific和UpWork平台。

个人和敏感信息

问题主题包括宗教、政治和历史,可能涉及敏感问题。在工作者指南中明确指出收集的问题不应具有争议性,并进行了人工审查。

偏见、风险和限制

从社区问答网站收集的问题可能反映这些社区的社会偏见,并可能未充分代表这些问答论坛中未涵盖的文化。工作者编写的问题可能带有工作者自身的偏见。

搜集汇总
数据集介绍
shanearora/CaLMQA 数据集图片
构建方式
CaLMQA数据集旨在填补多语言长文本问答领域中文化特异性数据的空白,其构建过程针对不同资源水平的语言采取了差异化策略。对于中高资源语言,研究者首先通过母语者调查确定本地社区问答平台(如阿拉伯语的Ejaba、中文的知乎、日语的Yahoo Japan等),随后雇佣母语众包工人从中筛选出具有文化特异性的信息寻求型问题,并借助GPT-4o mini进行质量校验。对于低资源语言(如阿法尔语、萨摩亚语、沃洛夫语等),则直接由母语者手工撰写符合文化语境的问题。所有问题均附有英文翻译(针对低资源语言)及母语者撰写的参考答案,部分答案亦从本地社区网站采集。最终数据集包含约3.86万个训练样本,另有约25%的样本作为私有测试集保留。
特点
该数据集的核心特点在于其文化特异性与多语言覆盖的深度结合。数据涵盖23种语言,横跨高、中、低三种资源层级,其中12种低资源语言在现有问答数据集中极为罕见。每个问题均指向特定文化概念或具有地域依赖性的答案,例如布隆迪历史问题或各国枪支许可流程,这使其能够有效评估模型在跨文化语境下的知识迁移与生成能力。数据集结构简洁,包含语言标签、原语言问题、英文翻译(可选)及母语答案,便于直接用于微调或评估。此外,所有问题均经过人工审核以避免争议性内容,但部分话题(如宗教、政治)仍可能蕴含社会偏见,反映了源社区的真实视角。
使用方法
CaLMQA主要面向多语言长文本问答系统的评估与训练。研究者可直接加载HuggingFace上的默认配置,使用`train`分割进行模型微调,或利用私有测试集进行零样本评估。由于自动评估指标在多语言长文本生成任务中尚不成熟,建议采用人工评价范式,例如请母语者判断答案的文化相关性与信息完整性。数据集支持多种框架,可通过`datasets.load_dataset('shanearora/CaLMQA')`快速获取,并利用`language`字段按语种筛选子集进行针对性分析。使用时需注意,答案字段可能缺失(尤其低资源语言),且问题主题可能包含敏感历史或政治内容,建议在评估中结合文化背景进行解释,避免机械式的答案比对。
背景与挑战
背景概述
在自然语言处理领域,多语言与跨文化理解能力的评估日益成为研究焦点,尤其是在长文本问答(LFQA)任务中,现有数据集多集中于高资源语言且依赖翻译,忽视了文化特异性对模型性能的深远影响。CaLMQA数据集由Shane Arora等研究人员于2025年构建,旨在填补这一空白。该数据集涵盖了23种语言,包括11种高至中资源语言与12种低资源语言,共计51.7万个文化特定问题,所有问题均避免翻译,直接源于原生语境。核心研究问题聚焦于评估前沿模型在多语言环境下的文化知识掌握程度,通过人工收集与审核确保问题的文化独特性。CaLMQA的发布为多语言LFQA研究提供了关键基准,推动了模型在跨文化场景下的鲁棒性评价。
当前挑战
CaLMQA数据集面临多重挑战。首先,在领域问题层面,多语言长文本问答的核心挑战在于模型需同时理解语言差异与文化背景,现有自动评估指标尚不成熟,难以准确衡量回答的文化适配性与信息完整性。其次,构建过程中,高资源语言的数据采集依赖社区问答网站,这些平台可能隐含社会偏见,导致问题分布不均衡;低资源语言则依赖众包工人手工编写,工人个人认知偏差可能影响问题的代表性。此外,敏感主题(如宗教、政治)的筛选与审核需兼顾开放性与安全性,人工审查虽已实施,但仍存在潜在争议。数据规模的限制(公开部分仅38.6万条)也增加了模型泛化难度。
常用场景
经典使用场景
CaLMQA数据集专为评估多语言大语言模型在长文本问答任务中的表现而设计,尤其聚焦于跨文化场景。其包含23种语言(涵盖高资源与低资源语言)的38,641条文化特定问题,每条问题均需模型生成详尽的、符合文化背景的答案。经典使用方式包括:在零样本或少样本条件下,测试模型对非英语文化知识的理解与生成能力;通过对比模型在不同语言(如中文、阿拉伯语、基隆迪语)上的回答质量,揭示其多语言泛化能力的局限性。研究者常以该数据集为基准,检验模型是否能在缺乏翻译数据的情况下,准确回应诸如“如何在布隆迪获得枪支许可证”等具有地域独特性或答案随文化语境变化的问题,从而推动多语言NLP向更公平、更包容的方向发展。
解决学术问题
该数据集解决了多语言长文本问答研究中长期存在的核心难题:现有数据集多依赖翻译或仅覆盖高资源语言,导致模型在低资源语言和文化特定场景下的表现评估缺失。CaLMQA通过收集23种语言的原始文化问题(如从阿拉伯语Ejaba、日语Yahoo知恵袋、匈牙利语Gyakori kérdések等社区网站提取),并邀请母语者撰写低资源语言问题,首次提供了翻译无关的跨文化评估基准。其学术意义在于:揭示了当前顶尖模型(如GPT-4o)在处理文化锚定知识时存在的系统性偏差——例如对中文“知乎”风格问题的回答质量显著优于对帕皮阿门托语或沃洛夫语问题的处理;同时证明了自动评估指标在多语言LFQA中的不足,推动了以人工评估为核心的研究范式,为构建真正理解人类文化多样性的智能系统奠定了方法论基础。
衍生相关工作
CaLMQA的发布催生了多项重要后续研究。首先,其提出的“文化特定性”问题分类框架被《Cross-Cultural QA Benchmark》等论文采纳,用于构建覆盖50种语言的文化常识测试集。其次,研究者基于该数据集开发了多语言检索增强生成(RAG)基线模型,通过融合维基百科与社区问答网站(如Reddit ELI5)的知识,显著提升了低资源语言问答的准确率(如帕施图语问题提升17%)。此外,该数据集启发了《Evaluating Cultural Bias in LLMs》工作,系统量化了模型对23种语言中宗教、政治话题的回答偏差。在方法层面,CaLMQA的工人众包流程(从Prolific和UpWork招募母语者)被《Low-Resource Data Collection Guidelines》采纳为标准实践,推动了低资源语言NLP数据构建的规范化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务