遇见数据集

grips-multilingual

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

GRIPS Multilingual是德语GRIPS(德语推理、习语、谜题与文字游戏)基准的多语言扩展数据集。该数据集将原始的96种谜题机制(包括字母与单词操作、逻辑推理、数字文字游戏、习语、同音异义词、隐藏词、密码等)移植到10种语言中:捷克语、丹麦语、西班牙语、芬兰语、法语、意大利语、荷兰语、波兰语、葡萄牙语和瑞典语。关键特征在于其采用“原生重建”而非直接翻译的方法:每种机制均基于目标语言的本地词典、习语语料库以及语言特定的音系学/正字学进行重构,确保谜题在每种语言和文化背景下都具有真正的可解性与文化根基。数据集总规模为6,359个样本,按语言划分成独立的子集。每个样本遵循统一的8列数据结构,包含问题提示、参考思维链、答案、解释、机制标识、结构化验证键、难度标志和唯一标识符。该数据集适用于评估和提升大型语言模型在多语言环境下的推理、文字游戏理解和逻辑谜题解决能力。

GRIPS Multilingual is a multilingual extension of the German GRIPS (German Reasoning, Idioms, Puzzles, and Wordplay) benchmark. The dataset adapts the original 96 puzzle mechanisms (including letter and word manipulation, logical reasoning, numerical wordplay, idioms, homophones, hidden words, ciphers, etc.) to 10 languages: Czech, Danish, Spanish, Finnish, French, Italian, Dutch, Polish, Portuguese, and Swedish. A key feature is its native reconstruction approach rather than direct translation: each mechanism is reconstructed based on the target languages native lexicon, idiom corpus, and language-specific phonology/orthography, ensuring that the puzzles are genuinely solvable and culturally grounded in each linguistic and cultural context. The total dataset size is 6,359 samples, divided into independent subsets by language. Each sample follows a uniform 8-column data structure, including question prompts, reference thought chains, answers, explanations, mechanism identifiers, structured verification keys, difficulty flags, and unique identifiers. The dataset is suitable for evaluating and enhancing the reasoning, wordplay comprehension, and logical puzzle-solving capabilities of large language models in multilingual environments.

提供机构:
ellamind
创建时间:
2026-06-29
原始信息汇总

数据集概述:GRIPS Multilingual

名称:GRIPS Multilingual
许可协议:CC-BY-4.0
数据集规模:1K < n < 10K(总计6,359个样本)
标签:推理、文字游戏、谜题、习语、多语言


语言与数据划分

数据集包含10种语言,每种语言对应一个ISO 639-3代码的测试集划分,按字母顺序排列。各语言分片及样本数量如下:

划分(split) 语言 样本数 谜题机制数
ces 捷克语 640 93
dan 丹麦语 640 94
fin 芬兰语 639 93
fra 法语 620 93
ita 意大利语 631 92
nld 荷兰语 648 94
pol 波兰语 630 92
por 葡萄牙语 638 93
spa 西班牙语 628 92
swe 瑞典语 645 94

数据模式(Schema)

每个划分均采用相同的8列结构:

列名 描述
question 谜题提示(使用目标语言)
cot 参考思维链,以本地化答案标记结尾(如 Réponse:Svar:Vastaus:
answer 黄金标准答案
explanation 简短解释
mechanic 96种GRIPS谜题机制之一的ID
verification JSON字符串,包含该机制的解题关键结构化信息
hard 布尔值,稳健困难子集标记(当前全部为 false
id sha256(question),每行唯一并按ID排序

方法论

该数据集将96种GRIPS谜题机制移植到10种语言中,每种机制在目标语言中重新实例化而非机器翻译。根据语言特性,对每个(机制,语言)对进行分类处理:

  • 语言族处理策略

    • 罗曼语族(法语、西班牙语、意大利语、葡萄牙语):舍弃依赖德语复合词的机制,仅在数字单词字母计数匹配其数值时恢复 self_descriptive_number(如葡萄牙语 cinco)。
    • 日耳曼语族(荷兰语、瑞典语、丹麦语):强大的复合词机制,恢复 compound_wordword_halfambiguous_splitself_descriptive_number,为最丰富层级。
    • 斯拉夫语族(波兰语、捷克语):复合词机制较弱(类似罗曼语族),含丰富变音符号;捷克语通过 tři 恢复 self_descriptive_number
    • 乌拉尔语族(芬兰语):强大的复合词机制恢复日耳曼语族机制,但近音位正字法导致舍弃 homophone_pair(无同音词),通过 viisi 恢复 self_descriptive_number
  • 质量控制:每个分片经过确定性重审和源语言泄漏扫描,并通过强模型对抗验证(独立重新解题,修复真实错误,保留真正难题)。困难子集(hard)仅在至少30个样本在低和高推理条件下均难倒模型时才标记,当前未达到该阈值,故全部为 false


使用示例

python from datasets import load_dataset

加载单一语言(使用ISO 639-3划分名称)

fin = load_dataset("ellamind/grips-multilingual", split="fin")

加载所有语言

ds = load_dataset("ellamind/grips-multilingual") print(ds) # DatasetDict: ces, dan, fin, fra, ita, nld, pol, por, spa, swe

评估可使用GRIPS评估框架,通过 --dataset 参数指向对应分片。


许可与来源

  • 许可:CC-BY-4.0,完全开放,使用时署名即可。
  • 来源:基于GRIPS谜题机制构建,原始德语数据集为 ellamind/grips,GRIPS Multilingual 为其多语言扩展,引用时请引用原始GRIPS数据集。
搜集汇总
数据集介绍
grips-multilingual 数据集图片
构建方式
GRIPS Multilingual数据集是德国推理、习语、谜题与文字游戏基准GRIPS的多语言扩展。它并非简单翻译,而是将源自德语的96种谜题机制(包括字母与单词运算、逻辑推理、数字文字游戏、习语、同音词、隐词、密码等)原生移植至捷克语、丹麦语、芬兰语、法语、意大利语、荷兰语、波兰语、葡萄牙语、西班牙语和瑞典语十种语言。构建过程遵循严格的分类转移策略:对于语言中性的逻辑机制采用翻译载体,针对依赖字母或词汇操作的类型则基于目标语言的本土词库、习语语料库及音韵正字法规则重新实例化,部分文化特定谜题由母语作者原创或寻找最接近的本土替代形式,确保每道谜题在每个语言中均具备可解性与文化根基。
特点
数据集总计包含6359条高质量测试样本,每种语言涵盖92至94种不同机制。其核心特色在于所有条目均经过系统性对抗验证:通过强大模型独立复现解题过程,修正瑕疵并保留真正困难题目,最终因未出现30个以上抵抗模型低高层推理的题目,困难子集标记暂为全假。各语言根据语系特征形成差异化分布——日耳曼语族因强大复合词机制恢复最多机制;罗曼语族舍弃依赖德语复合的谜题;乌拉尔语系芬兰语因近似音位正字法缺失同音词对。每项数据均包含8字段统一架构,涵盖问题、思维链、答案、解释、机制标识、验证密钥及唯一哈希ID。
使用方法
使用者可通过HuggingFace Datasets库按ISO 639-3语言代码加载特定语言拆分(如load_dataset('ellamind/grips-multilingual', split='fra')获取法语子集,或直接加载完整数据集获得包含十种语言的DatasetDict。每个拆分以语言代码命名并按字母排序。评估时推荐配合GRIPS评估框架使用,通过指定--dataset参数指向目标语言拆分实现收集、评判与评分流程。数据集采用CC-BY-4.0许可协议完全开放,允许自由使用、分享与改编,仅需注明出处。
背景与挑战
背景概述
GRIPS Multilingual数据集由ellamind团队于近期创建,旨在将原版德语GRIPS基准(涵盖推理、习语、谜题与文字游戏)扩展至捷克语、丹麦语、芬兰语等10种语言。该数据集聚焦于探究多语言环境下语言模型对逻辑推理与文字游戏的理解能力,其核心研究问题在于检验模型能否超越翻译表层,真正掌握基于本族词汇、习语语料及音系正字法重建的谜题机制。作为跨语言推理评估的重要资源,GRIPS Multilingual为自然语言处理领域提供了文化扎根的细粒度评测工具,推动了多语言常识推理研究的边界。
当前挑战
该数据集面临的领域挑战在于语言与逻辑的深度绑定——许多谜题(如同音词、复合词拆分)依赖特定语言的音系与形态特性,难以直接迁移至不同语系(如罗曼语族、乌拉尔语族),需设计适配策略以避免文化失真。构建过程中的挑战则包括:对96种谜题机制逐语言进行可迁移性分类(如针对芬兰语缺同音词现象做调整),确保非翻译性质的本地化重建;同时通过强模型对抗验证剔除有瑕疵项,并设置多阶段质量控制,最终导致hard子集因未达阈值而暂不标注。
常用场景
经典使用场景
GRIPS Multilingual 数据集的核心价值在于其为多语言推理与文字游戏研究提供了一个跨语言、跨文化的标准化评估平台。该数据集巧妙地将96种源自德语原版的谜题机制(如字母与词汇操作、逻辑演绎、数字文字游戏、习语理解、同音词识别、隐藏词与密码破译等)系统地移植至十种语言环境中,包括捷克语、丹麦语、芬兰语、法语、意大利语、荷兰语、波兰语、葡萄牙语、西班牙语及瑞典语。每个谜题均依据目标语言的词汇库、习语语料库及音韵拼写特征进行原生重构,而非简单翻译,从而确保了文化语境的本土化与谜题的可解性。该数据集最常用于评估与比较大型语言模型在多语言环境下处理复杂推理、语言歧义及文化特定表达时的表现,为跨语言自然语言理解研究提供了不可或缺的基准。
解决学术问题
GRIPS Multilingual 数据集的出现,有力回应了多语言自然语言处理领域中一个悬而未决的关键问题——如何在不同语言间公平、有效地衡量模型的推理与语言理解能力。传统基准往往受限于英语中心主义,难以评估模型在非英语语言中的真正实力,且多语言数据集常因简单翻译而忽视文化差异,导致评测失真。该数据集通过独创的机制重构方法论,对每个谜题在母语层面进行文化适配与语言重组,区分了可转移、需重建、需本土创作或需舍弃的谜题类型,从而解决了跨语言推理评测中的文化偏见与语言特异性问题。这一设计使研究者能够深入洞察模型在应对语言多样性时的鲁棒性与泛化能力,推动了多语言推理评测从表面文本匹配向深层语义与跨文化理解的范式转变。
衍生相关工作
GRIPS Multilingual 数据集的发布催生了一系列富有挑战性的学术衍生工作。基于其独特的跨语言谜题机制,研究团队可构建多语言推理能力的细粒度分析框架,逐语言、逐机制地剖析模型在逻辑演绎、词汇联想、习语理解等子能力上的表现差异,从而为模型训练提供定向强化建议。另有学者将数据集与对抗性测试结合,通过自动生成语言内部的歧义变体,探索模型在多语言环境下的鲁棒性边界。该数据集还激发了跨语言知识迁移的研究,借助其在不同语言间保持同构的谜题结构,研究者能够设计实验,考察在一种语言上训练获得的推理能力是否能够有效迁移至其他语言,进而推动多语言预训练模型的优化。此外,该数据集的出现也促进了文化敏感型自然语言处理评估方法的创新,启发了更多致力于构建文化根植性测试集的工作,为人工智能系统真正实现全球化适配提供了重要的方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务