grips-multilingual
收藏资源简介:
GRIPS Multilingual是德语GRIPS(德语推理、习语、谜题与文字游戏)基准的多语言扩展数据集。该数据集将原始的96种谜题机制(包括字母与单词操作、逻辑推理、数字文字游戏、习语、同音异义词、隐藏词、密码等)移植到10种语言中:捷克语、丹麦语、西班牙语、芬兰语、法语、意大利语、荷兰语、波兰语、葡萄牙语和瑞典语。关键特征在于其采用“原生重建”而非直接翻译的方法:每种机制均基于目标语言的本地词典、习语语料库以及语言特定的音系学/正字学进行重构,确保谜题在每种语言和文化背景下都具有真正的可解性与文化根基。数据集总规模为6,359个样本,按语言划分成独立的子集。每个样本遵循统一的8列数据结构,包含问题提示、参考思维链、答案、解释、机制标识、结构化验证键、难度标志和唯一标识符。该数据集适用于评估和提升大型语言模型在多语言环境下的推理、文字游戏理解和逻辑谜题解决能力。
GRIPS Multilingual is a multilingual extension of the German GRIPS (German Reasoning, Idioms, Puzzles, and Wordplay) benchmark. The dataset adapts the original 96 puzzle mechanisms (including letter and word manipulation, logical reasoning, numerical wordplay, idioms, homophones, hidden words, ciphers, etc.) to 10 languages: Czech, Danish, Spanish, Finnish, French, Italian, Dutch, Polish, Portuguese, and Swedish. A key feature is its native reconstruction approach rather than direct translation: each mechanism is reconstructed based on the target languages native lexicon, idiom corpus, and language-specific phonology/orthography, ensuring that the puzzles are genuinely solvable and culturally grounded in each linguistic and cultural context. The total dataset size is 6,359 samples, divided into independent subsets by language. Each sample follows a uniform 8-column data structure, including question prompts, reference thought chains, answers, explanations, mechanism identifiers, structured verification keys, difficulty flags, and unique identifiers. The dataset is suitable for evaluating and enhancing the reasoning, wordplay comprehension, and logical puzzle-solving capabilities of large language models in multilingual environments.
数据集概述:GRIPS Multilingual
名称:GRIPS Multilingual
许可协议:CC-BY-4.0
数据集规模:1K < n < 10K(总计6,359个样本)
标签:推理、文字游戏、谜题、习语、多语言
语言与数据划分
数据集包含10种语言,每种语言对应一个ISO 639-3代码的测试集划分,按字母顺序排列。各语言分片及样本数量如下:
| 划分(split) | 语言 | 样本数 | 谜题机制数 |
|---|---|---|---|
| ces | 捷克语 | 640 | 93 |
| dan | 丹麦语 | 640 | 94 |
| fin | 芬兰语 | 639 | 93 |
| fra | 法语 | 620 | 93 |
| ita | 意大利语 | 631 | 92 |
| nld | 荷兰语 | 648 | 94 |
| pol | 波兰语 | 630 | 92 |
| por | 葡萄牙语 | 638 | 93 |
| spa | 西班牙语 | 628 | 92 |
| swe | 瑞典语 | 645 | 94 |
数据模式(Schema)
每个划分均采用相同的8列结构:
| 列名 | 描述 |
|---|---|
question |
谜题提示(使用目标语言) |
cot |
参考思维链,以本地化答案标记结尾(如 Réponse:、Svar:、Vastaus:) |
answer |
黄金标准答案 |
explanation |
简短解释 |
mechanic |
96种GRIPS谜题机制之一的ID |
verification |
JSON字符串,包含该机制的解题关键结构化信息 |
hard |
布尔值,稳健困难子集标记(当前全部为 false) |
id |
sha256(question),每行唯一并按ID排序 |
方法论
该数据集将96种GRIPS谜题机制移植到10种语言中,每种机制在目标语言中重新实例化而非机器翻译。根据语言特性,对每个(机制,语言)对进行分类处理:
-
语言族处理策略:
- 罗曼语族(法语、西班牙语、意大利语、葡萄牙语):舍弃依赖德语复合词的机制,仅在数字单词字母计数匹配其数值时恢复
self_descriptive_number(如葡萄牙语cinco)。 - 日耳曼语族(荷兰语、瑞典语、丹麦语):强大的复合词机制,恢复
compound_word、word_half、ambiguous_split、self_descriptive_number,为最丰富层级。 - 斯拉夫语族(波兰语、捷克语):复合词机制较弱(类似罗曼语族),含丰富变音符号;捷克语通过
tři恢复self_descriptive_number。 - 乌拉尔语族(芬兰语):强大的复合词机制恢复日耳曼语族机制,但近音位正字法导致舍弃
homophone_pair(无同音词),通过viisi恢复self_descriptive_number。
- 罗曼语族(法语、西班牙语、意大利语、葡萄牙语):舍弃依赖德语复合词的机制,仅在数字单词字母计数匹配其数值时恢复
-
质量控制:每个分片经过确定性重审和源语言泄漏扫描,并通过强模型对抗验证(独立重新解题,修复真实错误,保留真正难题)。困难子集(
hard)仅在至少30个样本在低和高推理条件下均难倒模型时才标记,当前未达到该阈值,故全部为false。
使用示例
python from datasets import load_dataset
加载单一语言(使用ISO 639-3划分名称)
fin = load_dataset("ellamind/grips-multilingual", split="fin")
加载所有语言
ds = load_dataset("ellamind/grips-multilingual") print(ds) # DatasetDict: ces, dan, fin, fra, ita, nld, pol, por, spa, swe
评估可使用GRIPS评估框架,通过 --dataset 参数指向对应分片。
许可与来源
- 许可:CC-BY-4.0,完全开放,使用时署名即可。
- 来源:基于GRIPS谜题机制构建,原始德语数据集为
ellamind/grips,GRIPS Multilingual 为其多语言扩展,引用时请引用原始GRIPS数据集。




