遇见数据集

grips

收藏
Hugging Face2026-06-15 更新2026-06-16 收录
官方服务:

资源简介:

GRIPS(German Reasoning, Idioms, Puzzles & Sprachspiel)是一个德语基准测试数据集,旨在评估语言模型在德语推理、习语理解、谜题解答和文字游戏方面的能力。数据集名称 GRIPS 在德语中意为 智慧/头脑,直接反映了其测试核心。该数据集包含 925 个精心设计的德语问答项目,涵盖了 96 种不同的谜题解决机制,包括文字游戏、字谜、隐藏词、习语、双关语、算术文字问题以及多步逻辑推理等。所有项目均为合成生成,并经过程序化验证和人工审查,以确保每个问题都有唯一的正确答案,并存储了验证对象以记录具体的解决机制和方案。数据集包含 356 个多项选择题和 569 个开放答案题,并特别标记了一个包含 100 个对模型而言具有挑战性的 困难 项目子集。该数据集为纯文本模态,适用于问答和文本生成任务,主要用于对前沿推理模型进行基准测试和评估,尤其关注模型在需要精确阅读、计数和多步推理的复杂场景下的表现。

GRIPS (German Reasoning, Idioms, Puzzles & Sprachspiel) is a German benchmark dataset designed to evaluate the capabilities of language models in German reasoning, idiom comprehension, puzzle solving, and wordplay. The dataset name GRIPS means wisdom/mind in German, directly reflecting its core testing focus. It contains 925 carefully designed German question-answer items, covering 96 different puzzle-solving mechanisms, including word games, anagrams, hidden words, idioms, puns, arithmetic word problems, and multi-step logical reasoning. All items are synthetically generated and have undergone programmatic verification and manual review to ensure each question has a unique correct answer, with verification objects stored to document specific solving mechanisms and solutions. The dataset includes 356 multiple-choice questions and 569 open-answer questions, and it specifically marks a subset of 100 difficult items that are challenging for models. The dataset is in pure text modality, suitable for question-answering and text generation tasks, primarily used for benchmarking and evaluating state-of-the-art reasoning models, with a focus on their performance in complex scenarios requiring precise reading, counting, and multi-step reasoning.

提供机构:
ellamind
创建时间:
2026-06-14
原始信息汇总

数据集概述:GRIPS

GRIPS(German Reasoning, Idioms, Puzzles & Sprachspiel)是一个用于评估德语推理能力的基准数据集,名称在德语中意为“智慧/头脑”。

基本信息

  • 语言: 德语(German)
  • 数据类型: 纯文本
  • 许可证: CC-BY-4.0
  • 数据集大小: 少于 1,000 项(n<1K)
  • 任务类别: 问答(question-answering)、文本生成(text-generation)
  • 标签: 推理(reasoning)、文字游戏(wordplay)、德语(german)、基准测试(benchmark)、合成数据(synthetic)

数据规模与结构

  • 总样本数: 925 个问题
  • 问题机制数量: 96 种不同的谜题机制
  • 选择题数量: 356 个
  • 开放题数量: 569 个
  • 困难子集(hard=true): 100 个问题(对模型有挑战性,对人类不一定)

数据生成与验证

  • 所有问题均为合成生成,经过程序化验证,并经过人工审查以确保答案正确。
  • 每个样本包含一个verification对象,记录了其机制和解决方案。

任务与机制示例

数据集包含 96 种谜题机制,涵盖以下类型(部分示例):

  • 文字游戏类: 变位词(anagram)、隐词(hidden words)、回文(palindrome)、同音词对(homophone pair)、首字母序列(initial_sequence)、字母插入(insert_one_letter)等。
  • 语言文化类: 德语习语含义(idiom_meaning)、习语补全(idiom_complete)、同音双关(Teekesselchen)、习语起源(idiom_origin)等。
  • 逻辑推理类: 三元谎言推理(three_tier_liar)、真话者/说谎者(truthteller_liar)、传递性排序(transitive_order)、置换密码(substitution_cipher)等。
  • 算术与计数类: 手握手问题(handshakes)、区间计数(interval_count)、鸽巢原理(pigeonhole)、矩形边界计数(rectangle_border)、概率计算(probability)等。
  • 空间与模式类: 涂色立方体(painted_cube)、国际象棋颜色计数(chess_count)、字母频率(most_frequent)、字符计数(char_count)等。
  • 创意与语言游戏类: 打油诗(Schüttelreim)、复合词(compound_word)、字母排序(sort_letters)、名字代码(namecode)等。
  • 其他类: 概念/洞察力谜题(conceptual)、单位链(unit_chain)、单词长度序列(letter_length_sequence)等。

评估结果

以下是部分模型在 925 项测试集上的单次运行结果(由推荐的 gpt-5.4-mini 裁判评分):

模型 推理设置 正确率 (%)
gpt-5.5 high 99.8%
gemini-3.5-flash high 98.5%
deepseek-v4-pro default 97.6%
claude-sonnet-4-6 32k 97.6%
deepseek-v4-flash default 95.8%
gpt-5.4-mini high 94.4%
nemotron-3-ultra-550b default 94.1%
mistral-medium-3-5 high 92.4%
nemotron-3-super-120b default 90.4%
qwen3.5-35b-a3b default 90.1%
claude-sonnet-4-6 off 89.9%
mistral-medium-3-5 off 83.7%
claude-haiku-4.5 off 80.4%
gpt-5.4-mini off 75.6%
mistral-small-3.2-24b-instruct off 71.6%
mistral-small-2603 off 71.5%

推理设置说明:

  • high: 推理参数设置为高
  • 32k: Anthropic扩展思考预算为32,000 tokens
  • default: 模型默认启用推理(通过推理token使用确认)
  • off: 推理被禁用或模型非推理模型

困难子集评估结果

针对 100 个困难问题(hard=true)的表现:

模型 推理设置 正确率 (%)
gpt-5.5 high 98%
gemini-3.5-flash high 90%
claude-sonnet-4-6 32k 82%
deepseek-v4-pro default 81%
gpt-5.4-mini high 68%
deepseek-v4-flash default 64%
nemotron-3-ultra-550b default 64%
mistral-medium-3-5 high 50%
qwen3.5-35b-a3b default 43%
nemotron-3-super-120b default 41%
claude-sonnet-4-6 off 39%
claude-haiku-4.5 off 21%
mistral-medium-3-5 off 18%
gpt-5.4-mini off 15%
mistral-small-2603 off 12%
mistral-small-3.2-24b-instruct off 4%
搜集汇总
数据集介绍
grips 数据集图片
构建方式
GRIPS数据集通过全自动合成流程构建,覆盖96种不同的谜题机制,涵盖文字游戏、谜语、习语、算术问题及多步逻辑推理等类型。每条题目均经过程序化验证,确保答案的机器可验证性,并由人工校对以确保答案键的准确性。数据集包含925道德语测验题,分为多选题(356道)与开放式回答题(569道),并额外标注了100道对模型极具挑战性的硬子集。所有题目均附带一个名为'verification'的对象,记录每道题的具体机制与求解过程,从而为研究者提供透明且可复现的基准评估材料。
使用方法
GRIPS数据集适用于问答与文本生成任务,尤其适合评估模型的德语推理与文字游戏能力。推荐使用如gpt-5.4-mini等裁判模型对所有925道测试题目进行单次评估,每道题目生成一个回答,并基于正确率进行评分。研究者可通过'hard'标签筛选出100道高难度题目进行针对性测试。数据集中的多选题与开放式题目共存,要求模型具备多步逻辑推导、单词识别与上下文理解等能力。建议在评估时启用模型的高推理模式(如设置reasoning参数为high),以充分挖掘其在复杂谜题上的表现潜力。
背景与挑战
背景概述
GRIPS(German Reasoning, Idioms, Puzzles & Sprachspiel)是由研究者在2025年创建的一个德语推理基准数据集,专注于评估大语言模型在语言游戏、谜题、习语推理和多步逻辑演绎等非传统自然语言理解任务上的表现。该数据集由96种独特的谜题机制构成,包含925道经过程序化生成、自动验证和人工审核的德语测试题,覆盖字谜、回文、隐词、算术文字题、逻辑推理等多种类型。GRIPS的推出填补了德语领域高质量推理基准的空白,为评估前沿模型(如GPT-5.5、Gemini-3.5-flash)的推理能力提供了标准化、可复现的测试平台,其硬子集(100道题)更揭示出现有模型在无需外部推理链时表现显著下降的问题,对推动语言模型推理能力研究具有重要影响。
当前挑战
GRIPS数据集主要解决的领域挑战包括:1) 语言模型的复杂推理能力评估,尤其是需要多步逻辑、精确计数和文字游戏理解的任务,如Schüttelreim(首音互换韵文)和组合锁推理,这些任务仅靠统计学习或模式匹配难以解决,必须依赖真正的推理机制;2) 德语语言特有意象和习语的理解,例如Teekesselchen(同形异义词)和idiom_meaning(习语含义选择),对非母语模型构成巨大障碍。在数据集构建过程中,挑战包括:设计96种可自动化验证的谜题机制,确保答案唯一且可通过编程核对;生成大量高质量、无歧义的德语测试题,同时通过人工审核排除机器生成中的逻辑错误或文化不当内容;以及确保测试题能够有效区分不同模型的推理能力,避免出现天花板或地板效应。
常用场景
经典使用场景
GRIPS作为一项专为德语语言与推理能力设计的基准评测,其核心使用场景在于评估前沿大语言模型的复杂推理与语言理解水平。该数据集涵盖了96种不同的谜题机制,包括文字游戏、字谜、习语理解、算术逻辑推理与多步演绎推演等,重点考察模型在精细阅读、统计计数、跨步骤推理以及模式识别方面的表现。与传统评测集不同,GRIPS强调机器可验证与人类审核的双重保障机制,使得每一个测试条目都具备严谨的答案校验流程,为德语自然语言处理领域的模型能力度量提供了高区分度的标准化工具。
解决学术问题
该数据集精准回应了德语大模型评测中长期存在的两大瓶颈:一是缺乏覆盖多元语言游戏与复杂逻辑推理的综合性基准,二是现有评测难以区分模型究竟是掌握了深层推理还是仅依赖统计模式匹配。GRIPS通过合成生成、程序化可验证与人类校验三条路径,系统性地构建了86%条目为零样本开放答案、14%条目为多选方案的评估体系,有效捕捉了模型在习语溯源、字谜重组、符号逻辑推演等真实认知挑战上的表现差异,为德语推理能力研究提供了不可替代的对照参照。
实际应用
在实际应用层面,GRIPS可被广泛嵌入德语AI系统的质量验收与持续优化环节,尤其在教育科技、对话系统、专业翻译与智能娱乐等需要高精度语言理解与逻辑推导能力的产业场景中发挥关键作用。例如,智能德语学习助手可借助GRIPS中的习语解释与字谜类任务检验其对文化负载词汇的掌握程度;企业级聊天机器人则可通过该基准中的多步逻辑推理条目评估其在复杂客户咨询中的应答能力。此外,游戏化语言训练产品亦可利用GRIPS的谜题机制作为内容生成引擎的评估锚点,确保生成内容在趣味性与认知挑战性之间取得平衡。
数据集最近研究
最新研究方向
GRIPS数据集聚焦于德语复杂推理与语言游戏的前沿评估,其96种独特谜题机制涵盖文字游戏、习语理解、算术推理与多步逻辑演绎,为检验前沿推理模型在非英语环境下的认知深度提供了高难度基准。该基准的合成生成与程序化验证机制,结合硬子集对模型推理能力的极限施压,揭示了当前顶尖模型(如gpt-5.5、gemini-3.5-flash)在高端任务中接近人类水平的表现,而推理性模型与普通模型的显著性能鸿沟(硬子集准确率从98%骤降至4%)则凸显了推理能力跃升对通用人工智能突破的关键价值。这一工作不仅推动多语言认知基准的体系化构建,更通过精细化的谜题分类为模型可解释性研究提供了结构化诊断工具,其镜像出的模型脆弱性(如拼写错误检测、字母计数等看似简单任务上的失灵)正成为神经符号融合与推理强化学习的热点革新方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务