遇见数据集

NOLLI

收藏
github2026-08-09 更新2026-08-20 收录
数据链接:
官方服务:

资源简介:

NOLLI融合了韩语中的“놀이”(玩耍)和“논리”(逻辑),既指代该套件所针对的推理能力,也指代测试所采用的谜题形式。这是一个难度校准的英韩基准测试,用于衡量模型在跨语言任务中的失败点,包含15种谜题类型(25个任务;7500个项目)。

NOLLI is a portmanteau of the Korean words "놀이" (play) and "논리" (logic), which refers both to the reasoning capability targeted by this benchmark suite and the puzzle format employed in the test. This is a difficulty-calibrated English-Korean benchmark test developed to measure the failure points of models in cross-lingual tasks, encompassing 15 puzzle types (25 tasks; 7500 items).

创建时间:
2026-08-03
原始信息汇总

NOLLI:难度校准的英韩双语谜题基准

数据集概述

NOLLI(由韩语“놀이”(游戏)和“논리”(逻辑)融合而成)是一个难度校准的英语-韩语双语基准数据集,专用于诊断模型在不同语言间的性能差距。该数据集通过15种谜题类型(25个任务;共7,500个样本),衡量模型在不同语言环境下的推理失败模式。所有样本均程序化生成、可种子复现,并经过验证确保唯一解。难度基于固定参考模型的准确率区间进行校准,而非仅依据问题规模。

任务分类与构成

任务遵循三级跨语言谱系设计:

1. 直接翻译任务(8种类型;英韩双语)

同一生成器和参数在两种语言中保持一致,语言间隙可隔离展示:

任务 描述 样例数(易/中/难) 合计
array_formula 对二维数组按顺序应用行列聚合公式(SUM/MEAN/MAX等) 每语言各100/100/100 600
causal_dag 通过带边延迟的因果图推断事件传播时间 每语言各100/100/100 600
inequality CSP:放置1..N数字满足不等式约束(唯一解) 每语言各100/100/100 600
minesweeper 保持唯一解的最小提示扫雷 每语言各100/100/100 600
number_baseball 从Strike/Ball提示推断隐藏的N位数字 每语言各100/100/100 600
sat_puzzles 以自然语言场景呈现的布尔可满足性(CNF)问题 每语言各100/100/100 600
sudoku 保证唯一解的9x9数独 每语言各100/100/100 600
yacht_dice 将12次骰子投掷分配到12个计分类别以最大化总分 每语言各100/100/100 600

2. 脚本改编任务(2种类型;英韩双语)

并非翻译等价:英语使用罗马字母;韩语使用韩文字母(jamo)。按语言独立校准:

任务 描述 样例数(易/中/难) 合计
cipher 解码堆叠密码(替换、维吉尼亚、反转、Playfair、换位) 每语言各100/100/100 600
cryptarithmetic 字母替换数字算术(如SEND+MORE=MONEY式);韩语映射jamo组 每语言各100/100/100 600

3. 韩语专属任务(5种类型;仅韩语)

无英语对应版本——基于韩语语言与文化特有结构构建(亲属称谓、干支历法、传统单位、韩文正字法):

任务 描述 样例数(易/中/难) 合计
jamo 将韩语音节分解为初声/中声/终声,移动初声并重组 各100/100/100 300
kinship 从家庭关系链推断韩语亲属称谓(26选多项选择题) 各100/100/100 300
korean_units 以随机化比率转换韩国传统单位(평·마지기·되·자·냥等) 各100/100/100 300
saju 从出生日期/时间计算四柱(사주四柱) 各100/100/100 300
time 韩历推理:假日锚点+相对日期表达→日期/六十甲子日辰 各100/100/100 300

数据格式

  • data/{task}_{difficulty}.jsonl:每个任务×难度(easy/medium/hard)一个文件,各含100个样本
  • 通用字段:idquestionanswersolution(逐步推理过程)、difficulty,以及各任务特定元数据
  • 评估时可直接从HuggingFace中心(HAERAE-HUB/NOLLI)加载数据,无需本地文件

使用与评估

  • 模型调用:支持LiteLLM(云API:OpenAI、Anthropic、Gemini、OpenRouter等)和vLLM(自托管OpenAI兼容HTTP端点)两种后端
  • 评估命令:通过evaluation/run.py指定任务名称(格式为{task}_{lang}[_{difficulty}],如sudoku_ko运行全部难度,sudoku_ko_easy仅运行易档),或使用脚本运行全部任务
  • 数据再生:运行bash scripts/generate_dataset.sh可重新生成数据集,每个生成器也支持独立运行(如python generation/sudoku_en.py --num 300
  • 结果输出:评估结果写入results/{model}/{task}_{difficulty}/目录

重要资源

搜集汇总
数据集介绍
NOLLI 数据集图片
构建方式
NOLLI数据集的构建秉承严谨的科研范式,融合了韩语‘놀이’(游戏)与‘논리’(逻辑)之精髓,旨在通过谜题形式细致剖析模型在跨语言推理上的表现。该基准涵盖15种谜题类型、25项任务,共7,500个条目,每个条目均经由程序化生成,并配备种子再生机制,确保结果的可复现性。尤为关键的是,所有任务均经过严格验证,确认其唯一解的存在性与正确性。难度校准并非简单依据题目规模,而是以固定参考模型上的目标准确率区间为基准,从而实现精细化的难度分层。任务设计遵循三条跨语言光谱:直接翻译任务确保双语生成器与参数完全一致,以隔离语言呈现差异;脚本改编任务虽非翻译等价,但针对英韩文字系统分别独立校准;韩语专属任务则根植于韩语特有的文化结构,如亲属称谓、干支纪年及韩文正字法等,确保了数据集的深度与文化特异性。
特点
NOLLI数据集的显著特征在于其精细的难度校准体系与跨语言诊断能力。每个任务均按难易程度细分为易、中、高三档,且每档包含100个独立条目,保证了统计效度。该数据集不仅覆盖了从直接翻译到脚本改编再到韩语独有的三级任务光谱,还通过程序化生成与唯一解验证机制,确保了高度的标准化与可靠性。尤其值得关注的是,其难度校准基于固定参考模型的实际表现,而非仅依赖问题复杂度,这使其能够精准揭示模型在不同语言版本间的性能落差。此外,数据集中嵌入的韩语特有任务,如‘사주’(四柱)与‘saju’(六十甲子)等,挑战了模型对深层文化背景知识的理解,从而为评估模型的跨语言泛化能力提供了更为严苛的试金石。
使用方法
使用者可便捷地通过HuggingFace平台获取NOLLI数据集,并利用GitHub仓库中提供的评估框架进行模型性能评测。具体而言,研究者可通过LiteLLM客户端接入OpenAI、Anthropic等云端大模型,或借助vLLM引擎部署自托管开源模型,以HTTP接口实现调用。运行评估时,可灵活指定具体任务及难度层级,如‘sudoku_ko_easy’即仅测试韩语数独的简单级别,亦可利用脚本一次性评估全部任务。评估结果将自动保存至本地目录,便于后续分析。数据集还支持本地生成,通过执行生成脚本可复现或扩展数据集,为模型调试与对比研究提供了极大便利。综上,NOLLI为跨语言推理研究提供了一个标准化、可扩展且深度校准的评测工具。
背景与挑战
背景概述
NOLLI基准由韩国HAE-RAE团队于2026年创建,旨在系统诊断大语言模型在英语与韩语之间的性能差距。该基准融合了韩语中“玩”与“逻辑”的概念,通过15种谜题类型、25个任务及7500个程序化生成的条目,构建了一个难度校准的双语评测框架。其核心研究问题在于揭示模型在不同语言环境下推理能力的差异,尤其关注语言特定结构(如韩语亲属称谓、干支纪年)对模型表现的影响。NOLLI的发布为跨语言AI评估提供了创新工具,对多语言模型的可信部署具有重要参考价值。
当前挑战
NOLLI的构建面临多重挑战:首先,跨语言推理基准需确保任务在翻译与脚本改编后难度等同,而直接翻译可能引入文化偏差,脚本改编(如韩文字母密码)则需独立校准难度;其次,程序化生成必须保证答案唯一性,这要求设计复杂的验证算法;此外,韩国专属任务(如四柱推命、传统单位换算)需深度嵌入语言与文化结构,增加了数据生成的复杂度。这些挑战不仅考验了基准的严谨性,也反映出多语言评测中语言特异性和公平性的平衡难题。
常用场景
经典使用场景
NOLLI作为一个难度校准的英韩双语谜题基准,其经典使用场景在于跨语言推理能力的系统性评估。研究者可通过其包含的15种谜题类型(涵盖直接翻译、脚本改编及韩语专属任务)对模型进行精确诊断,特别适用于分析模型在英语与韩语之间的性能差距。该基准的独特之处在于采用程序化生成与种子可复现机制,确保每个题目均具有唯一解,且难度基于参考模型的准确率带校准,而非单纯依赖问题规模,从而为语言模型的语言鲁棒性研究提供了精细化的评测工具。
衍生相关工作
NOLLI衍生出的相关工作可能包括:基于其生成框架构建的多语言谜题扩展,如将任务模式迁移到其他语系(如日语、西班牙语),以探索语言特异的推理差异;利用其难度校准方法改进现有基准(如MMLU、BIG-bench)的跨文化版本;以及借助其韩语专属任务(如韩语亲属称谓、干支纪年)来推动文化常识推理的研究,进一步启发将语言结构特性融入预训练目标的新范式。
数据集最近研究
最新研究方向
NOLLI数据集最新研究方向聚焦于跨语言推理能力诊断,通过设计难度校准的英韩双语谜题基准,系统剖析大语言模型在不同语言间的性能鸿沟。该基准融合15种谜题类型与25项任务,利用程序化生成确保唯一解,并基于参考模型校准难度,从而精准定位模型在直接翻译、脚本改编及韩语专属任务中的失败模式。相关研究紧密关联多语言模型公平性与鲁棒性议题,其意义在于揭示语言特定知识与推理泛化之间的张力,为构建文化感知的评估体系及推动语言平等的人工智能发展提供关键实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务