NOLLI
收藏资源简介:
NOLLI融合了韩语中的“놀이”(玩耍)和“논리”(逻辑),既指代该套件所针对的推理能力,也指代测试所采用的谜题形式。这是一个难度校准的英韩基准测试,用于衡量模型在跨语言任务中的失败点,包含15种谜题类型(25个任务;7500个项目)。
NOLLI is a portmanteau of the Korean words "놀이" (play) and "논리" (logic), which refers both to the reasoning capability targeted by this benchmark suite and the puzzle format employed in the test. This is a difficulty-calibrated English-Korean benchmark test developed to measure the failure points of models in cross-lingual tasks, encompassing 15 puzzle types (25 tasks; 7500 items).
NOLLI:难度校准的英韩双语谜题基准
数据集概述
NOLLI(由韩语“놀이”(游戏)和“논리”(逻辑)融合而成)是一个难度校准的英语-韩语双语基准数据集,专用于诊断模型在不同语言间的性能差距。该数据集通过15种谜题类型(25个任务;共7,500个样本),衡量模型在不同语言环境下的推理失败模式。所有样本均程序化生成、可种子复现,并经过验证确保唯一解。难度基于固定参考模型的准确率区间进行校准,而非仅依据问题规模。
任务分类与构成
任务遵循三级跨语言谱系设计:
1. 直接翻译任务(8种类型;英韩双语)
同一生成器和参数在两种语言中保持一致,语言间隙可隔离展示:
| 任务 | 描述 | 样例数(易/中/难) | 合计 |
|---|---|---|---|
| array_formula | 对二维数组按顺序应用行列聚合公式(SUM/MEAN/MAX等) | 每语言各100/100/100 | 600 |
| causal_dag | 通过带边延迟的因果图推断事件传播时间 | 每语言各100/100/100 | 600 |
| inequality | CSP:放置1..N数字满足不等式约束(唯一解) | 每语言各100/100/100 | 600 |
| minesweeper | 保持唯一解的最小提示扫雷 | 每语言各100/100/100 | 600 |
| number_baseball | 从Strike/Ball提示推断隐藏的N位数字 | 每语言各100/100/100 | 600 |
| sat_puzzles | 以自然语言场景呈现的布尔可满足性(CNF)问题 | 每语言各100/100/100 | 600 |
| sudoku | 保证唯一解的9x9数独 | 每语言各100/100/100 | 600 |
| yacht_dice | 将12次骰子投掷分配到12个计分类别以最大化总分 | 每语言各100/100/100 | 600 |
2. 脚本改编任务(2种类型;英韩双语)
并非翻译等价:英语使用罗马字母;韩语使用韩文字母(jamo)。按语言独立校准:
| 任务 | 描述 | 样例数(易/中/难) | 合计 |
|---|---|---|---|
| cipher | 解码堆叠密码(替换、维吉尼亚、反转、Playfair、换位) | 每语言各100/100/100 | 600 |
| cryptarithmetic | 字母替换数字算术(如SEND+MORE=MONEY式);韩语映射jamo组 | 每语言各100/100/100 | 600 |
3. 韩语专属任务(5种类型;仅韩语)
无英语对应版本——基于韩语语言与文化特有结构构建(亲属称谓、干支历法、传统单位、韩文正字法):
| 任务 | 描述 | 样例数(易/中/难) | 合计 |
|---|---|---|---|
| jamo | 将韩语音节分解为初声/中声/终声,移动初声并重组 | 各100/100/100 | 300 |
| kinship | 从家庭关系链推断韩语亲属称谓(26选多项选择题) | 各100/100/100 | 300 |
| korean_units | 以随机化比率转换韩国传统单位(평·마지기·되·자·냥等) | 各100/100/100 | 300 |
| saju | 从出生日期/时间计算四柱(사주四柱) | 各100/100/100 | 300 |
| time | 韩历推理:假日锚点+相对日期表达→日期/六十甲子日辰 | 各100/100/100 | 300 |
数据格式
data/{task}_{difficulty}.jsonl:每个任务×难度(easy/medium/hard)一个文件,各含100个样本- 通用字段:
id、question、answer、solution(逐步推理过程)、difficulty,以及各任务特定元数据 - 评估时可直接从HuggingFace中心(HAERAE-HUB/NOLLI)加载数据,无需本地文件
使用与评估
- 模型调用:支持LiteLLM(云API:OpenAI、Anthropic、Gemini、OpenRouter等)和vLLM(自托管OpenAI兼容HTTP端点)两种后端
- 评估命令:通过
evaluation/run.py指定任务名称(格式为{task}_{lang}[_{difficulty}],如sudoku_ko运行全部难度,sudoku_ko_easy仅运行易档),或使用脚本运行全部任务 - 数据再生:运行
bash scripts/generate_dataset.sh可重新生成数据集,每个生成器也支持独立运行(如python generation/sudoku_en.py --num 300) - 结果输出:评估结果写入
results/{model}/{task}_{difficulty}/目录
重要资源
- 论文:NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap(arXiv:2608.04397)
- 数据集:HAERAE-HUB/NOLLI(HuggingFace)
- 代码仓库:HAE-RAE/NOLLI(GitHub)
- 开源协议:MIT License




