BrailleBench
收藏资源简介:
BrailleBench是一个专为评估大型语言模型在盲文理解与生成能力而设计的基准数据集,由克莱姆森大学等机构联合创建。该数据集包含5,570个实例,整合自GSM8K、AIME 2024、CommonsenseQA、HotpotQA和2WikiMultiHopQA五个公开数据集,覆盖数学计算、竞赛数学、常识推理及多跳问答任务,并支持英语、一级盲文和二级盲文三种格式。数据通过确定性、专家审核的管道构建,借助自研的Braille Toolkit基于liblouis和UEB标准表进行转换,全程未使用LLM生成内容,确保评估无偏。该基准旨在系统衡量LLM在盲文输入、输出及端到端交互场景下的表现,为开发包容性AI系统,特别是改善盲人和聋盲用户与AI的无障碍交互,提供关键评测依据。
BrailleBench is a benchmark dataset specifically designed to evaluate the braille comprehension and generation capabilities of large language models (LLMs), co-developed by Clemson University and other institutions. This dataset consists of 5,570 instances integrated from five public datasets, namely GSM8K, AIME 2024, CommonsenseQA, HotpotQA and 2WikiMultiHopQA. It covers tasks including mathematical computation, competitive mathematics, commonsense reasoning and multi-hop question answering, and supports three formats: English, Grade 1 Braille and Grade 2 Braille. The data is constructed through a deterministic, expert-reviewed pipeline, and is converted using the self-developed Braille Toolkit based on liblouis and UEB standard tables. No LLM-generated content is used throughout the entire process, ensuring unbiased evaluation. This benchmark aims to systematically measure the performance of LLMs in braille input, output and end-to-end interaction scenarios, providing critical evaluation foundations for the development of inclusive AI systems, particularly to improve accessible interaction between blind and deafblind users and AI.
BrailleBench 是一个用于评估语言模型在盲文读写及推理问答任务上能力的基准测试集,版本为 0.1.0。其核心评估对象是以 Braille ASCII 编码的六点式统一英语盲文(UEB),同时提供 Unicode 盲文和点号表示,以及平行的英语字段和与提供商无关的评估框架。
核心测试配置
基准测试包含七个核心配置,用于区分盲文阅读、书写和端到端推理能力:
| 配置 | 输入 | 输出 | 能力 |
|---|---|---|---|
EN-EN |
英语 | 英语 | 标准基线 |
G1-EN |
一级盲文 | 英语 | 非缩写盲文阅读 |
G2-EN |
二级盲文 | 英语 | 缩写盲文阅读 |
EN-G1 |
英语 | 一级盲文 | 非缩写盲文书写 |
EN-G2 |
英语 | 二级盲文 | 缩写盲文书写 |
G1-G1 |
一级盲文 | 一级盲文 | 完整一级盲文推理 |
G2-G2 |
二级盲文 | 二级盲文 | 完整二级盲文推理 |
此外还提供纯盲文提示(FULLBR-G1、FULLBR-G2)和映射速查表(G1-EN-CS、G2-EN-CS)的消融实验配置,但这些不属于核心矩阵,除非明确报告。
数据集构成
该基准包含五个数据集,共 22,551 条逻辑记录,每条记录均保留了来源归属信息:
| 数据集 | 划分 | 记录数 | 任务 | 主要指标 |
|---|---|---|---|---|
| GSM8K | 测试集 | 1,319 | 小学数学 | math_verify |
| AIME 2024 | I + II | 30 | 竞赛数学 | math_verify |
| CommonsenseQA | 开发集 | 1,221 | 多项选择问答 | 精确匹配 |
| HotpotQA | 开发集 | 7,405 | 多跳问答 | 精确匹配 |
| 2WikiMultiHopQA | 开发集 | 12,576 | 多跳问答 | 精确匹配 |
每条逻辑记录以六种格式存储在 data/braille/<dataset>/grade1/ 和 grade2/ 目录下,分别为 ascii、unicode、dots 的 JSONL 文件。文件同时包含平行的英语问题、选项(如适用)和英语标准答案。
ascii:可打印的 Braille ASCII/BRF 字符,例如#ah表示数字 18。unicode:Unicode 盲文图案(U+2800 区块)。dots:以空格分隔的点号,如1-2-5。
翻译过程使用 liblouis 的 UEB 表 en-ueb-g1.ctb 和 en-ueb-g2.ctb。
安装与使用
- 支持 Python 3.10-3.13,推荐环境使用 Python 3.11 和 conda-forge(因 liblouis 包含原生命库)。可通过
environment.yml创建环境并设置LOUIS_TABLEPATH环境变量。 - 仅进行英语输出(
EN-EN、G1-EN、G2-EN)时,评估阶段无需 liblouis,可使用 pip 环境。 - 使用
src/validate_release.py进行数据审计,并通过unittest运行回归测试。 - 通过编辑
src/model_client.py并实现invoke_with_retry函数连接模型,支持--models all参数。
评估命令示例
- 小规模阅读冒烟测试(含
--limit 20)和七配置 ASCII 核心矩阵测试均有提供。 - 支持
--formats unicode或--formats dots切换表面表示。 - 生成默认参数为温度 0、最大输出 token 1,024(AIME24 为 4,096),可通过
--max-tokens和--aime-max-tokens调整。
输出与恢复
评估结果以每个项目文件(<model>_<dataset>_<config>_<format>_details.jsonl)和汇总文件(summary.json)形式输出。每个详情行包含 id、gold_answer、predicted、metrics 和 full_response 等字段。盲文输出额外包含 wrote_english、back_translated、predicted_raw 和 trailing_period_normalized 指标。中断的运行可从现有 JSONL 前缀恢复。
评分方法
- 数学任务通过
math_verify进行符号等价性验证,并有数值回退机制。 - 问答任务采用 FlashRAG 风格的归一化精确匹配、子串精确匹配和 token F1。
- 盲文输出经过格式归一化、保守的英语检测、liblouis 反向翻译,再与英语标准答案比较。
已知局限性
- Braille ASCII 与小写印刷英语共享字符,语言检测必须保守,以避免误拒绝有效盲文单元格。
- 结果依赖 liblouis 版本和 UEB 表,发布评估时应记录这些信息。
- 生成上限可能截断推理模型的最终答案,需报告 token 限制并检查空预测。
- 基准仅评估英语 UEB,不涵盖其他盲文语言或代码。
- HotpotQA/2Wiki 不提供上下文段落,属于闭卷推理设置。
项目结构与许可
主要目录包括 data/braille/、src/(含评估、模型客户端、验证、翻译等脚本)、tests/、DATA_MANIFEST.json、DATA_LICENSES.md、THIRD_PARTY_NOTICES.md、LICENSE、CITATION.cff 和 RELEASE_NOTES.md。
BrailleBench 自研代码采用 MIT 许可证,但其不重新许可源问题和答案等第三方数据集内容,这些内容仍受其上游条款约束。引用时请引用带版本号的仓库发布。

- 1BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models克莱姆森大学; 罗切斯特理工学院; 亚马逊公司; 弗吉尼亚理工大学 · 2026年




