遇见数据集

BrailleBench

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

BrailleBench是一个专为评估大型语言模型在盲文理解与生成能力而设计的基准数据集,由克莱姆森大学等机构联合创建。该数据集包含5,570个实例,整合自GSM8K、AIME 2024、CommonsenseQA、HotpotQA和2WikiMultiHopQA五个公开数据集,覆盖数学计算、竞赛数学、常识推理及多跳问答任务,并支持英语、一级盲文和二级盲文三种格式。数据通过确定性、专家审核的管道构建,借助自研的Braille Toolkit基于liblouis和UEB标准表进行转换,全程未使用LLM生成内容,确保评估无偏。该基准旨在系统衡量LLM在盲文输入、输出及端到端交互场景下的表现,为开发包容性AI系统,特别是改善盲人和聋盲用户与AI的无障碍交互,提供关键评测依据。

BrailleBench is a benchmark dataset specifically designed to evaluate the braille comprehension and generation capabilities of large language models (LLMs), co-developed by Clemson University and other institutions. This dataset consists of 5,570 instances integrated from five public datasets, namely GSM8K, AIME 2024, CommonsenseQA, HotpotQA and 2WikiMultiHopQA. It covers tasks including mathematical computation, competitive mathematics, commonsense reasoning and multi-hop question answering, and supports three formats: English, Grade 1 Braille and Grade 2 Braille. The data is constructed through a deterministic, expert-reviewed pipeline, and is converted using the self-developed Braille Toolkit based on liblouis and UEB standard tables. No LLM-generated content is used throughout the entire process, ensuring unbiased evaluation. This benchmark aims to systematically measure the performance of LLMs in braille input, output and end-to-end interaction scenarios, providing critical evaluation foundations for the development of inclusive AI systems, particularly to improve accessible interaction between blind and deafblind users and AI.

创建时间:
2026-08-27
原始信息汇总

BrailleBench 是一个用于评估语言模型在盲文读写及推理问答任务上能力的基准测试集,版本为 0.1.0。其核心评估对象是以 Braille ASCII 编码的六点式统一英语盲文(UEB),同时提供 Unicode 盲文和点号表示,以及平行的英语字段和与提供商无关的评估框架。

核心测试配置

基准测试包含七个核心配置,用于区分盲文阅读、书写和端到端推理能力:

配置 输入 输出 能力
EN-EN 英语 英语 标准基线
G1-EN 一级盲文 英语 非缩写盲文阅读
G2-EN 二级盲文 英语 缩写盲文阅读
EN-G1 英语 一级盲文 非缩写盲文书写
EN-G2 英语 二级盲文 缩写盲文书写
G1-G1 一级盲文 一级盲文 完整一级盲文推理
G2-G2 二级盲文 二级盲文 完整二级盲文推理

此外还提供纯盲文提示(FULLBR-G1FULLBR-G2)和映射速查表(G1-EN-CSG2-EN-CS)的消融实验配置,但这些不属于核心矩阵,除非明确报告。

数据集构成

该基准包含五个数据集,共 22,551 条逻辑记录,每条记录均保留了来源归属信息:

数据集 划分 记录数 任务 主要指标
GSM8K 测试集 1,319 小学数学 math_verify
AIME 2024 I + II 30 竞赛数学 math_verify
CommonsenseQA 开发集 1,221 多项选择问答 精确匹配
HotpotQA 开发集 7,405 多跳问答 精确匹配
2WikiMultiHopQA 开发集 12,576 多跳问答 精确匹配

每条逻辑记录以六种格式存储在 data/braille/<dataset>/grade1/grade2/ 目录下,分别为 asciiunicodedots 的 JSONL 文件。文件同时包含平行的英语问题、选项(如适用)和英语标准答案。

  • ascii:可打印的 Braille ASCII/BRF 字符,例如 #ah 表示数字 18。
  • unicode:Unicode 盲文图案(U+2800 区块)。
  • dots:以空格分隔的点号,如 1-2-5

翻译过程使用 liblouis 的 UEB 表 en-ueb-g1.ctben-ueb-g2.ctb

安装与使用

  • 支持 Python 3.10-3.13,推荐环境使用 Python 3.11 和 conda-forge(因 liblouis 包含原生命库)。可通过 environment.yml 创建环境并设置 LOUIS_TABLEPATH 环境变量。
  • 仅进行英语输出(EN-ENG1-ENG2-EN)时,评估阶段无需 liblouis,可使用 pip 环境。
  • 使用 src/validate_release.py 进行数据审计,并通过 unittest 运行回归测试。
  • 通过编辑 src/model_client.py 并实现 invoke_with_retry 函数连接模型,支持 --models all 参数。

评估命令示例

  • 小规模阅读冒烟测试(含 --limit 20)和七配置 ASCII 核心矩阵测试均有提供。
  • 支持 --formats unicode--formats dots 切换表面表示。
  • 生成默认参数为温度 0、最大输出 token 1,024(AIME24 为 4,096),可通过 --max-tokens--aime-max-tokens 调整。

输出与恢复

评估结果以每个项目文件(<model>_<dataset>_<config>_<format>_details.jsonl)和汇总文件(summary.json)形式输出。每个详情行包含 idgold_answerpredictedmetricsfull_response 等字段。盲文输出额外包含 wrote_englishback_translatedpredicted_rawtrailing_period_normalized 指标。中断的运行可从现有 JSONL 前缀恢复。

评分方法

  • 数学任务通过 math_verify 进行符号等价性验证,并有数值回退机制。
  • 问答任务采用 FlashRAG 风格的归一化精确匹配、子串精确匹配和 token F1。
  • 盲文输出经过格式归一化、保守的英语检测、liblouis 反向翻译,再与英语标准答案比较。

已知局限性

  • Braille ASCII 与小写印刷英语共享字符,语言检测必须保守,以避免误拒绝有效盲文单元格。
  • 结果依赖 liblouis 版本和 UEB 表,发布评估时应记录这些信息。
  • 生成上限可能截断推理模型的最终答案,需报告 token 限制并检查空预测。
  • 基准仅评估英语 UEB,不涵盖其他盲文语言或代码。
  • HotpotQA/2Wiki 不提供上下文段落,属于闭卷推理设置。

项目结构与许可

主要目录包括 data/braille/src/(含评估、模型客户端、验证、翻译等脚本)、tests/DATA_MANIFEST.jsonDATA_LICENSES.mdTHIRD_PARTY_NOTICES.mdLICENSECITATION.cffRELEASE_NOTES.md

BrailleBench 自研代码采用 MIT 许可证,但其不重新许可源问题和答案等第三方数据集内容,这些内容仍受其上游条款约束。引用时请引用带版本号的仓库发布。

搜集汇总
数据集介绍
BrailleBench 数据集图片
构建方式
BrailleBench的构建遵循一条严谨且可复现的路径。研究团队首先从五个公开数据集中精心遴选5,570条实例,涵盖算术、竞赛数学、常识推理与多跳问答等任务类型。随后,通过任务感知的归一化流程,将数学公式与自然语言问题转换为线性文本,并利用基于liblouis的定制工具包,依据UEB标准确定性转录为Grade 1与Grade 2盲文ASCII序列。整个构建过程严格规避大语言模型的参与,确保数据纯净性。最后,通过多层级质量校验,包括跨表示一致性验证、反向翻译检查及专家人工审阅,保障了数据集的高保真度与可靠性。
使用方法
BrailleBench的运用灵活而深入。研究者可依据任务类型选择对应的子集,并采用方向感知的评估协议进行闭卷测试。评估时,模型在未接触任何盲文示例或解码密钥的条件下,接收混合提示(英文指令加盲文内容)或全盲文提示,以模拟不同交互场景。针对数学任务,采用Math-Verify进行符号与数值验证;问答任务则结合精确匹配与F1分数,并对盲文输出先进行格式校验与反向翻译,再与英文参考答案比对。该数据集还支持表层格式消融、盲文参考提示等变体实验,为剖析模型盲文能力缺陷的根源提供了系统化工具。
背景与挑战
背景概述
BrailleBench是由克莱姆森大学、罗切斯特理工学院、亚马逊公司和弗吉尼亚理工大学的研究人员于2026年联合构建的基准数据集,旨在评估大型语言模型(LLMs)对盲文的理解能力。该数据集基于GSM8K、AIME 2024、CommonsenseQA、HotpotQA和2WikiMultiHopQA五个来源,构建了5,570个实例,涵盖数学、常识推理和多跳问答任务,并提供了英文、一级盲文和二级盲文三种形式。其核心研究问题在于探究LLMs能否通过盲文实现等效的交互能力,包括理解盲文输入、生成盲文输出以及端到端的盲文交互。通过严格的确定性转换管道和质量控制,BrailleBench为盲文AI系统的开发提供了重要评估基准,推动了包容性AI的发展。
当前挑战
BrailleBench面临多重挑战。在领域问题层面,盲文理解与英文理解存在显著不对称性,尤其二级盲文因缩略规则导致语义歧义,模型在输入侧解码困难,而在输出侧又难以生成符合规范的盲文,端到端盲文交互性能进一步下降。在构建过程中,数学公式和自然语言需先进行任务感知的规范化处理,再通过liblouis转换,但LaTeX表达式的线性化、Grade 2缩写的上下文依赖性等均易引入错误,需要专家审核和跨格式校验确保质量。此外,不同盲文字符表示(ASCII、Unicode、点字)对模型性能影响显著,模型对数字指示符的追踪和缩略词的消解能力不足,导致句子级理解准确率远低于字词级,凸显了序列解码的脆弱性。
常用场景
经典使用场景
BrailleBench作为首个系统评估大语言模型盲文理解能力的基准,其经典使用场景在于衡量模型在七种核心交互配置下的表现,涵盖盲文输入至英文输出、英文输入至盲文输出以及盲文端到端交互,同时覆盖Grade 1和Grade 2两种盲文等级。该基准整合了数学推理、常识问答和多跳问答等多元化任务,通过统一的评估协议和方向感知评分机制,为研究者提供了一套标准化、可复现的盲文能力测评工具。其设计不仅关注模型能否正确解读盲文编码,还深入考察其在盲文环境中的推理能力和输出表达准确性,为构建真正包容性的AI系统奠定了基础。
解决学术问题
该数据集解决了现有大语言模型在盲文理解与生成能力评估中的核心学术空白。此前研究多聚焦于盲文识别与翻译,而缺乏对通用模型在任务导向交互中盲文理解能力的系统性考察。BrailleBench通过构建高质量、确定性转换的基准,揭示了模型在盲文输入下的性能下降规律,尤其是Grade 2盲文在输入端的脆弱性,以及盲文理解与生成之间的不对称性。这些发现为理解模型如何处理非标准语言输入提供了重要实证,推动了包容性AI理论的完善,并为未来盲文感知模型的训练与优化指明了方向。
实际应用
在实际应用中,BrailleBench为开发面向视障和聋盲用户的AI辅助系统提供了关键的评估基准与改进依据。基于该基准的评估结果,开发者可以识别现有模型在盲文交互中的薄弱环节,从而针对性地优化模型对盲文ASCII、Unicode等不同数字表示的适应能力。例如,在智能助手、教育工具和内容获取平台中,集成盲文支持功能时,BrailleBench的评估方法能够指导系统设计者选择更合适的盲文表示形式,提升模型的响应准确性和用户体验。此外,该基准还可用于验证辅助技术中盲文翻译模块的性能,确保其在不同任务场景下的可靠性。
数据集最近研究
最新研究方向
当前大语言模型在盲文理解领域的研究前沿聚焦于构建系统化评估基准,以检验模型在盲文阅读、应答生成及端到端交互中的包容性能力。BrailleBench作为该方向的代表性工作,通过整合数学推理、常识问答及多跳问答等多样化任务,采用确定性转换工具与多级质量校验流程,确保基准的可靠性与可复现性。研究揭示了模型在印刷英语与盲文能力间的显著鸿沟,尤其是在二级盲文的上下文消歧、数字状态追踪及序列级解码方面,暴露了现有模型对盲文规则理解的不完整性与脆弱性。该基准的发布为开发更具包容性的盲文AI系统提供了关键评估基础设施,推动了无障碍交互从文本格式扩展至特殊语言模态的范式转型,对促进AI技术在视障与聋盲群体中的普惠应用具有深远意义。
相关研究论文
  • 1
    BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models克莱姆森大学; 罗切斯特理工学院; 亚马逊公司; 弗吉尼亚理工大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务