phxember/Uni-MuMER-Data
收藏官方服务:
资源简介:
Uni-MuMER数据集包括CROHME、HME100K、MathWriting和Im2LaTeXv2等多个子集,用于手写数学表达式识别(HMER)的多任务训练。数据集包含图像和LaTeX格式的标签,以及用于结构推理、错误学习和符号计数的特定子集。数据集经过了预处理,包括语法清理、分词和归一化。数据集的大小在1M到10M之间,许可证为MIT。
The Uni-MuMER dataset includes subsets such as CROHME, HME100K, MathWriting, and Im2LaTeXv2, designed for multi-task training in Handwritten Mathematical Expression Recognition (HMER). The dataset consists of images and LaTeX format labels, with specific subsets for structural reasoning, error learning, and symbol counting. The data has undergone preprocessing, including syntax cleaning, tokenization, and normalization. The dataset size ranges between 1M and 10M, and the license is MIT.
提供机构:
phxember搜集汇总
数据集介绍
构建方式
在手写数学表达式识别(HMER)领域,构建高质量的多任务数据集是提升视觉-语言模型(VLM)性能的关键。Uni-MuMER-Data数据集通过整合CROHME、HME100K、MathWriting和Im2LaTeXv2等多个权威基准,构建了涵盖多样手写风格与印刷体表达式的丰富语料库。每个子数据集均经过严格的预处理流程,包括去除语法无效与噪声数据、对LaTeX表达式进行分词与标准化,并通过交叉验证与采样技术生成稳健的错误语料。此外,数据集针对树感知思维链(Tree-CoT)、符号计数(SC)以及错误驱动学习(EDL)三项专门任务进行了精细化标注,形成了统一的multi-task结构。
特点
该数据集的核心特点在于其多任务融合与层次化设计。每个子集均包含三种标注视角:标准LaTeX识别目标、抽象语法树(AST)结构表示以及符号数量计数,从而支持模型同时学习结构推理与细节感知能力。特别地,EDL子集(*_error_find与*_error_fix)通过显式标记错误预测并提供修正标签,使模型能够针对性强化薄弱环节。数据规模从数千到数十万样本不等,覆盖从简单符号到复杂长表达式的广泛难度层级,确保了模型在多样化场景下的泛化性与鲁棒性。
使用方法
研究者可通过HuggingFace平台便捷地加载该数据集,利用其预定义的config名称(如crohme2023、hme100k_train_tree等)选择特定子集进行微调。每个子集均以Parquet格式存储,包含id、conversations(多轮对话格式)、image(图像张量)及gt(真实标签)字段,可直接适配主流VLM的训练接口。推荐结合Uni-MuMER框架,将Tree-CoT、SC与EDL任务联合训练,以最大化多任务协同效应。数据加载后,建议依据任务需求动态组合不同子集,例如使用*_train进行基础识别训练,辅以*_error_fix进行错误纠正优化。
背景与挑战
背景概述
手写数学公式识别(HMER)是计算机视觉与文档分析领域的核心难题,其复杂性源于手写风格的多样性与数学符号结构的层次性。Uni-MuMER数据集由Li等人于2025年提出,依托多任务视觉-语言模型微调框架,旨在将领域知识无缝注入通用视觉语言模型。该数据集整合了CROHME、HME100K、MathWriting及Im2LaTeXv2等多个权威基准,覆盖从标准评测到大规模真实场景的广泛样本。通过引入树感知链式推理、错误驱动学习与符号计数三大核心任务,Uni-MuMER显著提升了模型对复杂表达式的解析能力,为HMER领域树立了新的研究范式,推动了多任务学习在文档智能中的深度应用。
当前挑战
当前HMER领域面临多重挑战:首先,手写数学公式的结构歧义性与符号重叠现象导致传统图像分类方法难以准确解析,亟需模型具备显式的结构推理能力;其次,真实场景中长公式的符号计数误差与罕见书写风格的低频出现,使得模型泛化性能受限,错误驱动学习虽能针对性改进,但高质量错误样本的构建与标注成本高昂。此外,Uni-MuMER数据集的构建过程中,需对来自不同源的数据进行语法校验、LaTeX规范化与跨任务注释对齐,处理规模达数千万样本的噪声过滤与平衡采样,确保多任务子集间的语义一致性,这对数据工程提出了严苛的精度与效率要求。
常用场景
经典使用场景
在光学字符识别与文档智能分析领域,Uni-MuMER-Data数据集最经典的用途是作为手写数学公式识别(HMER)任务的多任务微调基准。研究者通常利用其丰富的子集配置,如CROHME、HME100K、MathWriting和Im2LaTeXv2等,来训练视觉-语言模型(VLM)精准地将手写或印刷数学表达式图像转化为LaTeX序列。该数据集通过集成树感知思维链(Tree-CoT)、错误驱动学习(EDL)和符号计数(SC)等专门任务,为模型提供了结构化的推理路径与错误纠正机制,从而在复杂公式的解析精度上实现突破性提升。
解决学术问题
该数据集的构建有效解决了手写数学公式识别领域中长期存在的两大核心学术难题:一是在长序列与复杂结构表达式中模型解析准确率低的问题,二是通用视觉-语言模型缺乏领域专有知识的困境。通过引入错误驱动学习(EDL)范式,数据集让模型能够从过往的识别失误中汲取经验,显著降低了错误率;而树感知思维链(Tree-CoT)则通过抽象语法树(AST)的显式推理,赋予模型结构化的数学理解能力。这些创新不仅提升了HMER任务的性能标杆,也为多模态学习中的知识注入策略提供了重要的方法论参考。
衍生相关工作
围绕Uni-MuMER-Data数据集,学术界已衍生出多项经典工作。其中,Uni-MuMER框架本身提出的树感知思维链(Tree-CoT)与错误驱动学习(EDL)策略,启发了后续研究者将结构化推理与自纠错机制融入更多视觉-语言模型中。此外,基于该数据集,有学者进一步探索了跨域泛化能力,利用Im2LaTeXv2子集训练模型在印刷体与手写体之间的迁移学习。还有工作专注于符号计数(SC)任务的深化,将其与注意力机制结合,提升了模型对密集符号序列的解析鲁棒性。这些衍生研究共同推动了HMER领域从单一识别向多任务智能理解的演进。
以上内容由遇见数据集搜集并总结生成



