遇见数据集

aiflow-math-ink-0.9-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

AIFlow Math Ink 0.9 Public Stroke Dataset 是一个用于在线手写数学表达式识别的公开数据集。该数据集包含119个数学表达式,由8位书写者在12个会话中采集,其中70个来自公开网页收集,49个来自设备回放。数据以Stroke轨迹序列形式存储,每个记录保留原始笔画顺序、点坐标(x, y)、相对于公式的时间戳(t_ms),以及压力、倾斜、接触几何等传感器信息(若存在)。此外,还包括画布尺寸、目标标记/关系、审查状态、可复现的本地书写者ID和会话组。数据集分为四个JSONL文件:formulas_valid.jsonl(110个,已审查,可用于训练/分析)、formulas_pending.jsonl(4个,待视觉审查)、formulas_reject.jsonl(5个,审查未通过)、ownership_train.jsonl(47个,提供了字符级别的笔画到符号归属标注,包含样本ID、字符标签和原始笔画索引组)。所有数据已完成隐私处理,适用于训练和验证手写数学表达式识别模型,但存在已知限制:规模较小(仅119个表达式、8位书写者),类别分布不均衡,待审查和拒绝的公式不应自动纳入训练,且仅有47个公式具有字符级所有权标注。数据集遵循DATA_USE_NOTICE.md许可,禁止用于身份推断、重新识别或基于笔迹的个人画像,且不授予第三方商业重用的通用许可。

AIFlow Math Ink 0.9 Public Stroke Dataset is a public dataset for online handwritten mathematical expression recognition. It contains 119 mathematical expressions collected from 8 writers in 12 sessions, of which 70 are from public web collection and 49 from device playback. The data is stored as stroke trajectory sequences, each record preserving the original stroke order, point coordinates (x, y), timestamps relative to the formula (t_ms), and sensor information such as pressure, tilt, and contact geometry (if available). Additionally, it includes canvas size, ground truth labels/relations, review status, reproducible local writer IDs, and session groups. The dataset is divided into four JSONL files: formulas_valid.jsonl (110 reviewed, usable for training/analysis), formulas_pending.jsonl (4 pending visual review), formulas_reject.jsonl (5 rejected), and ownership_train.jsonl (47 providing character-level stroke-to-symbol attribution annotations, including sample IDs, character labels, and raw stroke index groups). All data has been privacy-processed and is suitable for training and validating handwritten mathematical expression recognition models, but with known limitations: small scale (only 119 expressions, 8 writers), imbalanced class distribution, pending and rejected formulas should not be automatically included in training, and only 47 formulas have character-level ownership annotations. The dataset follows the DATA_USE_NOTICE.md license, prohibiting use for identity inference, re-identification, or handwriting-based personal profiling, and does not grant general third-party commercial reuse rights.

创建时间:
2026-08-08
原始信息汇总

AIFlow Math Ink 0.9 公共笔迹数据集

数据集概述

AIFlow Math Ink 0.9 是一个韩语和英语的在线手写数学公式笔迹数据集,主要用于图像分类任务,具体涉及数学表达式识别、轨迹和笔画序列分析。数据集规模较小,总计包含154个公式样本。

数据构成

文件 数量 用途
data/formulas_valid.jsonl 110个公式 已验收的学与分析候选数据
data/formulas_pending.jsonl 39个公式 待视觉验收,默认不纳入训练
data/formulas_reject.jsonl 5个公式 验收未通过,默认不纳入训练
data/ownership_train.jsonl 47个公式 经过人工验收的笔画到符号归属标注

数据来自11位数据集本地书写者,共15个会话组。其中105个公式来自公开网页收集,49个来自所属者手机回放。

记录内容

每个公式记录包含:

  • 原始笔画顺序与点顺序
  • xy坐标及公式相对时间t_ms
  • 压力、倾斜角、接触几何等传感器数据(如有)
  • 画布大小、目标标记/关系、验收状态
  • 可复现的数据集本地writer_idsession_group

ownership_train.jsonl提供样本ID、字符标签和原始笔画索引组。

隐私处理

公共版本已移除贡献者/会话/提示的原始ID、记录时间、IP、原始路径、PNG数据URL、基于纪元时间的时间原点及原始压力值。书写者/会话值采用与私有映射分离的数据集本地别名,每个公式的首个点时间移至t_ms=0

验证方式

可通过以下命令验证: bash python scripts/validate_public_dataset09.py . --expected-records 154 --expected-ownership 47

验证器检查154条记录、质量划分、47条归属行、SHA-256、禁用字段缺失、笔画/点数量、时间原点及归属一致性。

许可与限制

遵循DATA_USE_NOTICE.md。数据集基于参与者同意及管理员确认公开发布,但未声明允许第三方商业再使用的标准许可。禁止用于身份推断、重新识别或基于字迹的个人画像分析。

已知局限

  • 仅154个公式、11位书写者,规模较小
  • 类别分布不均衡
  • pending和reject数据不应自动纳入训练
  • 仅47个公式具备字符级归属验收
  • CROHME不包含在本仓库中,仅用于单独的非商业研究验证
搜集汇总
数据集介绍
aiflow-math-ink-0.9-dataset 数据集图片
构建方式
在在线手写数学表达式识别研究领域,轨迹级标注数据的稀缺长期制约着模型对笔序与符号归属的建模能力。AIFlow Math Ink 0.9 数据集由数据管理者在确认参与者公开分发授权后构建,采集范围涵盖105条公开网络书写与49条所有者手机重放记录,经统一清洗后保留原始笔序、点序、公式相对时间戳及压力、倾斜等传感器读数。数据经视觉审核划分为有效、待定与拒绝三类,并采用数据集本地化的匿名writer与session别名,同时移除原始标识、IP、原始压力等敏感字段,以确保可复现性与隐私安全。
特点
该数据集以在线手写数学表达式的笔画序列为核心载体,共收录154条公式记录,涉及11个本地writer组与15个session组。其显著特征在于完整保留原始笔画顺序与逐点坐标信息,并提供字符级stroke-to-symbol归属标注,为细粒度符号定位与轨迹解析研究提供了基础。数据按质量状态分层,有效集可直接用于训练与分析,待定与拒绝集则明确排除于默认训练流程。各记录附带画布尺寸、目标token及关系标签,同时数据集规模较小且类别分布不均衡,需谨慎评估泛化性能。
使用方法
研究者可依据质量分层策略加载data目录下的JSONL文件,以formulas_valid.jsonl作为训练与验证的主数据源,将formulas_pending.jsonl与formulas_reject.jsonl排除于默认学习流程之外。ownership_train.jsonl适用于字符级符号归属监督任务,可结合sample_id与原始stroke索引进行定位分析。使用前建议运行validate_public_dataset09.py脚本核验记录数、质量划分、字段完整性及时间原点一致性。数据仅限非商业研究用途,须遵守DATA_USE_NOTICE.md,严禁用于身份推断、再识别或笔迹画像。
背景与挑战
背景概述
在线手写数学表达式识别作为文档分析与模式识别领域的核心课题,长期受制于公开笔迹轨迹数据稀缺的困境。AIFlow Math Ink 0.9 数据集于2026年8月9日前完成公开授权确认,由AIFlow团队构建,旨在为手写数学表达式识别模型提供包含原始笔画序列与传感器信息的在线书写轨迹资源。该数据集涵盖154条公式、11位书写者及15个会话组,以韩英双语标注,聚焦笔画到符号的归属关系与轨迹建模,为数学表达式结构解析、触控笔输入分析等任务提供了可复现的实验基准。
当前挑战
数学表达式识别需同时处理符号分类与二维空间关系解析,其难点在于笔画顺序的任意性、符号间嵌套结构的歧义性以及书写风格的个体差异,这些因素共同导致模型泛化困难。构建方面,数据集规模仅154条公式且类别分布失衡,易引发训练偏差;仅有47条公式完成字符级归属人工核验,其余样本的标注完整性受限;待审与拒绝样本若误入训练将引入噪声;同时需在开放科学价值与隐私保护间取得平衡,剔除原始标识、时间戳及压力数据,限制了部分时序建模研究。
常用场景
经典使用场景
在在线手写数学表达式识别这一长期吸引模式识别与教育科技领域的研究方向上,该数据集以原始笔迹轨迹为基本单元,完整保留了笔画的时序顺序、坐标、相对时间戳以及若干传感器信号,为构建端到端的手写公式解析模型提供了珍贵的真实书写样本。经典使用方式聚焦于基于笔画的数学符号分类与公式结构解析,研究者可借助轨迹序列直接训练序列到序列的识别网络,或将笔画分组与符号归属任务作为预训练目标,以探索手写数学表达式中空间布局与时间动态的联合建模。
解决学术问题
针对手写数学表达式识别中长期存在的笔画与符号对齐困难、公式结构歧义以及书写风格差异导致泛化性能不足等学术难题,该数据集通过提供经人工核验的stroke-to-symbol归属标注以及质量分级策略,使监督信号得以精确到笔画级别,从而支持细粒度的符号定位与关系抽取研究。其引入的书写者与会话分组信息有助于评估模型在跨书写者场景下的稳健性,为缓解数据泄漏与过拟合问题提供了可复现的实验基准,对推动在线数学手写识别领域的方法论严谨性具有积极意义。
衍生相关工作
围绕该数据集,后续工作可能衍生出面向笔画级数学符号分类的基准模型、基于ownership标注的弱监督符号分组方法,以及针对小型手写数据集的跨书写者泛化评估协议。其质量分级策略亦可能启发数据清洗与半自动标注流程的研究,推动构建更标准化、可复现的在线数学手写数据资源。该数据集与CROHME等公开评测的互补使用,有望促进非商业研究场景下轨迹建模与结构解析方法的比较与迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务