Violet-yo/Chinese-Braille-Dataset-10per-Tone
收藏资源简介:
`Chinese-Braille-10per-Tone`数据集旨在解决公开可用的中文盲文数据集稀缺的问题。原始数据来源于Leipzig Corpora Collection,包含2007年至2009年间从新闻媒体收集的一百万个离散句子。这些句子通过中国盲文在线平台的工具转换为带有完整声调的盲文,形成了`Chinese-Braille-Dataset-Full-Tone`数据集。经过数据清洗和去重后,数据集规模缩减至约60万句。为了模拟实际使用中省略90%声调的情况,从完整声调数据集中随机移除了90%的声调,生成了`Chinese-Braille-10per-Tone`数据集。此外,还创建了一个完全移除声调的`Chinese-Braille-Dataset-No-Tone`数据集。数据集统计信息包括训练、验证和测试集的样本数量、盲文和中文句子的平均和中位长度。
`Chinese-Braille-10per-Tone`数据集旨在解决公开可用的中文盲文数据集稀缺的问题。原始数据来源于Leipzig Corpora Collection,包含2007年至2009年间从新闻媒体收集的一百万个离散句子。这些句子通过中国盲文在线平台的工具转换为带有完整声调的盲文,形成了`Chinese-Braille-Dataset-Full-Tone`数据集。经过数据清洗和去重后,数据集规模缩减至约60万句。为了模拟实际使用中省略90%声调的情况,从完整声调数据集中随机移除了90%的声调,生成了`Chinese-Braille-10per-Tone`数据集。此外,还创建了一个完全移除声调的`Chinese-Braille-Dataset-No-Tone`数据集。数据集统计信息包括训练、验证和测试集的样本数量、盲文和中文句子的平均和中位长度。
Chinese Braille Dataset
数据集描述
Chinese-Braille-10per-Tone 数据集解决了公开可用中文盲文数据集稀缺的问题。原始中文文本数据来源于公开的 Leipzig Corpora Collection,包含2007年至2009年间从新闻媒体收集的100万条独立句子。
中文汉字通过中国盲文在线平台的工具转换为“全音调”盲文,形成 Chinese-Braille-Dataset-Full-Tone 数据集。该工具基于规则的方法标注汉字发音并转换为盲文,但有时会返回错位数据和乱码。经过数据清洗和去重后,数据集大小减少至约60万条句子。
随机移除 Chinese-Braille-Dataset-Full-Tone 数据集中90%的音调,生成 Chinese-Braille-10per-Tone 数据集,以模拟现实世界中盲文使用中约90%音调被省略的情况。通过识别和排除数字及标点符号,确保仅移除音调标记。
此外,还创建了 Chinese-Braille-Dataset-No-Tone 数据集,移除了 Chinese-Braille-Dataset-Full-Tone 数据集中的所有音调。
数据集统计
| # 样本数 | 盲文长度(均值/中位数)字符串 | 盲文长度(均值/中位数)标记 | 中文长度(均值/中位数)字符串 | 中文长度(均值/中位数)标记 | |
|---|---|---|---|---|---|
| 训练集 | 525072 | 145/112 | 149/115 | 74/64 | 59/51 |
| 验证集 | 65634 | 117/96 | 121/99 | 71/62 | 57/50 |
| 测试集 | 65634 | 107/90 | 111/93 | 72/63 | 58/50 |
资源
- 主页: Vision-Braille
- 仓库: Github
- 论文: arXiv
- HuggingFace:




