登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Normalization of characters having the same pronunciations.
Normalization of characters having the same pronunciations.
收藏
Figshare
2023-12-14 更新
2026-04-28 收录
文本规范化
同音字处理
数据链接:
https://figshare.com/articles/dataset/Normalization_of_characters_having_the_same_pronunciations_/24811091
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Normalization of characters having the same pronunciations.
应用场景:
创建时间:
2023-12-14
相关数据集
bene-ges/en_gtn_vocab
文本规范化
自然语言处理
该数据集是从Google文本规范化数据集中提取的词汇表,包含(semiotic_class, normalized, non-normalized, freq)元组。它通过一个特定的脚本生成,并可以用于快速文本规范化。
Hugging Face
2023-08-04 更新
33
0
D435_Chinese_Text_Normalization_Data
文本处理
文本规范化
本套TN数据包括200,475句原始文本,每句标注文本中的特殊符号及数字的汉字读法。
OpenCSG
2026-03-04 更新
14
0
hinglishNorm
文本规范化
自然语言处理
hinglishNorm是由Vahan Inc创建的一个包含13494个Hindi-English混合语句的数据集,专门用于文本规范化任务。该数据集的特点是每个句子都配有其人工标注的规范化形式,旨在解决非标准文本到标准格式的转换问题。数据集的创建过程包括数据收集、过滤与清洗、以及人工标注等步骤。hinglishNorm主要应用于自然语言处理领域,特别是在为印度用户构建互联网应用时,处理混合语言文本
arXiv
2020-10-18 更新
8
0
thangvip/thuvienphapluat-qa-normalize
法律问答
文本规范化
该数据集包含多个配置,每个配置都有相同的特征:标题(title)、问题(question)、内容(content)和标准化答案(normalize_answer)。每个配置的训练集包含1000个样本,数据集的大小和下载大小因配置不同而有所变化。
Hugging Face
2024-04-10 更新
24
0
Ahmadsameh8/QalbPreprocessedAndMergedwithoutPunct
阿拉伯语语法
文本规范化
--- dataset_info: features: - name: correct dtype: string - name: incorrect dtype: string splits: - name: train num_bytes: 18912610 num_examples: 18350 - name: validation
Hugging Face
2024-04-30 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广