登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
fine-tuning data
fine-tuning data
收藏
kaggle
2025-05-12 更新
2025-07-12 收录
中文文字识别
自然语言处理微调
数据链接:
https://www.kaggle.com/datasets/sciamano/positive-sample
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
use to fine tune Gemma2 for Chinese pinyin recognition
用于微调Gemma2以实现中文拼音识别。
应用场景:
创建时间:
2025-03-12
相关数据集
RCTW-17 (Reading Chinese Text in the Wild)
中文文字识别
计算机视觉
RCTW-17 是一个阅读图像中的中文文本的比赛。对于训练和测试,我们提供了一个包含各种图像的大规模数据集,包括街景、海报、菜单、室内场景和屏幕截图。
OpenDataLab
2026-07-12 更新
108
0
Chinese Text in the Wild
中文文字识别
图像处理
Chinese Text in the Wild 是一个包含约 100 万个汉字的中文文本数据集,来自 3850 个独特的汉字,由专家在 30000 多张街景图像中进行注释。这是一个具有挑战性的数据集,具有良好的多样性,包含平面文本、凸起文本、光照不足的文本、远距离文本、部分遮挡的文本等。
OpenDataLab
2026-08-23 更新
20
0
ASR-CIntervCSC: A Chinese Interview Conversational Speech Corpus
中文文字识别
访谈对话处理
Sample:
MagicHub开源社区
2022-08-25 更新
15
0
irregular handwritten Chinese character dataset,IHCCD
手写识别
中文文字识别
This article collects the first set of irregular handwritten Chinese character dataset (IHCCD), which includes 3755 categories and 30 samples for each category. IHCCD is handwritten by different non-s
DataCite Commons
2025-04-27 更新
49
0
aidatatang
中文文字识别
声纹识别
aidatatang语料库的内容和相应的描述包括: 语料库包含200小时的声学数据,主要是移动记录的数据。 邀请了来自中国不同口音地区的600位演讲者参与录音。 每个句子的转录准确率大于 98%。 录音在安静的室内环境中进行。 数据库按7:1:2的比例分为训练集、验证集和测试集。 语音数据编码和说话人信息等详细信息保留在元数据文件中。 还提供了分段的成绩单。 该语料库旨在支持语音识别、机器翻译、声
OpenXLab
19
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广