登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Akshara_dataset
Akshara_dataset
收藏
kaggle
2024-04-25 更新
2025-12-06 收录
多语言音译
印度语言处理
数据链接:
https://www.kaggle.com/datasets/lokendra008/akshara-dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Indian languages Transliteration Dataset
印度语言转写数据集(Indian languages Transliteration Dataset)
应用场景:
创建时间:
2024-04-25
相关数据集
OCR 合成基准数据集用于印度语言
OCR
印度语言处理
本数据集名为‘OCR合成基准数据集用于印度语言’,由EkStep基金会和Tarento科技创建,包含90,000张图像及其对应的真实标签,涵盖23种印度语言。数据集通过合成数据生成技术创建,旨在为光学字符识别(OCR)模型提供多样化训练数据,以提高模型在印度语言上的准确性和鲁棒性。该数据集适用于计算机视觉和图像处理领域,特别是在处理多语言和复杂文档图像时,能够有效提升模型的性能和泛化能力。
arXiv
2022-05-05 更新
26
0
ai4bharat/IndicMSMARCO
信息检索
印度语言处理
IndicMSMARCO是一个面向印度语言的多元语言信息检索基准数据集,包含精心挑选的查询和对应的高质量翻译段落。支持13种印度语言,适用于信息检索/段落排名任务,具有多样化的主题和查询复杂度。
Hugging Face
2025-06-03 更新
10
0
IndicParam
印度语言处理
基准测试
IndicParam是一个研究生级别的基准测试,旨在评估大型语言模型(LLMs)对低资源和极低资源印度语言的理解能力。数据集包含来自官方UGC-NET语言试题和答案的13,207道多选题(MCQs),涵盖11种印度语言以及一个单独的梵语-英语混合代码集。这些题目分为语言理解(语言学、语法等)和常识(文学、文化、历史等)两大类。数据集支持多种任务,包括多选题回答、语言理解评估、常识评估和问题类型评估
Hugging Face
2025-12-10 更新
8
0
MultiDiac
自然语言处理
多语言音译
MultiDiac是一个多语言数据集,用于评估大型语言模型在阿拉伯语和约鲁巴语中的文本标音效果。该数据集包含多样化的样本,涵盖了各种标音歧义。研究机构 Mohamed Bin Zayed University of Artificial Intelligence 与三位母语为约鲁巴语的语言学家合作收集了约350个基本单词,每个单词都有多个有效的标音形式,并构建了3到4个语境丰富的句子来确保多样性和
arXiv
2025-06-13 更新
17
0
elevenlabs dubbing
语音合成
多语言音译
Elevenlabs Dubbing API allows you to dub audios in another language with the voice you want.
RapidAPI
2024-09-17 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广