登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Most spoken Indian languages worldwide 2025
Most spoken Indian languages worldwide 2025
收藏
Statista
2026-04-11 收录
印度语言学
语言统计
数据链接:
https://www.statista.com/statistics/1614099/worldwide-indian-languages-spoken/
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Most spoken Indian languages worldwide in 2025 (in millions)
应用场景:
相关数据集
google/IndicGenBench_crosssum_in
多语言生成
印度语言学
IndicGenBench数据集,特别是其子集CrossSum-IN,是一个多语言、多任务并行基准测试,旨在评估大型语言模型(LLMs)在29种印度语言上的生成能力。该数据集涵盖了13种书写系统和4种语言家族,包括孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、泰米尔语、泰卢固语、乌尔都语、阿萨姆语、博杰普尔语、尼泊尔语、奥里亚语、旁遮普语、普什图语、梵语、阿瓦德语、哈里亚纳语、藏
Hugging Face
2024-05-04 更新
63
0
Statisitics of Irish Speakers
语言统计
爱尔兰语言
Number of Irish speakers broken down by age group, county, etc.
kaggle
2020-10-26 更新
15
0
Cognitive-Lab/Aya_Dataset_Indic
印度语言学
自然语言处理
该数据集包含多种语言(如孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、缅甸语、尼泊尔语、旁遮普语、僧伽罗语、信德语、泰米尔语、泰卢固语和乌尔都语)的文本数据。每个语言的数据集包含输入(inputs)、目标(targets)、语言(language)、语言代码(language_code)、注释类型(annotation_type)和用户ID(user_id)等特征。数据集主要用于
Hugging Face
2024-03-08 更新
15
0
ai4bharat dataset
自动语音识别
印度语言学
Shrutilipi_bn is a labelled ASR corpus by Ai4Bharat
kaggle
2022-10-19 更新
22
0
microsoft/Updesh_beta
多语言模型
印度语言学
Updesh是一个大规模的合成数据集,旨在推动印度语系的LLM后训练。它结合了翻译推理数据和合成的开放域生成内容,以支持基于印度语言和文化背景的多语言LLM适应。Updesh通过提供丰富的多语言指令调整数据,填补了高质量、文化基础资源在印度语系中的空白。
Hugging Face
2025-07-07 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广