登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
PM INDIA "Mann ki Baat"
PM INDIA "Mann ki Baat"
收藏
kaggle
2020-09-01 更新
2024-03-07 收录
多语言文本处理
Indian Languages NLP
数据链接:
https://www.kaggle.com/datasets/taruntiwarihp/pm-india-mann-ki-baat
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
7 Indic Languages NLP
7种印度语支语言自然语言处理(Natural Language Processing,NLP)
应用场景:
创建时间:
2020-09-01
相关数据集
TDT3 Multilanguage Text Version 2.0
多语言文本处理
主题检测与跟踪
Introduction Topic Detection and Tracking (TDT) refers to automatic techniques for finding topically related material in streams of data such as newswire and broadcast news. The TDT3 corpus was create
DataONE
2023-06-15 更新
38
0
patrikgerard/combined_uk_ru_dataset_v3
多语言文本处理
机器学习
该数据集包含多个特征,包括唯一标识符(unique_id)、输入(input)、分类(classification)和原始数据集(original_dataset)。数据集分为训练集和测试集,训练集包含16417个样本,测试集包含1824个样本。数据集的总下载大小为8831638字节,总数据集大小为18666794字节。
Hugging Face
2024-07-12 更新
15
0
CL4Lang
跨语言抄袭检测
多语言文本处理
该数据集用于跨语言抄袭检测评估,包含来自4种语言(俄语、亚美尼亚语、西班牙语和英语)的维基百科文章子集。查询部分包含每种语言的维基百科文档,这些文档的句子通过Google Translate API从集合中翻译而来,并带有XML标记。数据集的目的是帮助开发跨语言抄袭检测方法。
Hugging Face
2024-10-10 更新
12
0
wikipedia-RuDataset
多语言文本处理
语言模型训练
RuDataset是一个用于训练语言模型的俄语数据集,特别适用于聊天格式的训练。该数据集包含了从维基百科中提取的文章,这些文章已经过清理和格式化,去除了元数据和特殊字符,并进行了文本规范化处理。数据集以Parquet格式存储,使用Snappy压缩和UTF-8编码。它适用于LLM训练、fine-tuning、创建embeddings和模型测试。
Hugging Face
2025-01-23 更新
31
0
NTB_pre
多语言文本处理
文本分类
这是一个俄语文本数据集,包含少于1000个样本,适用于文本分类和文本摘要任务。
Hugging Face
2025-11-28 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广