登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
adeshkin/kjh-mono-sents
adeshkin/kjh-mono-sents
收藏
Hugging Face
2026-05-18 更新
2026-05-31 收录
低资源语言语料库
哈卡斯语文本生成
数据链接:
https://hf-mirror.com/datasets/adeshkin/kjh-mono-sents
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
该数据集包含416,141个哈卡斯语(kjh)句子。
This dataset contains 416,141 sentences in the Khakas language (kjh).
应用场景:
提供机构:
adeshkin
相关数据集
塞尔维亚语通用文本语料库
低资源语言语料库
多语言模型适配
本数据集面向需要覆盖巴尔干地区语言的多语言AI项目,为塞尔维亚语这类低资源语言提供宝贵的训练数据。包含0.51亿条塞尔维亚语文本,覆盖日常表达及基础领域文档。 尽管规模相对有限,但本数据集聚焦塞尔维亚语特有的西里尔/拉丁双文字系统及阴阳性变位,经过专项清洗与对齐,可作为多语言模型增量训练或特定任务微调的核心语料,提升模型在该语言上的基础理解能力。
国家数据集管理服务平台
2026-04-28 更新
11
0
Assamese Corpus
低资源语言语料库
阿萨姆语NLP
Assamese Corpus was developed in the NLP Lab of Gauhati University. Total size of Assamese Corpus (in terms of words) is 1.6 million (1613551 words). The Corpus is prepared...
B2FIND
10
0
galsenai/wolof_centalized_corpus
沃洛夫语自然语言处理
低资源语言语料库
该数据集是一个文本数据集,包含212,904个训练示例,总大小约为23.7 MB。每个示例包含text字段(字符串类型,表示文本内容)和sources字段(字符串列表,表示文本来源)。数据集仅提供训练分割,用于自然语言处理任务,如文本分析或模型训练,但具体用途和领域未在README中明确说明。
Hugging Face
2026-05-09 更新
7
0
igbo_monolingual
低资源语言语料库
多语言自然语言处理
Igbo Monolingual Dataset 旨在提供尼日利亚伊博语的单语语料数据,规模包含数千条样本。该数据集内容涵盖多种来源,包括书籍章节、新闻报道等,并针对不同来源的数据设置了不同的字段,例如标题、内容、日期等。此数据集支持文本生成和掩码填充等任务。数据集的具体授权许可信息待补充。
OpenCSG
2024-07-19 更新
10
0
mbazaNLP/kinyarwanda_monolingual_v01.0
低资源语言语料库
基尼亚卢旺达语NLP
--- task_categories: - text-generation language: - rw size_categories: - 1K !!! PLEASE USE mbazaNLP/kinyarwanda_monolingual_v01.1 !!! # <span style="col
Hugging Face
2024-10-24 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广