遇见数据集

Uyghur

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

Uyghur AI Corpus 是一个精心策划的维吾尔语文本数据集,旨在为人工智能模型提供基础训练资源,使大语言模型能够理解、生成和翻译维吾尔语。数据集源自公开互联网,收集了多年来在各种公共平台、论坛和网站上分享的维吾尔族集体知识遗产,包括故事、散文、文章和历史记载等。原始网络数据经过仔细清洗、格式化并结构化处理,以满足高质量AI训练标准。数据集中尽可能地保留了元数据(如作者和来源),以尊重原始创作者。数据集包含以下字段:标题(title)、主要文本内容(text)、作者(author)、来源平台(source)、发布日期(date)以及译者(translator)。该数据集适用于文本生成、翻译和掩码填充等自然语言处理任务。最新更新(2026年2月)新增了维吾尔语文章和诗歌。数据集许可证为MIT。

Uyghur AI Corpus is a carefully curated Uyghur text dataset designed to provide foundational training resources for AI models, enabling large language models to understand, generate, and translate Uyghur. The dataset originates from public internet, collecting the collective knowledge heritage of the Uyghur people shared over the years on various public platforms, forums, and websites, including stories, essays, articles, and historical records. The original web data has been carefully cleaned, formatted, and structured to meet high-quality AI training standards. Metadata (such as author and source) are preserved as much as possible to respect the original creators. The dataset contains the following fields: title, text, author, source, date, and translator. It is suitable for natural language processing tasks such as text generation, translation, and masked language modeling. The latest update (February 2026) added Uyghur articles and poems. The dataset is licensed under MIT.

创建时间:
2026-08-03
原始信息汇总

数据集概述

Uyghur Corpus (AI-Optimized) 是一个专为人工智能训练优化的维吾尔语语料库,旨在通过提供高质量文本数据,帮助大语言模型(LLMs)理解、生成和翻译维吾尔语。

基本信息

  • 语言: 维吾尔语(ug)
  • 许可证: MIT
  • 任务类别: 文本生成(text-generation)、翻译(translation)、掩码填充(fill-mask)
  • 标签: uyghur、corpus、nlp、uyghur-dataset、uyghur-ai
  • 数据集主页: https://huggingface.co/datasets/Uyghur-Corpus/Uyghur
  • 配置: 默认配置(default),包含一个训练集(train),数据文件格式为 *.jsonl

数据集内容与来源

该语料库是从开放的互联网上精心收集并整理的文本集合,代表了维吾尔民族在各类公共平台、论坛和网站上分享的集体知识遗产。来源类型包括:

  • 故事(Stories)
  • 散文(Essays)
  • 文章(Articles)
  • 历史记述(Historical accounts)

原始网页数据经过细致的清洗、格式化和结构化处理,以满足高质量AI训练的标准。在收集过程中,尽可能保留了原始创作者的 author(作者)和 source(来源)元数据,以尊重知识产权。

数据字段说明

字段名 含义
title 作品标题
text 训练使用的主要文本内容
author 作品原作者
source 作品来源平台
date 发布日期
translator 译者姓名

更新动态(2026年2月更新)

数据集近期进行了内容更新,新增了维吾尔语文章和诗歌。

搜集汇总
数据集介绍
Uyghur 数据集图片
构建方式
在低资源语言数字存续需求日益迫切的背景下,该数据集采用开放互联网文本采集与人工精筛相结合的构建策略。原始语料源自多个公共平台、论坛及网站中公开发表的维吾尔语故事、散文、文章与历史记述,经过去噪、格式规范化与结构化处理,形成符合大语言模型训练标准的高质量文本集合。构建过程中,作者与来源等元数据被尽可能保留,以尊重原始创作者的智力贡献,同时确保语料在语言多样性与文本纯度上达到AI训练要求。
特点
该数据集以维吾尔语为核心语言,面向文本生成、翻译与完形填空等多项自然语言处理任务,具备鲜明的低资源语言赋能特征。数据字段涵盖标题、正文、作者、来源、日期与译者,兼顾内容语义与出处溯源。语料来源多样,文体丰富,包含文学性与知识性文本,能够反映维吾尔语在真实语境中的表达习惯。数据持续更新,收录新近文章与诗歌,并遵循MIT许可协议,便于学术研究与商业应用中的合法使用与二次开发。
使用方法
使用者可通过HuggingFace平台直接加载默认配置,数据以JSONL格式按训练集划分存储,便于与主流深度学习框架无缝衔接。针对文本生成任务,可将title与text字段作为条件与目标文本进行微调;面向翻译或完形填空任务,则依据具体任务构造输入输出对。字段author、source、date与translator可用于溯源分析或元数据增强研究。加载后建议根据任务需求进行分词、截断与批处理,并注意遵守MIT许可协议中关于署名与使用的相关条款。
背景与挑战
背景概述
在人工智能时代,语言资源的数字化成为维系语言活力的关键。维吾尔语作为中国新疆地区的重要语言,其自然语言处理研究长期受限于高质量语料匮乏。为应对这一困境,Uyghur AI Corpus于2026年2月完成重大更新,由社区驱动、开放维护,旨在为大规模语言模型提供基础训练资源。该数据集汇集了公开互联网上的故事、散文、诗歌及历史记述,并尽可能保留作者与来源元数据,体现了对知识产权的尊重。其核心研究问题在于如何使机器以母语级水平理解、生成与翻译维吾尔语,从而在数字空间中延续文化遗产。这一工作对低资源语言的人工智能发展具有示范意义,推动了维吾尔语在机器翻译、文本生成等任务中的性能提升。
当前挑战
维吾尔语AI语料库面临双重挑战。领域层面,维吾尔语属于黏着语,形态复杂且方言差异显著,现有模型难以准确捕捉其构词与句法规律,导致生成与翻译质量不稳定;同时,公开语料多源于网络,噪声高、标注稀疏,且版权与隐私问题交织,增加了数据合规使用的难度。构建层面,从开放互联网采集的文本需经历清洗、去重、格式化等繁复工序,而保留作者与来源信息更对元数据管理提出精细要求;此外,语料随时间动态增长,维护者需持续更新并平衡数据多样性与代表性,避免模型偏见。这些挑战共同制约着维吾尔语智能处理技术的实用化进程。
常用场景
经典使用场景
在低资源语言自然语言处理领域,Uyghur语料库最经典的使用场景是支撑乌兹别克语大语言模型的预训练与微调任务。研究者依托该数据集中丰富且经过清洗的文本,包括故事、散文、诗歌与历史记述,开展语言建模、掩码填充与机器翻译等实验。尤为重要的是,该语料库以原生文本训练模型理解乌兹别克语的形态学特征与语境依赖关系,从而在文本生成任务中产出符合本族语表达习惯的内容,为低资源语言的数字化生存提供了关键的数据基座。
解决学术问题
该数据集主要缓解了乌兹别克语在自然语言处理研究中长期面临的数据匮乏与质量参差问题。过往学术探索受限于公开可用语料的稀缺,难以有效训练具备稳健性能的乌兹别克语模型,而本语料库通过汇聚互联网公开文本并保留作者与来源元数据,为语言模型训练提供了高质量且可追溯的数据来源。其意义在于推动了低资源语言在生成、翻译与语义理解等任务上的可复现研究,并促进了语言资源建设方法论的反思与进步。
衍生相关工作
围绕该数据集,学术界与工业界衍生出一系列相关经典工作,包括基于其训练的乌兹别克语预训练语言模型、双语神经机器翻译系统以及面向低资源语言的迁移学习框架。部分研究进一步利用其元数据信息开展作者归属与文体分析,拓展了计算语言学的应用边界。这些工作不仅验证了语料库的实用价值,也激励了更多面向突厥语系语言的资源建设与模型优化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务