遇见数据集

anke01/uyghur-dictionary-dataset

收藏
Hugging Face2026-03-01 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - ug - zh - en license: apache-2.0 library_name: datasets tags: - translation - dictionary - uyghur - chinese - english - multilingual task_categories: - translation size_categories: - 1M<n<10M --- # 维吾尔语多语言词典数据集 维吾尔语-汉语-英语多语言词典数据集,适用于大型语言模型(LLM)微调训练。 ## 数据集统计 | 数据集 | 条目数 | 大小 | 语言方向 | |--------|--------|------|----------| | `ug-cn.jsonl` | 3,079,016 | 456 MB | 维吾尔语 ⟷ 汉语 | | `ug-en.jsonl` | 685,836 | 108 MB | 维吾尔语 ⟷ 英语 | | `en-ug.jsonl` | 705,534 | 112 MB | 英语 ⟷ 维吾尔语 | | `ug-ug.jsonl` | 139,920 | 46 MB | 维吾尔语释义 | | `cn-cn.jsonl` | 127,646 | 39 MB | 汉语释义 | **总计**: 4,737,952 条(双向)/ 约 236 万唯一对 ## 数据格式 ```json { "instruction": "请翻译以下维吾尔语词汇", "input": "مەركىزى", "output": "中心的,中央的" } ``` 字段说明: - `instruction`: 任务指令 - `input`: 输入文本 - `output`: 输出文本 ## 使用示例 ```python import json with open('uyghur_data/output/ug-cn.jsonl', 'r', encoding='utf-8') as f: for line in f: data = json.loads(line) print(f"输入: {data['input']}") print(f"输出: {data['output']}") ``` ## 数据来源 - Gheyret 词典 (~37万条) - Tilkan 词典数据库 (150MB) - Bilkan 词典 (5方向) - Online Dictionary (~33万条) ## 文件位置 ``` uyghur_data/output/ ├── ug-cn.jsonl # 维汉数据集 ├── ug-en.jsonl # 维英数据集 ├── en-ug.jsonl # 英维数据集 ├── ug-ug.jsonl # 维维释义 └── cn-cn.jsonl # 汉汉释义 ``` --- **版本**: 1.0 | **更新**: 2025-03-01

--- 语言: - 维吾尔语(Uyghur) - 汉语(Chinese) - 英语(English) 许可证:Apache-2.0 所用库:datasets 标签: - 翻译 - 词典 - 维吾尔语 - 汉语 - 英语 - 多语言 任务类别: - 翻译 数据规模: - 100万 < 条目数 < 1000万 --- # 维吾尔语多语言词典数据集 本数据集为维吾尔语-汉语-英语多语言词典数据集,可用于大语言模型(Large Language Model,LLM)的微调训练。 ## 数据集统计 | 数据集文件 | 条目数量 | 文件大小 | 语言对方向 | |--------|--------|------|----------| | `ug-cn.jsonl` | 3,079,016 | 456 MB | 维吾尔语 ⟷ 汉语 | | `ug-en.jsonl` | 685,836 | 108 MB | 维吾尔语 ⟷ 英语 | | `en-ug.jsonl` | 705,534 | 112 MB | 英语 ⟷ 维吾尔语 | | `ug-ug.jsonl` | 139,920 | 46 MB | 维吾尔语内部释义 | | `cn-cn.jsonl` | 127,646 | 39 MB | 汉语内部释义 | **总计**: 4,737,952 条(双向)/ 约 236 万唯一语对 ## 数据格式 json { "instruction": "请翻译以下维吾尔语词汇", "input": "مەركىزى", "output": "中心的,中央的" } 字段说明: - `instruction`:任务指令 - `input`:输入文本 - `output`:输出文本 ## 使用示例 python import json with open('uyghur_data/output/ug-cn.jsonl', 'r', encoding='utf-8') as f: for line in f: data = json.loads(line) print(f"输入: {data['input']}") print(f"输出: {data['output']}") ## 数据来源 - Gheyret词典(约37万条) - Tilkan词典数据库(150 MB) - Bilkan词典(支持5个语种方向) - 在线词典(Online Dictionary,约33万条) ## 文件存储路径 uyghur_data/output/ ├── ug-cn.jsonl # 维汉双语语料集 ├── ug-en.jsonl # 维英双语语料集 ├── en-ug.jsonl # 英维双语语料集 ├── ug-ug.jsonl # 维吾尔语内部语料集 └── cn-cn.jsonl # 汉语内部语料集 --- **版本**: 1.0 | **更新日期**: 2025年3月1日

提供机构:
anke01
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,词典资源对于低资源语言的机器翻译与模型微调具有基础性作用。该数据集整合了Gheyret词典、Tilkan词典数据库、Bilkan词典及在线词典等多源异构语料,通过清洗、对齐与标准化处理,构建了涵盖维吾尔语-汉语、维吾尔语-英语、英语-维吾尔语、维吾尔语释义及汉语释义五个子集的综合词典数据集。数据总量近474万条,约236万唯一翻译对,采用统一的JSONL格式存储,每条记录包含任务指令、输入文本与输出文本三个字段,为多语言翻译任务提供了结构化的训练素材。
使用方法
研究者可基于HuggingFace Datasets库直接加载该数据集,或通过Python读取本地JSONL文件进行灵活处理。典型应用场景包括维吾尔语相关的大语言模型指令微调、机器翻译模型训练以及多语言词典增强。使用时需注意各子集文件的路径结构,并根据任务需求选择对应的语言方向子集,例如翻译任务可选用ug-cn或ug-en文件,语义理解任务可结合ug-ug与cn-cn文件。数据格式简洁,便于集成至标准训练流水线中。
背景与挑战
背景概述
在低资源语言自然语言处理领域,维吾尔语作为突厥语族的重要成员,因其独特的语法结构和稀缺的数字化资源,长期面临机器翻译与语言模型训练的数据瓶颈。为弥合这一鸿沟,anke01团队于2025年3月发布了维吾尔语多语言词典数据集,该数据集整合了Gheyret词典、Tilkan数据库、Bilkan词典及在线资源,汇聚近474万条双语及单语释义条目,覆盖维吾尔语与汉语、英语之间的双向翻译及同语言释义。其核心研究问题在于构建高质量、大规模的维吾尔语平行语料,以支撑大型语言模型的微调与跨语言理解能力提升。该数据集的开源发布,为维吾尔语信息处理、少数民族语言机器翻译以及多语言预训练模型的发展提供了关键基准资源,显著推动了低资源语言在人工智能领域的可及性与研究深度。
当前挑战
该数据集面临的核心挑战包括:其一,所解决的领域问题在于低资源语言翻译质量提升,维吾尔语形态复杂且语料稀缺,现有模型在语义对齐与罕见词处理上仍存在显著误差,尤其对多义词和语境依赖表达的翻译准确性亟待突破。其二,构建过程中遭遇多重困难,数据来源异构(如词典、数据库、在线资源)导致格式不统一、噪声与重复条目混杂,需耗费大量人力进行清洗与对齐;同时,维吾尔语特有的阿拉伯字母变体与汉语、英语的编码兼容性问题增加了预处理复杂度。此外,条目规模虽大,但双向翻译对的不平衡(如维汉条目远超英维)可能引发模型偏向性,影响多语言泛化能力,未来需进一步扩展均衡语料并优化数据质量评估标准。
常用场景
经典使用场景
在神经机器翻译与多语言自然语言处理领域,该数据集最为经典的使用场景是作为维吾尔语与汉语、英语之间的双语平行语料库,用于训练和微调序列到序列(Seq2Seq)模型。其包含近五百万条高质量词典条目,覆盖维汉、维英、英维等多个语言方向,尤其适合低资源语言的翻译模型预训练与词汇对齐任务。研究者可利用其结构化指令格式(instruction-input-output)直接适配大语言模型的监督微调范式,从而提升模型在维吾尔语上的跨语言理解与生成能力。
解决学术问题
该数据集有效缓解了维吾尔语作为低资源语言在自然语言处理研究中长期面临的数据匮乏困境。它解决了双语词典对齐中的词汇覆盖率不足与语义歧义问题,为跨语言词嵌入、零样本翻译、多语言语义表示学习等学术课题提供了大规模、高覆盖率的基准语料。通过整合Gheyret、Tilkan、Bilkan等多个权威词典源,数据集显著提升了维吾尔语词汇的形态学分析与翻译一致性,推动了中亚语系语言在计算语言学领域的系统性研究。
实际应用
在实际应用层面,该数据集可被直接集成到智能翻译系统、多语言客服机器人及边疆地区教育辅助工具中。例如,面向新疆地区的双语政务服务平台,可利用维汉子集构建高效的实时翻译模块,服务基层民众的跨语言沟通需求。同时,数据集中的单语释义部分(ug-ug、cn-cn)可用于开发维吾尔语词典查询应用或语言学习APP,支持词汇的语义解释与例句生成,助力民族语言的信息化保护与传播。
数据集最近研究
最新研究方向
该数据集聚焦于低资源语言机器翻译与多语言大模型微调的前沿方向,特别是针对维吾尔语这一少数民族语言的神经机器翻译研究。随着多模态大语言模型在跨语言理解和生成任务中的突破,该数据集为提升模型在维吾尔语-汉语-英语三语场景下的翻译质量、词典对齐及语义消歧提供了关键支撑。近期热点事件包括国家人工智能战略对少数民族语言数字资源建设的重视,以及大模型在“一带一路”多语言信息服务中的落地需求,使得此类高质量词典数据成为推动语言平等、文化传承与智能交互的重要基础设施,其影响力延伸至自然语言处理中的零样本翻译、跨语言知识迁移等核心研究领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务