shingali-translation-v2
收藏官方服务:
资源简介:
Shingali Translation v2 (Êzîdîkî) 是一个专门针对低资源语言Êzîdîkî构建的双语翻译数据集。Êzîdîkî是伊拉克辛贾尔地区雅兹迪人使用的北库尔德语(库尔曼吉语)方言。该数据集旨在支持Êzîdîkî语言的机器翻译和文本生成任务。数据集包含两个主要部分:双语翻译对和单语文本语料。双语部分共包含6,420个高质量翻译对,其中5,778个用于训练,642个用于验证。这些翻译对进一步分为3,857个阿拉伯语到Êzîdîkî的翻译样本和2,563个英语到Êzîdîkî的翻译样本。单语部分包含1,375行纯Êzîdîkî文本,总计39,890个单词,来源于播客音频的自动转录。数据经过严格的质量控制,已过滤掉拉丁乱码、源语言与目标语言相同的无效样本以及机器人命令等噪声数据。数据来源多样化,包括通过Telegram机器人收集并经过人工验证的词典条目和句子翻译,以及使用Whisper语音识别技术从Êzîdîkî播客音频转录得到的单语文本。该数据集适用于低资源语言神经机器翻译模型的训练与评估,特别是针对阿拉伯语或英语到Êzîdîkî的翻译任务,也可用于Êzîdîkî语言的单语语言模型预训练或微调。
创建时间:
2026-07-08
原始信息汇总
数据集概览:Shingali Translation v2 (Êzîdîkî)
- 数据集名称:Shingali Translation v2 (Êzîdîkî)
- 数据集别名:Shingali Translation v2 — Êzîdîkî (kmr-IQ)
- 语言:库尔德语库尔曼吉方言(Êzîdîkî,代码:kmr)、阿拉伯语(ar)、英语(en)
- 许可协议:CC-BY-SA-4.0
- 任务类别:翻译(translation)、文本生成(text-generation)
- 标签:ezidiki、yazidi、shingali、kurmanji、kmr-IQ、低资源语言(low-resource)
- 数据集大小:1,000 < 样本数 < 10,000
数据规模与划分
- 双语平行句对:共 6,420 对
- 训练集:5,778 对
- 验证集:642 对
- 其中阿拉伯语 → Êzîdîkî:3,857 对
- 其中英语 → Êzîdîkî:2,563 对
- 单语文本:1,375 行 Êzîdîkî 文本(共 39,890 词),来源于播客转录
- 数据过滤:已过滤垃圾内容(无拉丁乱码、无源语言等于目标语言、无机器人命令)
数据格式
- 数据以聊天格式(chat-format)存储,每行对应一个示例。
数据来源
- 人工验证的词典条目(通过Telegram机器人贡献)
- 人工验证的句子翻译
- 基于Whisper语音识别模型从Êzîdîkî播客音频转录的单语语料库
使用建议
- 可用于微调 Gemma 3 4B 模型(配合 Unsloth LoRA 技术),相关训练笔记位于配套仓库中。
搜集汇总
数据集介绍

构建方式
Shingali Translation v2 数据集专为埃兹迪语(Êzîdîkî)——伊拉克辛贾尔地区雅兹迪人所使用的北库尔德语(库尔曼吉方言)——构建,旨在缓解低资源语言的翻译困境。该数据集包含6,420个双语平行句对(其中阿拉伯语-埃兹迪语3,857对,英语-埃兹迪语2,563对),经过严格去噪处理,剔除了拉丁乱码、源语言等于目标语言的无效对及机器人指令。此外还纳入了1,375行源自播客转录的单语文本,共计39,890词。数据来源包括经人工校验的词典条目、句子翻译以及Whisper语音识别模型从埃兹迪语播客音频中提取的语料。
特点
该数据集最显著的特点在于其针对极端低资源语言埃兹迪语的专注性,填补了该方言在机器翻译领域的空白。通过人工验证与多源融合(词典、翻译、语音转录)的构建策略,确保了数据质量与多样性。数据集采用对话格式存储,便于直接应用于大语言模型的微调。规模上,训练集含5,778对、验证集含642对,平衡了数据丰富性与可操作门槛,为后续模型评估提供了可靠基准。
使用方法
数据集主要用于微调大语言模型以提升埃兹迪语的翻译与文本生成能力。推荐使用Unsloth库结合LoRA技术对Gemma 3 4B模型进行高效参数微调。用户可直接加载训练集与验证集中的对话格式数据,通过配套的笔记本教程快速复现训练流程。该数据集不仅支持双语翻译任务,还可用于单语文本生成场景,尤其适用于低资源场景下的神经网络机器翻译研究与开发。
背景与挑战
背景概述
Shingali Translation v2(Êzîdîkî)数据集由专注低资源语言处理的研究团队创建,旨在解决伊拉克辛贾尔地区雅兹迪社区所使用的北库尔德语(库尔曼吉方言)——Êzîdîkî的机器翻译资源匮乏问题。该语言在地缘政治动荡与口头传统传承中面临消亡风险,其数字化语料极度稀缺。数据集于近年通过众包与专家审核相结合的方式构建,包含6,420条双语平行句对(阿拉伯语和英语至Êzîdîkî)及1,375行单语文本,首次为这一濒危方言提供了结构化的翻译基准。依托于Telegram机器人贡献的词典条目、人工校验的句子翻译以及Whisper语音识别转录的播客语料,该数据集填补了低资源库尔德语变体在神经机器翻译领域的空白,为雅兹迪文化的数字化保护与多语言信息接入奠定了数据基础。
当前挑战
该领域面临的核心挑战在于Êzîdîkî作为低资源语言的极端匮乏性:其无标准化正字法、口语体与书面体差异显著,且缺乏大规模预训练语料,使得传统数据增强方法(如回译)效果受限。构建过程中,团队需应对多重困境:原始语料来源混杂,包含Telegram机器人中未经过滤的拉丁字母乱码、重复条目(源语言与目标语言相同)及非对话性机器指令,必须设计自动化垃圾过滤流水线以剔除噪声;单语数据仅依赖播客音频的Whisper转录,受方言口音与背景噪音影响,转录错误率较高;此外,雅兹迪社区的语言使用者分散且数字化参与度低,人工审核的规模化与质量控制极为困难,最终在有限的人力与计算资源下,仅能产出千级规模的平行句对,难以满足现代神经翻译模型对海量数据的依赖。
常用场景
经典使用场景
Shingali Translation v2数据集专为极其低资源的雅兹迪语(Êzîdîkî)与阿拉伯语、英语之间的双语翻译任务而设计。该数据集包含6,420个高质量的双语平行句对,覆盖了阿拉伯语到雅兹迪语和英语到雅兹迪语两个翻译方向,并附有1,375行来自播客转写的单语语料。研究者通常将其用于训练和评估低资源场景下的神经机器翻译模型,尤其适合利用小规模平行语料进行微调或零样本迁移学习。数据以对话格式组织,便于直接适配大语言模型的指令微调范式,成为探索濒危语言翻译技术的宝贵基准。
衍生相关工作
基于Shingali Translation v2数据集已衍生出多项重要研究工作。其中最典型的是利用Unsloth LoRA技术在Gemma 3 4B模型上进行参数高效微调,探索极小规模平行语料对大语言模型翻译能力的激活效果。相关工作还包括构建雅兹迪语语音-文本联合翻译系统、设计针对噪声语料的对抗性过滤算法,以及开发跨方言(如土耳其库尔德语)的迁移学习基准。这些成果不仅为Êzîdîkî自然语言处理建立了初始技术栈,也为其他全球濒危语言的资源建设与模型适配提供了可复用的方法论框架。
数据集最近研究
最新研究方向
在低资源语言机器翻译与语言保护的前沿领域,Shingali Translation v2 数据集专注于雅兹迪社区使用的 Êzîdîkî 方言(伊拉克辛贾尔地区的北库尔德语库尔曼吉变体)。该数据集的核心价值在于填补了极度濒危语言在神经机器翻译中的空白,通过构建6,420个高质量双语对(阿拉伯语-Êzîdîkî与英语-Êzîdîkî)及1,375行单语转写语料,为极低资源场景下的少样本学习与模型微调提供了关键基准。其研究意义紧密关联全球语言多样性保护热点:雅兹迪群体在历经战乱与流散后,数字化语言资料的缺失使其文化传承面临严峻挑战。该数据集的出现不仅推动了跨语言信息检索、语音识别后处理等技术的落地,也为后续利用大规模预训练模型(如Gemma 3)进行LoRA高效微调以适配濒危语言铺平了道路,彰显了人工智能在文化韧性建设中的深远影响力。
以上内容由遇见数据集搜集并总结生成



