遇见数据集

somosnlp-hackathon-2026/rosettia-chanka-data

收藏
Hugging Face2026-06-02 更新2026-06-14 收录
官方服务:

资源简介:

RosettIA Chanka Quechua — Judicial Parallel Data 是一个用于司法/行政管理领域的西班牙语与Chanka/Ayacucho Quechua(语言代码:quy)平行语料数据集。数据来源于秘鲁文化部2014年出版的手册《Manual para el empleo del Quechua Chanka en la administración de justicia》,该手册明确允许在注明出处的情况下复制。数据集包含多个Parquet文件,涵盖经过审查的西班牙语-Chanka平行对(包括斜杠替代拆分)、词汇表条目(如术语对),以及相关元数据。列包括reviewed_spanish和reviewed_chanka_quechua等。该数据集是RosettIA项目的一部分,专门用于翻译任务,支持Quechua语言资源开发。许可证为CC-BY-4.0,要求署名。注意:此发布仅包含可自由分发的数据,不包括其他受限制的第三方语料。

RosettIA Chanka Quechua — Judicial Parallel Data is a Spanish ↔ Chanka/Ayacucho Quechua (quy) parallel dataset for the judicial/administration of justice domain. It is derived from a Peruvian Ministry of Culture manual (2014) that explicitly permits reproduction with attribution. The dataset includes multiple Parquet files containing reviewed Spanish-Chanka parallel pairs (with slash-alternative splits), glossary entries (e.g., term pairs), and metadata. Columns include reviewed_spanish and reviewed_chanka_quechua. This dataset is part of the RosettIA project, aimed at translation tasks and Quechua language resource development. It is licensed under CC-BY-4.0, requiring attribution. Note: This release only includes the cleanly redistributable data, excluding other third-party corpora with restrictive licenses.

搜集汇总
数据集介绍
somosnlp-hackathon-2026/rosettia-chanka-data 数据集图片
构建方式
该数据集的构建根植于秘鲁文化部官方发布的《Chanka克丘亚语司法应用手册》(Ardito Vega, 2014),该手册明确允许在注明出处的前提下进行复制与传播。研究团队对该手册进行了系统性的人工审核与抽取,将原文中的西班牙语与Chanka克丘亚语平行段落、斜杠分隔的术语变体以及词汇表条目逐一提取,并经过严格的校对与清洗流程,最终整理为结构化的Parquet格式文件。数据集中包含了经过审核的平行句对、术语条目以及人工标记的审校元数据,确保了司法行政领域下语言对译的精确性与权威性。
特点
该数据集聚焦于司法与行政领域,具有高度的专业性与领域专精性,而非通用的克丘亚语语料。其核心特点在于所有数据均源自单一、可合法再分发的官方手册,数据来源透明且版权清晰,采用CC-BY-4.0许可协议,极大降低了使用风险。数据集内含1,055条经过审校的平行句对与423条术语条目,并提供了审校标志与决策记录,便于用户评估数据质量。此外,项目团队详细公开了因许可证限制而未在此分发的其他训练数据来源,体现了开放科学中严谨的数据溯源伦理。
使用方法
该数据集可直接用于训练或微调司法领域的西班牙语—Chanka克丘亚语机器翻译模型。用户可通过Hugging Face数据集库加载其中的Parquet文件,利用'cleaned_chanka'目录下的平行句对进行有监督训练,或结合项目GitHub仓库中的构建脚本,从原始第三方来源(如AmericasNLP、FLORES-200等)自行重建更广泛的训练语料。推荐在使用时引用原始手册(Ardito Vega, 2014)及RosettIA项目,以遵守CC-BY-4.0的署名要求。数据集规模较小,适合作为高质量种子数据或领域适配的验证集合。
背景与挑战
背景概述
RosettIA Chanka Quechua — Judicial Parallel Data 数据集于2026年由Estefanía Espinosa Fernández与Irving Ernesto Quezada Ramírez在SomosNLP黑客松项目中创建,旨在解决司法领域内克丘亚语(Chanka/Ayacucho变体)与西班牙语之间的平行语料匮乏问题。该数据集基于Wilfredo Ardito Vega于2014年编写的《Manual para el empleo del Quechua Chanka en la administración de justicia》提取而成,包含1055条经过审核的司法行政平行句子及423条术语条目。作为RosettIA项目的核心资源,它填补了低资源语言在专业领域机器翻译中的空白,为保护濒危语言、促进司法公平提供了关键数据基础,对计算语言学和语言复兴研究具有重要推动作用。
当前挑战
该数据集面临的首要挑战是解决低资源语言在特定领域(司法行政)的机器翻译难题,克丘亚语数据量稀缺且缺乏高质量平行语料,严重制约翻译模型的性能。在构建过程中,挑战尤为显著:原始来源仅为一份PDF手册,需手动提取并审核1055条平行句对,确保翻译准确性与术语一致性;同时,第三方语料如JW300、FLORES-200等因版权限制无法直接使用,需设计脚本从原始提供方按各自条款重建数据,包括从NLLB模型蒸馏合成目标语料,以及处理C4等网络文本的合规性问题,整个流程复杂且依赖严格的版权合规与数据溯源管理。
常用场景
经典使用场景
在跨语言司法翻译与低资源语言机器翻译领域,RosettIA Chanka Quechua数据集以其独特的司法领域平行语料和克丘亚语(Chanka方言)稀缺性,成为研究西班牙语与安第斯原住民语言之间自动翻译的经典基准。该数据集包含经过人工审核的西班牙语—克丘亚语司法行政术语对、平行句对及词汇表,为构建面向特定专业领域的神经机器翻译模型提供了高质量的训练与评估样本。研究者常利用其标注严谨、领域聚焦的特性,开发可泛化于司法语境或精准捕捉克丘亚语形态句法特征的翻译系统,同时验证数据增强、迁移学习及跨领域适应策略在极度低资源情境下的效能。
解决学术问题
该数据集的核心学术贡献在于攻克了低资源原住民语言司法翻译缺乏高质量平行语料的长期困境。传统机器翻译研究多集中于高资源语言对,而克丘亚语因其方言分化、书面语料匮乏及社群边缘化,长期处于自然语言处理研究的盲区。RosettIA数据集的发布,使得学者能够系统性地探究西班牙语与克丘亚语在司法语境下的词汇对应、句法转换及法律术语一致性难题。它不仅为低资源机器翻译提供了可复现的标准化评价数据,更推动了形态丰富语言在专业领域翻译中的建模进展,其数据构建与清洗方法论对安第斯地区其他原住民语言的数据集开发具有示范意义。
衍生相关工作
围绕该数据集,一系列开创性的研究工作应运而生。其原始项目RosettIA在前述数据基础上,结合来自AmericasNLP、FLORES-200等多源异构语料,开展了涵盖监督微调、合成知识蒸馏及组对比偏好优化(GSPO)强化学习的系统性实验,探索了Qwen3.5等预训练模型在低资源司法翻译上的潜力。此外,该项目衍生了针对Chanka克丘亚语的发音归一化、形态分析及评估基准构建等子任务,为后续研究提供了开源工具与复现脚本。这些工作不仅直接促进了美洲原住民语言的自然语言处理发展,也为其他低资源语言的跨领域机器翻译研究提供了可借鉴的技术范式与数据协作模式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务