遇见数据集

kichwa-spanish

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

Kichwa–Spanish 平行词典与指令数据集是一个经过清理、去重和结构化的双语资源,专门针对厄瓜多尔纳波低地(亚马逊)基丘瓦语(ISO 639-3 `qvo`;宏观语言 `qu`)与西班牙语。该数据集并非全新创建,而是对Hugging Face Hub上三个源自同一出版词典的现有社区上传数据进行了整合与修复,解决了原始数据中存在的列解析错误、数据集查看器类型转换错误、列方向混乱和格式不一致等问题。数据集包含三个独立配置:1) `lexicon`(默认配置):包含6,313个平行对(词目及例句),采用Apache-2.0与MIT混合许可,其中6,287行标记为`ok`,26行标记为`review`;2) `instructions`:包含6,354个聊天格式的问答对(用于指令微调),源自同一词典,采用MIT许可;3) `lexicon_gpl`:包含7,543个平行对,采用GPL-3.0许可,与`lexicon`配置内容相关但独立存放以遵守许可协议。所有配置总计提供13,856个平行对。数据字段包括基丘瓦语文本、西班牙语文本、条目类型(词目或例句)、质量标记、来源和许可信息。数据源自UNICEF与厄瓜多尔DINEIB出版的《Diccionario Kichwa–Castellano》教育词典,并整合了三个贡献者数据集。数据集经过解析校正、语言方向修复、文本规范化、去重和质量标记等处理。局限性包括:未经流利基丘瓦语使用者验证、西班牙语侧存在OCR导致的错误空格、少量行标记为需审查、条目类型为启发式判定,且内容仅限于纳波低地(亚马逊)方言。适用于基丘瓦语与西班牙语之间的机器翻译、双语词典归纳、低资源语言指令微调以及语言保护与教育工具开发。

创建时间:
2026-06-16
原始信息汇总

数据集概述

数据集名称: Kichwa–Spanish Parallel Lexicon & Instructions (Napo / Amazonian Kichwa)

数据集地址: https://huggingface.co/datasets/aimeri/kichwa-spanish

语言: Kichwa (ISO 639-3 qvo, 厄瓜多尔 Napo Lowland 方言) ↔ 西班牙语

任务类别: 翻译 (translation), 文本生成 (text-generation)

许可协议: 各配置不同,详见下方表格。存储库级许可标记为 other

数据集构成

该数据集并非全新数据,而是对三个现有社区上传的、源自同一已出版词典的数据进行清理、去重和结构化整理的产物。数据按许可协议分为三个配置(Config):

配置名称 数据行数 许可协议 内容描述
lexicon (默认) 6,313 行 Apache-2.0 + MIT 平行语对(包括词条和例句)。其中 6,287 行标记为 ok,26 行标记为 review(需要审查)。
instructions 6,354 行 MIT 聊天格式的问答对(指令微调用),从相同的词典数据派生。
lexicon_gpl 7,543 行 GPL-3.0 来自 GPL 许可来源的平行语对,单独存放。其中 7,542 行标记为 ok,1 行标记为 review

两个词表配置 (lexiconlexicon_gpl) 共有 13,856 条平行语对,它们有重叠但内容不完全相同。

数据字段

lexiconlexicon_gpl 配置:

字段 类型 描述
kichwa string Kichwa 侧文本(词条或例句)。
spanish string 西班牙语侧文本(释义或翻译)。
entry_type string 条目类型:headword(1-2词术语)或 example(≥3词句子),基于启发式规则。
quality_flag string 质量标记:ok(正常)或 review(Kichwa 字段读起来像西班牙语,可能源数据有错位)。
source string 来源存储库。如果去重后对出现于多个来源,则用 + 连接。
license string 每条数据的许可协议。如果合并自多个来源,则用 + 连接。

instructions 配置:

字段 类型 描述
messages list 对话轮次:[{"role": "user"/"assistant", "content": "..."}]
source string 来源存储库。
license string 许可协议 (mit)。

数据来源与致谢

  • 上游源词典: 数据最终来源于由 UNICEF 和厄瓜多尔 DINEIB 出版的 《Diccionario Kichwa–Castellano》(Napo 方言),ISBN 978-92-806-4082-3,用于免费教育分发。数字版托管在 FLACSO Andes 数字图书馆
  • 贡献的 Hub 数据集:
    • Carlos89apc/TraductorES_Kichwa (GPL-3.0) → 贡献给 lexicon_gpl 配置。
    • hcurbelo/Kichwa_ES_001 (Apache-2.0) → 贡献给 lexicon 配置。
    • hcurbelohy/ES_Kichwa (MIT) → 贡献给 instructions 配置(并挖掘了一部分平行语对到 lexicon)。

数据清理与标准化

  • 纠正解析错误: 修复了原始数据中列分隔混乱、列类型错误等问题。
  • 语言方向修复: 通过一个 Kichwa 与西班牙语的评分器,纠正了约 280 行语言顺序颠倒的数据。
  • 标准化: 压缩空白、去除标点伪影、将全大写词条转换为小写。
  • 去重: 在每个许可层级内移除精确重复的 (kichwa, spanish) 对。
  • 质量标记: 对 Kichwa 字段仍读起来像西班牙语的行标记 quality_flag = "review",而不是直接丢弃。

局限性

  • 未经验证: 内容未经流利的 Kichwa 母语者验证。
  • 西班牙语伪影: 西班牙语文本中存在来自原始数字化的错误中间空格(如 te nía),未被修正。
  • 标记为 review 的行: 约 0.4% 的行在源数据中存在错位。建议在需要纯净数据时过滤 quality_flag == "ok" 的行。
  • 方言: 内容为 Napo Lowland (Amazonian) 厄瓜多尔 Kichwa 方言 (qvo),不覆盖其他高地变体。

预期用途

机器翻译(Kichwa↔西班牙语)、双语词表归纳、低资源 Kichwa 的指令微调,以及语言保护和教育工具开发。鉴于上述局限性,建议在面向用户的应用前进行人工审核。

搜集汇总
数据集介绍
kichwa-spanish 数据集图片
构建方式
该数据集以Napo低地亚马逊方言的Kichwa语与西班牙语双语词典为核心,整合并修复了HuggingFace平台上三个源自同一出版物的社区上传数据。通过纠正列解析错误、修复语言方向混乱、统一格式并去除重复项,最终形成结构清晰、来源可溯的平行语料库。数据被划分为多个子集:permissive许可的lexicon(6,313条,含词条与例句)、基于lexicon构建的指令集instructions(6,354条,采用对话格式),以及GPL许可的lexicon_gpl(7,543条,单译项覆盖面更广)。每一条目均标注了质量标记、来源与许可信息,便于用户筛选与合规使用。
特点
本数据集的核心特色在于对低资源语言的细致处理与许可透明性。针对亚马逊Kichwa语这一生存危机语言,数据集不仅提供了丰富的双语平行对(合计13,856对),还专门拆分为permissive与copyleft两个许可层级,用户可根据项目需求灵活选用。质量标记系统将存疑条目(约0.4%)单独标出,保留了原始数据中难以自动修复的错位问题,同时通过启发式方法区分词条与例句。此外,数据集保留了西班牙语侧因数字化产生的断词瑕疵(如“te nía”应为“tenía”),避免修复时污染Kichwa语内容,体现了对语言原始面貌的尊重。
使用方法
通过HuggingFace的datasets库即可便捷加载。例如,使用`load_dataset("aimeri/kichwa-spanish", "lexicon", split="train")`获取默认的permissive平行词典;调用`.filter(lambda r: r["quality_flag"] == "ok")`即可获得高质量子集。指令调优数据可通过指定`instructions`配置获取,以标准的Chat格式呈现。若项目兼容GPL,则可加载`lexicon_gpl`配置。每个子集均包含kichwa、spanish、entry_type、quality_flag等字段,支持细粒度过滤与分析,适用于机器翻译、双语词典归纳、低资源语言教育工具开发等场景。
背景与挑战
背景概述
低资源语言的自然语言处理研究长期受限于高质量双语资源的匮乏,尤其是对于亚马逊河流域的土著语言而言。在此背景下,由UNICEF与厄瓜多尔跨文化双语教育国家局(DINEIB)共同编纂的《Kichwa–Castellano词典》于2012年前后出版,成为Napo低地Kichwa语(ISO 639-3: qvo)与西班牙语之间最为系统的词汇与例句资源。该词典以免费教育分发形式发布,数字版本存放于FLACSO Andes数字图书馆。然而,社区中三位独立贡献者在Hugging Face上发布的数字化版本存在列解析错误、数据集查看器类型错误、列方向混乱及格式不一致等问题,严重阻碍了其可用性。本数据集(kichwa-spanish)由aimeri整合、清理并修复上述三个源头,形成了包含13,856个平行对的结构化词典及对话指令资源,为Kichwa语的机器翻译、双语词典归纳与指令微调提供了关键基础,对低资源土著语言的数字化保护与计算研究具有重要推动作用。
当前挑战
该数据集的核心挑战首先在于所解决的领域问题:Kichwa语作为亚马逊低地土著语言,缺乏大规模、经过母语者验证的双语平行语料,现有数字资源质量参差不齐,导致机器翻译与语言技术开发严重受限。本数据集所面对的挑战包括:1)源头数据存在列方向混乱、Kichwa与西班牙语内容交叉错位、西班牙语侧的OCR断词误差(如“te nía”应为“tenía”)以及重复条目;2)构建过程中,需针对三种不同许可证(Apache-2.0、MIT、GPL-3.0)的输入端进行分割整理,通过Kichwa与西班牙语的字符与形态特征评分自动修复约280行语言方向错误,同时通过精确去重与质量标记(如标记约0.4%的待审行)确保数据可靠;3)内容未经流利母语者验证,词典内部潜在的语义分歧仅得以保留而未被调和,要求使用者根据质量标记自行筛选。
常用场景
经典使用场景
在低资源自然语言处理领域,kichwa-spanish数据集被广泛用于构建基切瓦语与西班牙语之间的神经机器翻译系统。研究人员利用其对齐良好的平行语料(涵盖词条和例句),训练序列到序列模型或基于Transformer的翻译架构,尤其针对Amazonian Kichwa这一极度稀缺的语种方言。该数据集还常被用于跨语言词嵌入对齐、双语词典归纳以及低资源语言的文本生成任务。
解决学术问题
该数据集的核心学术贡献在于为濒危的Amazonian Kichwa语(ISO 639-3: qvo)提供了首个结构统一、质量可追溯的数字化平行资源,解决了此前数据分散、格式混乱、版权不清等阻碍计算语言学研究的核心痛点。它使得研究者得以开展低资源语境下的机器翻译鲁棒性研究、跨语言表示学习的迁移效果探究以及句法对齐的声学语言学验证,对保护语言多样性和推动计算语言学的公平性具有深远意义。
衍生相关工作
该数据集催生了多项奠基性工作,包括基于Kichwa-Spanish数据的低资源机器翻译基线基准(如清理后模型显著优于未清洗版本)、面向Amazonian方言的跨方言迁移学习方法、以及融合语音与文本的多模态语言文档技术。此外,其双重许可设计(Apache-2.0/MIT与GPL-3.0)为后续数据集治理研究提供了重要范例,推动了低资源语言数据在使用权限与开放共享方面的规范化讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务