proxectonos/MT_wikidata-labels-gl
收藏资源简介:
这是一个从维基数据(Wikidata)中提取的标签和描述的多语言数据集,专注于加利西亚语(GL)及其与英语(EN)、西班牙语(ES)和加泰罗尼亚语(CA)的平行映射。数据集基于完整的“Wikidata Label Maps 2025 (All Languages)”数据集构建,包含超过1600万个唯一的维基数据Q-ID条目。每个条目以Q-ID为键,提供可用语言的平行标签和描述对,例如英语、加利西亚语、西班牙语和加泰罗尼亚语。对于加利西亚语,还包含一个“transliterated”字段,指示文本是否通过从葡萄牙语转写而来(当维基数据中没有原生加利西亚语条目时)。数据集包含多个语言对配置,如EN-GL、ES-GL、CA-GL和EN-ES,其中约64.5%的条目具有加利西亚语覆盖(60.7%为原生,39.3%为转写),95.3%的条目同时具有英语和西班牙语。构建过程采用了流式处理和对齐工作流,包括分片流式处理、语言选择性索引、葡萄牙语到加利西亚语的转写回退、检查点中间状态、基于Q-ID的多语言对齐和单次对发射技术,以确保高效处理大规模多语言资源。
A curated glossary of labels and descriptions extracted from Wikidata, focused on Galician (GL) and its parallel mappings to English (EN), Spanish (ES), and Catalan (CA). Built from the full Wikidata Label Maps 2025 (All Languages) dataset, it contains over 16 million unique Wikidata Q-ID entries. Each entry is keyed by Q-ID and provides parallel label/description pairs for available languages, such as English, Galician, Spanish, and Catalan. For Galician, a transliterated field indicates whether the text was obtained via transliteration from Portuguese (when no native Galician entry existed in Wikidata). The dataset includes multiple language pair configurations, e.g., EN-GL, ES-GL, CA-GL, and EN-ES, with approximately 64.5% of entries having Galician coverage (60.7% native, 39.3% transliterated) and 95.3% having both English and Spanish. The construction process employed a streaming and alignment workflow, including shard streaming with PyArrow IPC, language-selective indexing, Portuguese-to-Galician transliteration fallback, checkpointed intermediate state, Q-ID-based multilingual alignment, and single-pass pair emission, designed for efficient handling of large-scale multilingual resources.




