Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI)
收藏资源简介:
# Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI) **Versión:** 5.0.0 **Fecha:** 2026-06-02 **Autores:** Juliana Chantre Astudillo; Manuel Arturo Melo Legarda **Institución:** Institución Universitaria Colegio Mayor del Cauca — Ingeniería Informática **Licencia:** [CC BY 4.0](LICENSE) — uso libre con **atribución obligatoria** --- ## Descripción Conjunto de datos bilingüe **Nasa Yuwe–Español** para el Asistente Virtual Inteligente (AVI) del proyecto de grado *Desarrollo de un Asistente Virtual Inteligente para la Revitalización Digital de la Lengua Nasa Yuwe* (2026). Incluye entradas léxicas, ejemplos, pares pregunta–respuesta y diálogos pedagógicos, con normalización UTF-8, deduplicación canónica, trazabilidad de fuentes y particiones train/dev/test. ### Estadísticas (validadas) | Métrica | Valor | |---------|------:| | Total registros | 4 593 | | Registros reales | 3 933 | | Registros sintéticos trazables | 660 | | Train / dev / test | 3 673 / 459 / 461 | | Errores estructurales | **0** | | Registros `quality_flag=ok` | **4 593** | | Cola de revisión activa | **0** | --- ## Archivos incluidos | Archivo | Descripción | |---------|-------------| | `data/corpus_bilingue_v5.csv` | Corpus completo | | `data/corpus_v5_train.csv` | Partición entrenamiento | | `data/corpus_v5_dev.csv` | Partición desarrollo | | `data/corpus_v5_test.csv` | Partición prueba (393 léxicos en evaluación @1) | | `data/talking_dictionary_pairs.csv` | Pares base Talking Dictionary | | `schema/corpus_schema_v5.json` | Esquema JSON de validación | | `reports/data_dictionary_v5.md` | Diccionario de campos | | `reports/quality_report_v5.md` | Reporte de calidad | | `reports/objective1_final_report.md` | Informe objetivo 1 | | `reports/traceability_matrix_v5.csv` | Trazabilidad fuente–categoría | | `reports/review_queue_v5.csv` | Cola de revisión (vacía; cierre v5) | | `reports/normalization_report_v5.md` | Normalización y deduplicación | | `LICENSE` | Licencia CC BY 4.0 | | `CITATION.cff` | Metadatos de citación | | `FUENTES_Y_ATRIBUCION.md` | Fuentes externas y uso ético | --- ## Cómo citar Tras publicar en Zenodo, use el DOI que asigne la plataforma: ```text Chantre Astudillo, J., & Melo Legarda, M. A. (2026). Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI) [Data set]. Zenodo. https://doi.org/[DOI-ZENODO] ``` ```bibtex @dataset{chantre2026corpus, author = {Chantre Astudillo, Juliana and Melo Legarda, Manuel Arturo}, title = {Corpus bilingüe Nasa Yuwe--Español v5 (YuweAI)}, year = {2026}, publisher = {Zenodo} } ``` Añada el campo `doi = {...}` cuando Zenodo genere el identificador. --- ## English summary Bilingual **Nasa Yuwe–Spanish** dataset (4,593 records) for low-resource NLP and language revitalization. Lexical entries, pedagogical dialogues, and QA pairs with full source traceability, quality metadata, and train/dev/test splits. **License: CC BY 4.0** — free use with attribution to Juliana Chantre Astudillo and Manuel Arturo Melo Legarda. --- ## Validación ```bash python scripts/validate_corpus_v5.py ``` Resultado esperado: **4593 entradas, 0 errores**. --- ## Proyecto relacionado - Web: https://yuwe-ai.web.app - Código: https://github.com/jchantre-jpg/YuweAI



