Corpus bilingüe Nasa Yuwe–Español (YuweAI)
收藏资源简介:
Corpus bilingüe Nasa Yuwe–Español con 4 593 registros, desarrollado en un proyecto de grado en Ingeniería Informática de la Institución Universitaria Colegio Mayor del Cauca (2026), orientado al entrenamiento de un asistente virtual para el aprendizaje de la lengua Nasa Yuwe. Contenido: 3 922 entradas léxicas, 300 pares de pregunta y respuesta, 360 diálogos y 11 ejemplos. De ellos, 3 933 provienen de fuentes documentadas y 660 de material derivado con trazabilidad explícita. Los registros cubren 17 categorías temáticas (animales, números, cuerpo humano, saludos, alimentos, entre otras). Cada fila incluye texto en Nasa Yuwe y en español, categoría, tipo de registro, enlace a la fuente (fuente_url) y partición (train, dev o test). Formato CSV, codificación UTF-8. Validación estructural: 4 593 entradas, 0 errores. Fuentes principales: Talking Dictionary (http://talkingdictionary.swarthmore.edu/paez/) y KwesxYuwe (https://kwesxyuwe.com/). Particiones: entrenamiento 3 673, desarrollo 459, prueba 461. Licencia CC BY 4.0. Archivos: corpus completo y particiones (corpus_bilingue.csv, corpus_train.csv, corpus_dev.csv, corpus_test.csv), esquema JSON, diccionario de campos y reporte de calidad.



