NOS_Cientifico. Corpus de dominio científico y académico.
收藏资源简介:
Aviso sobre actualizaciones / Aviso sobre actualizacións / Update notice (ES) Una versión actualizada de Corpus de dominio científico y académico está disponible en Hugging Face: https://huggingface.co/datasets/proxectonos/corpus_dominio_cientifico Las futuras actualizaciones, correcciones y versiones ampliadas del corpus se publicarán principalmente a través del repositorio de Hugging Face. Este registro de Zenodo se mantiene con fines de archivo y citación, pero se recomienda a las personas usuarias consultar la versión de Hugging Face para acceder a la publicación más reciente. (GL) Unha versión actualizada de Corpus de dominio científico e académico está dispoñible en Hugging Face: https://huggingface.co/datasets/proxectonos/corpus_dominio_cientifico As futuras actualizacións, correccións e versións ampliadas do corpus publicaranse principalmente a través do repositorio de Hugging Face. Este rexistro de Zenodo mantense con fins de arquivo e citación, mais recoméndase ás persoas usuarias consultar a versión de Hugging Face para acceder á publicación máis recente. (EN) An updated version of Corpus de dominio científico y académico is available on Hugging Face: https://huggingface.co/datasets/proxectonos/corpus_dominio_cientifico Future updates, corrections, and extended releases of the corpus will be primarily made available through the Hugging Face repository. This Zenodo record is kept for archival and citation purposes, but users are encouraged to consult the Hugging Face version for the most recent release. Corpus de dominio científico y académico Descripción general El corpus de dominio científico reúne textos académicos y enciclopédicos representativos del registro científico, procedentes de fuentes institucionales y abiertas. Incluye publicaciones universitarias, artículos científicos y contenidos enciclopédicos, con el objetivo de proporcionar un recurso útil para tareas de procesamiento del lenguaje natural. Composición del corpus El dominio científico está formado por los siguientes conjuntos: Publicaciones del Servicio de Publicaciones de la Universidad de Santiago de Compostela (USC) Este conjunto incluye artículos y publicaciones académicas editadas por la USC, obtenidas a partir de dos tipos de fuentes: Documentos extraídos de XML: cuando los artículos estaban disponibles en formato XML estructurado, se extrajo el texto completo junto con los metadatos editoriales disponibles (por ejemplo, título, autores, idioma, año de publicación o identificadores como DOI). Los documentos resultantes se almacenan en formato JSONL. Documentos extraídos de PDF mediante OCR: en los casos en los que no existía una versión XML accesible, los textos se obtuvieron a partir de archivos PDF utilizando PaddleOCR [1]. Estos documentos contienen principalmente el texto del artículo tras OCR, con metadatos mínimos, y fueron sometidos a un proceso posterior de limpieza. Estos textos están incluídos en CorpusNÓS [2], pero han sufrido un proceso de extracción y limpieza diferente. Wikipedia (ámbito científico) El corpus incluye artículos de Wikipedia pertenecientes al ámbito científico, tanto en castellano como en gallego, recopilados mediante volcados temáticos específicos por idioma. Para cada artículo se extrajo el texto enciclopédico limpio, junto con información básica como el título, la URL y la categoría temática. Este conjunto aporta diversidad temática y un registro más divulgativo dentro del dominio científico, complementando los textos académicos. Formato y organización Todos los documentos del dominio científico se almacenan en formato JSONL, con un documento por línea. La organización del corpus refleja la fuente de procedencia, el idioma y el formato original del texto (XML o PDF). La estructura del corpus es la siguiente:NOS_Corpus_Dominio_Cientifico/├── Servizo_Publicacions_USC/│ ├── es/│ │ ├── source_pdf/│ │ │ └── ServizoPublicacionsUSC_es.jsonl│ │ └── source_xml/│ │ ├── 2020.jsonl│ │ ├── 2021.jsonl│ │ └── 2022.jsonl│ └── gl/│ ├── source_pdf/│ │ └── ServizoPublicacionsUSC_gl.jsonl│ └── source_xml/│ ├── 2020.jsonl│ ├── 2021.jsonl│ └── 2022.jsonl└── Wikipedia/ ├── es/ │ └── wikipedia_ciencia_es_13112025_dump.jsonl └── gl/ └── wikipedia_ciencia_gl_11112025_dump.jsonl Procesamiento y limitaciones El corpus ha sido generado mediante procesos automáticos de extracción y limpieza básica del texto. No se ha realizado corrección lingüística manual ni anotación semántica adicional. Los textos procedentes de PDF pueden contener errores residuales derivados del proceso de OCR. Asimismo, la disponibilidad y riqueza de metadatos varía en función de la fuente y del formato original. Ejemplos Wikipedia { "id": 1, "title": "%Alcons", "text": "% Alcons es un acrónimo de Percentage Articulation Loss of Consonants...", "related_articles": [], "num_tokens": 384, "url": "https://es.wikipedia.org/wiki/%25Alcons"} Servicio de Publicaciones de la USC Obtenidos de versiones XML { "doc_id": "10.15304/ges.2.6469", "source_url": "https://doi.org/10.15304/ges.2.6469", "title": { "es": "LA PROTECCIÓN PENAL FRENTE A LA MINERÍA ILEGAL" }, "journal": { "name": "Gladius et Scientia. Revista de Seguridad del CESEG", "publisher": "Universidade de Santiago de Compostela", "issn_epub": "2695-6993" }, "language": "es", "year": 2020, "authors": [ { "given": "Antonio", "family": "Roma Valdés" } ], "text": "1. INTRODUCCIÓN\n\nLa minería ilegal es un fenómeno..."} Obtenidos de versiones en PDF { "id": 10, "text": "INNOVACIÓNS REPUBLICANAS NA EDUCACIÓN POPULAR...", "tokens": 6995, "abstract_es": null, "abstract_gl": "Coa chegada das Misións Pedagóxicas a partir de 1931...", "abstract_en": "When the Misiones Pedagógicas arrived in Galicia...", "source": "1234-121-4788-1-10-20131111.md", "lang": "es"} Información adicional | Fuente | Idioma | Nº de documentos | Nº de tokens ||--------|--------|------------------|--------------|| Servizo de Publicacións da USC | Español (es) | 186 | 1 307 411 || Servizo de Publicacións da USC | Gallego (gl) | 499 | 3 005 739 || Wikipedia (ciencia) | Español (es) | 34 151 | 33 957 522 || Wikipedia (ciencia) | Gallego (gl) | 35 964 | 20 448 504 || **Total** | | **70 800** | **58 719 176** | Licencia y condiciones de uso Publicaciones del Servicio de Publicaciones de la Universidad de Santiago de Compostela (USC) Los textos procedentes del Servicio de Publicaciones de la Universidad de Santiago de Compostela han sido incluidos en este corpus en el marco de los acuerdos institucionales vigentes.Los documentos originales en formato XML han sido reformateados para su almacenamiento en JSONL, preservando el contenido textual y los metadatos editoriales disponibles, sin alteración del contenido semántico. Los textos extraídos de PDF han sido procesados mediante OCR y limpieza básica. Wikipedia Los textos enciclopédicos proceden de Wikipedia en castellano y gallego y han sido extraídos de conformidad con la licencia Creative Commons Attribution–ShareAlike 4.0 International (CC BY-SA 4.0) bajo la que se publica Wikipedia. Los artículos han sido transformados mediante procesos automáticos de extracción, limpieza y reestructuración en formato JSONL, sin modificar su contenido textual. De acuerdo con los términos de la licencia original, se mantiene la atribución a Wikipedia como fuente y se preserva la compatibilidad con su licencia. Licencia del corpus derivado La estructura del corpus, el formato de los datos, la organización de los archivos y los procesos de extracción, limpieza y normalización aplicados se distribuyen bajo la licencia: Creative Commons Attribution 4.0 International (CC BY 4.0) Referencias [1] @misc{cui2025paddleocr30technicalreport, title={PaddleOCR 3.0 Technical Report}, author={Cheng Cui and Ting Sun and Manhui Lin and Tingquan Gao and Yubo Zhang and Jiaxuan Liu and Xueqing Wang and Zelun Zhang and Changda Zhou and Hongen Liu and Yue Zhang and Wenyu Lv and Kui Huang and Yichao Zhang and Jing Zhang and Jun Zhang and Yi Liu and Dianhai Yu and Yanjun Ma}, year={2025}, eprint={2507.05595}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2507.05595}, } @misc{cui2025paddleocrvlboostingmultilingualdocument, title={PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model}, author={Cheng Cui and Ting Sun and Suyin Liang and Tingquan Gao and Zelun Zhang and Jiaxuan Liu and Xueqing Wang and Changda Zhou and Hongen Liu and Manhui Lin and Yue Zhang and Yubo Zhang and Handong Zheng and Jing Zhang and Jun Zhang and Yi Liu and Dianhai Yu and Yanjun Ma}, year={2025}, eprint={2510.14528}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2510.14528}, } [2] @inproceedings{de-dios-flores-etal-2024-corpusnos, title = ""{C}orpus{N{\'O}S}: A massive {G}alician corpus for training large language models"", author = ""de-Dios-Flores, Iria and Su{\'a}rez, Silvia Paniagua and P{\'e}rez, Cristina Carbajal and Outeiri{\~n}o, Daniel Bardanca and Garcia, Marcos and Gamallo, Pablo"", editor = ""Gamallo, Pablo and Claro, Daniela and Teixeira, Ant{\'o}nio and Real, Livy and Garcia, Marcos and Oliveira, Hugo Gon{\c{c}}alo and Amaro, Raquel"", booktitle = ""Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1"", month = mar, year = ""2024"", address = ""Santiago de Compostela, Galicia/Spain"", publisher = ""Association for Computational Lingustics"", url = ""https://aclanthology.org/2024.propor-1.66"", pages = ""593--599"",} -------------------------------Esta publicación del proyecto Desarrollo de Modelos ALIA está financiada por el Ministerio para la Transformación Digital y de la Función Pública y por el Plan de Recuperación, Transformación y Resiliencia – Financiado por la Unión Europea – NextGenerationEU This work is funded by the Ministerio para la Transformación Digital y de la Función Pública - Funded by EU – NextGenerationEU within the framework of the project Desarrollo de Modelos ALIA.



