遇见数据集

MedRel_Spanish

收藏
Zenodo2025-05-25 更新2026-05-26 收录
官方服务:

资源简介:

------------ MedRel DataSet Spanish ---------------- Este conjunto de datos incluye un archivo CSV con frases del dominio médico en español, anotadas con tres tipos de entidades: ANAT: Partes del cuerpo ENFE: Enfermedades MEDI: Medicamentos Cada frase contiene dos entidades médicas enmascaradas y una etiqueta binaria que indica la existencia de una relación médica y contextual entre ellas: 1: Existe relación médica y contextual 0: No existe relación Este dataset puede ser utilizado como recurso auxiliar para el entrenamiento y evaluación de modelos de clasificación de relaciones médicas en textos clínicos en español. ####Creador de datos#### Las entidades fueron identificadas mediante un sistema automático de reconocimiento de entidades médicas desarrollado en un trabajo en proceso de publicación. Las frases se extrajeron de un total de 165 resúmenes (abstracts) de publicaciones científicas médicas: Tsatsaronis, G., Balikas, G., Malakasiotis, P., Partalas, I., Zschunke, M., Alvers, M. R., Weissenborn, D., Krithara, A., Petridis, S., Polychronopoulos, D., Almirantis, Y., Pavlopoulos, J., Baskiotis, N., Gallinari, P., Artieres, T., Ngonga, A., Heino, N., Gaussier, E., Barrio-Alvers, L., Schroeder, M., Androutsopoulos, I., & Paliouras, G. (2015). An overview of the BIOASQ large-scale biomedical semantic indexing and question answering competition. BMC Bioinformatics, 16, 138. https://doi.org/10.1186/s12859-015-0564-6 ####Etiquetado de datos #### El etiquetado de relaciones fue realizado manualmente por tres expertos en el dominio médico: *Médico 1 Dr. Alexis Eduardo Jiménez Rodríguez Encargado de la sección de servicio médico Universidad Autónoma Metropolitana, Unidad Azcapotzalco *Médico 2 Dr. Carlos Virrueta Sánchez Encargado de la sección de servicio médico Universidad Autónoma del Estado de México, CU Texcoco *Médico 3 Dr. José Luis Rodriguez Cruz Subdirector médico Sanatorio de nuestra señora del carmen Cada experto evaluó si las entidades en cada frase mantenían una relación médica y contextual, asignando la etiqueta correspondiente. Como resultado del proceso de etiquetado, los expertos identificaron 1,106 frases que sí contenían una relación y 806 frases que no la contenían. #### Notas de uso ##### Este conjunto de datos está diseñado para entrenar y validar modelos de aprendizaje automático o aprendizaje profundo en tareas de clasificación de relaciones entre entidades médicas. Es especialmente útil en aplicaciones de procesamiento de lenguaje natural (PLN) en el ámbito clínico en idioma español.

提供机构:
Zenodo
创建时间:
2025-05-25
二维码
社区交流群
二维码
科研交流群
商业服务