Diccionario de uso del español de María Moliner — datos estructurados
收藏资源简介:
Dataset estructurado del Diccionario de uso del español de María Moliner (DUE 3.0), extraído directamente de la base de datos del programa original. Versión 2 — cambios respecto a la versión 1: Fuente de datos: V1 procedía de una extracción OCR del libro impreso. V2 procede directamente de la base de datos interna del software DUE 3.0, eliminando los artefactos OCR y obteniendo los datos tal como los almacenaba el programa original. Acepciones estructuradas: en V1 cada acepción era una cadena de texto plana. En V2 cada acepción es un objeto con campos separados: categoria_gramatical, epigrafe, definicion, ejemplos, sinonimos y sub_acepciones anidadas. Expresiones pluriverbales estructuradas: en V1 eran strings. En V2 son objetos con expresion, definicion y sinonimos. Nuevos campos: catalogo (lista de palabras relacionadas, tesauro) y notas_de_uso. Número de entradas: V1 contenía 92 667 entradas (incluyendo duplicados del OCR y entradas de tipos distintos mezcladas). V2 contiene 88 112 entradas de tipo definición, más homogéneas y sin duplicados. Disponible en formato JSONL (una entrada por línea, 44 MB) y CSV (15 MB). El CSV incluye las acepciones aplanadas como texto para facilitar la ingestión en hojas de cálculo.



