Dataset integrado de libros de Project Gutenberg con Open Library: datos sin limpiar — M2.851 PRACT2
收藏资源简介:
Dataset generado como parte de la Práctica 2 de la asignatura M2.851 Tipología y ciclo de vida de los datos del Máster en Ciencia de Datos de la Universitat Oberta de Catalunya (UOC). Contiene 1.122 filas y 38 columnas. Es el resultado de integrar dos fuentes: el scraping de 17 bookshelves temáticas de Project Gutenberg (ampliación del dataset de la PRACT1) y el enriquecimiento mediante consulta a la API pública de Open Library por título y autor para cada libro único. El fichero refleja el estado de los datos antes de cualquier proceso de limpieza, e incluye duplicados por bookshelf, nulos estructurales en las columnas de Open Library y los campos originales sin transformar. Las columnas de Gutenberg incluyen: url, bookshelf_id, bookshelf_nombre, titulo, autor, idioma, clase_loc, materias, categoria, ebook_num, fecha_publicacion, fecha_actualizacion, copyright_status, downloads_30d, reading_ease_score, year_gutenberg, entre otras. Las columnas de Open Library (prefijo ol_) incluyen: ol_first_publish_year, ol_pages_median, ol_ratings_avg, ol_ratings_count, ol_edition_count, ol_subject_count, ol_status y variables de calidad del match. Los datos de Project Gutenberg fueron extraídos en mayo de 2026 y representan una instantánea de las bookshelves seleccionadas en ese momento. Todas las obras son de dominio público.



