遇见数据集

Dataset integrado de libros de Project Gutenberg con Open Library: dataset limpio para análisis — M2.851 PRACT2

收藏
Zenodo2026-05-20 更新2026-05-26 收录
官方服务:

资源简介:

Dataset generado como parte de la Práctica 2 de la asignatura M2.851 Tipología y ciclo de vida de los datos del Máster en Ciencia de Datos de la Universitat Oberta de Catalunya (UOC). Contiene 1.095 filas y 41 columnas. Es la versión limpia y lista para análisis del dataset integrado de Project Gutenberg y Open Library. Respecto al dataset sin limpiar, se han aplicado las siguientes transformaciones: eliminación de 27 duplicados por ebook_num (conservando en la columna bookshelves_all todas las categorías de origen de cada libro), imputación de nulos en columnas de Open Library (mediana para páginas, year_gutenberg para año de primera publicación, cero para conteos), conversión de tipos (fechas a datetime, variables categóricas a category, enteros con nulos a Int64), extracción de la puntuación numérica Flesch-Kincaid del campo nivel_lectura en la variable reading_ease_score y derivación de la variable ordinal reading_difficulty con 7 niveles, transformación logarítmica de variables con alta asimetría (downloads_30d_log, ol_edition_count_log, ol_pages_median_log), y eliminación de 3 columnas redundantes. Los datos de Project Gutenberg fueron extraídos en mayo de 2026 y representan una instantánea de las bookshelves seleccionadas en ese momento. Todas las obras son de dominio público.

提供机构:
Zenodo
创建时间:
2026-05-20
二维码
社区交流群
二维码
科研交流群
商业服务