Indicadores Macroeconómicos por país (Macroeconomic Data by Country)
收藏资源简介:
Dataset de indicadores macroeconómicos por país obtenido mediante técnicas de web scraping utilizando el framework Scrapy en Python. La información fue extraída desde la página “List of countries by GDP (nominal)” de Wikipedia y complementada con datos provenientes de las páginas individuales de cada país. El conjunto de datos incluye las siguientes variables: nombre del país, URL de referencia, PIB nominal en millones de USD, moneda, población, índice de desarrollo humano (HDI), PIB en paridad de poder adquisitivo (PPP), coeficiente de Gini y tasa de desempleo. El proceso de recolección se realizó en dos etapas: (1) extracción de la tabla principal de países y sus valores de PIB nominal, y (2) navegación automatizada hacia cada país para obtener variables adicionales desde la tabla tipo infobox. Para mejorar la calidad de los datos, se aplicaron procedimientos de limpieza de texto mediante expresiones regulares, eliminando referencias, caracteres no relevantes y espacios redundantes. Se incorporaron configuraciones orientadas al uso responsable del scraping, incluyendo retrasos entre solicitudes, aleatorización de tiempos de descarga, activación de AutoThrottle y respeto por las políticas definidas en robots.txt. El dataset se entrega en formato CSV y está orientado a fines académicos, particularmente para el análisis exploratorio de datos, modelamiento y desarrollo de habilidades en ciencia de datos y business analytics.
本数据集为各国宏观经济指标数据集,依托Python的Scrapy框架,通过网络爬虫(web scraping)技术采集获取。数据最初采集自维基百科的"按名义国内生产总值(GDP)排序的国家列表"页面,并补充了各国专属维基百科页面中的相关数据。 本数据集包含以下变量:国家名称、参考URL、以百万美元计的名义国内生产总值(GDP)、货币类型、人口数量、人类发展指数(HDI)、购买力平价国内生产总值(PPP GDP)、基尼系数以及失业率。 数据采集流程分为两个阶段:(1) 提取各国主表格及其名义GDP数据;(2) 自动化导航至各国专属页面,从信息框类表格中获取额外变量。为提升数据质量,我们通过正则表达式执行文本清洗操作,移除引用标记、无关字符与冗余空格。 本数据集采用了面向负责任爬虫操作的配置策略,包括请求间隔延迟、下载时间随机化、启用AutoThrottle功能,以及遵守robots.txt中定义的站点访问规则。 本数据集以CSV格式发布,主要面向学术研究用途,尤其适用于探索性数据分析、模型构建,以及数据科学与商业分析(business analytics)相关技能的训练与提升。



