遇见数据集

Web Scraping PRACT1

收藏
Zenodo2024-11-11 更新2026-05-26 收录
官方服务:

资源简介:

Dataset obtenido de realizar webscraping en el sitio web del periódico El Pais. El dataset consiste en dos campos incluidos en una misma columna, ambos en formato texto: Titular: título de la noticia Fecha: fecha en que dicha noticia fue publicada. El dataset se genera a partir de la extracción de titulares de varios días. En primer lugar, se recorre de forma iterativa el rango de fechas indicado en el código para la hemeroteca. Posteriormente, y una vez concluido con el rango de fechas pasadas, se llama nuevamente a la función que extrae los titulares, pero en la URL principal (la que no corresponde a la hemeroteca) y con la fecha actual del sistema cuando se ejecuta el web scraping.

本数据集通过对西班牙《国家报(El Pais)》官网开展网络爬虫(web scraping)采集得到。 本数据集包含两个文本格式字段,二者均存储于同一列中,具体如下: - 标题字段(Titular):对应新闻的标题 - 发布日期字段(Fecha):该新闻的发布时间 本数据集通过多轮新闻标题采集流程生成:首先以迭代方式遍历代码中指定的报刊过刊数据库(hemeroteca)日期范围完成历史新闻标题采集;待该历史日期范围的采集任务结束后,再次调用标题提取函数,访问非报刊过刊数据库的官网主页面,并以本次网络爬虫运行时的系统当前日期为准,采集当日新闻标题。

提供机构:
Zenodo
创建时间:
2024-11-11
二维码
社区交流群
二维码
科研交流群
商业服务