遇见数据集

bbc-news-logger

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

BBC新闻表面观察数据集是一个独立的纵向研究数据集,用于记录BBC新闻首页和最多阅读列表中出现的故事,同时包含链接文章的解析快照。该数据集包含三个主要配置:observations配置提供每个故事位置和每小时收集的数据行,使用稳定的story_id值便于跨表面和纵向连接;article_snapshots配置包含每日URL集合获取一次的解析元数据和纯文本;scrape_runs配置则提供新收集运行的操作元数据,包括选择器版本和验证计数。所有时间戳均采用UTC标准,数据以Zstandard压缩的Parquet文件格式存储,按年、月和UTC日期分区。数据集适用于时间序列预测、新闻学分析、纵向研究和审计等任务,但需注意该数据集仅记录BBC的两个网页表面,不反映编辑意图、读者群体或所有BBC输出,且布局和选择器变更可能导致数据缺口。

The BBC News Surface Observational Dataset is a standalone longitudinal study dataset that records stories appearing on the BBC News homepage and most read list, along with parsed snapshots of linked articles. It includes three main configurations: the observations configuration provides data rows for each story position collected hourly, using stable story_id values for cross-surface and longitudinal linking; the article_snapshots configuration contains parsed metadata and plain text fetched daily for URL sets; and the scrape_runs configuration offers operational metadata for new collection runs, including selector versions and validation counts. All timestamps are in UTC, and data is stored in Zstandard-compressed Parquet files partitioned by year, month, and UTC date. The dataset is suitable for tasks such as time-series forecasting, journalism analysis, longitudinal research, and auditing, but note that it only records two BBC web surfaces and does not reflect editorial intent, audience, or all BBC output, with layout and selector changes potentially causing data gaps.

创建时间:
2026-07-14
原始信息汇总

数据集概述:BBC News Surface Observations

  • 数据集名称:BBC News Surface Observations
  • 许可证:其他(需遵守BBC条款与版权)
  • 语言:英语(en)
  • 任务类别:时间序列预测
  • 标签:新闻、新闻业、纵向研究
  • 发布者:AlastairH(独立研究项目,未与BBC关联或获得认可)

数据集内容

该数据集记录了BBC新闻首页和“最多阅读”列表中出现的报道,以及相关文章的解析快照。适用于研究、审计和新闻分析。

配置(Configurations)

数据集包含三个配置,数据以Zstandard压缩的Parquet格式存储,按年、月、UTC日期分区,所有时间戳为UTC。

  • observations:每行对应一次每小时收集中某个故事的位置。包含稳定的story_id,便于跨表面和纵向连接。
  • article_snapshots:每天对URL集合抓取一次,包含解析后的元数据和纯文本。原始HTML保留在配套的原始数据集中。
  • scrape_runs:每次新收集操作的元数据,包括选择器版本和验证计数。

已知限制

  • 仅记录BBC两个网页表面,不反映编辑意图、读者群体或全部BBC输出。
  • 布局和选择器变化可能导致数据缺失;若任一表面为空,新运行会失败关闭。
  • 旧版文章编写器曾错误地将URL存储在first_appeared_at字段中;迁移时尽可能从最早匹配的观测值修复。
  • 首页推广内容历史上没有明确的排名,因此其位置根据每次抓取的行顺序重建。

附加信息

  • 迁移审计文件位于migration/manifest.json,记录源哈希、行数、目标哈希及源Git提交。
  • 历史文章的fetched_at值根据旧文件名推断,并标记为fetched_at_is_inferred=true
搜集汇总
数据集介绍
bbc-news-logger 数据集图片
构建方式
该数据集通过独立的纵向研究方法,系统性地记录了BBC新闻首页与“最多阅读”列表中的故事出现情况,并解析链接文章的元数据与纯文本内容。数据采集采用定时抓取策略,每小时收集一次观察数据,同时为每个URL集合每日抓取一次文章快照。所有文件均采用Zstandard压缩的Parquet格式,按年、月、UTC日期分区存储,并嵌入模式版本元数据,确保数据的一致性与可追溯性。历史文章的抓取时间通过旧文件名推断并标记,迁移审计清单记录了源哈希、行数、目标哈希及Git提交信息,保证了数据迁移的完整性。
特点
数据集包含三个核心配置:观测数据表以稳定故事ID为键,支持跨表面与纵向连接;文章快照表提供解析后的元数据与纯文本,原始HTML保留在配套数据集中;抓取运行表记录每次采集的操作元数据,包括选择器版本与验证计数。所有时间戳统一为UTC,数据集独立于BBC官方发布,专为研究、审计与新闻分析设计,用户需自行确保使用合法性。其局限性在于仅覆盖两个BBC网页表面,不反映编辑意图或读者实际阅读情况,布局与选择器变更可能导致数据间断。
使用方法
用户可通过HuggingFace数据集库加载该资源,使用`load_dataset`函数指定配置名称(如'observations')即可访问对应表格。数据以Parquet格式存储,支持高效的时间序列分析与统计查询,利用`story_id`字段可实现故事在不同表面的跨时间点追踪。文章快照中的纯文本适用于自然语言处理任务,而抓取运行元数据可用于评估数据采集质量。建议结合时间窗口过滤与分区列优化查询性能,历史数据中的推断时间字段需谨慎使用,并参照迁移审计清单验证数据完整性。
背景与挑战
背景概述
BBC News Surface Observations数据集由独立研究团队于近年创建,专注于新闻媒体领域的纵向时序分析。该数据集系统性地记录了BBC新闻首页与“最多阅读”列表的展示内容,并附带了链接文章的解析快照,为新闻编辑决策、内容传播模式及公众关注度演化等研究提供了宝贵的结构化数据资源。其核心研究问题在于:如何通过高频率、长周期的表面观测数据,揭示新闻议程设置与受众注意力流动的潜在规律。该数据集一经发布,便对计算新闻学、媒体社会学及信息科学领域产生了重要影响,尤其为验证新闻选择理论、构建预测模型及开展媒体审计提供了可复现的基础设施。
当前挑战
该数据集面临多重挑战。在领域问题层面,它仅捕捉BBC两个网页表面的可见内容,无法反映编辑意图、实际读者行为或BBC全部新闻输出,导致研究结论可能存在表面偏差与覆盖局限。在构建过程中,网页布局与选择器的动态变更易造成数据采集缺口,且新抓取运行在任一表面为空时均会失败关闭,形成系统性缺失。此外,历史数据中存在因存储逻辑缺陷而导致的字段错位问题(如将URL写入时间戳字段),需依赖复杂迁移脚本修补,增加了数据清洗的难度与不确定性。最后,首页推广内容的排名顺序缺乏显式历史记录,只能通过每次抓取的行序重建,引入了位置重构的潜在误差。
常用场景
经典使用场景
BBC News Surface Observations数据集通过持续记录BBC新闻首页与“最多阅读”栏目的故事出现情况,为新闻传播学与计算社会科学提供了罕见的高频纵向观测窗口。研究者可以借此追踪特定新闻议题在首页的驻留时长、位置变迁以及跨时段的热度波动,从而揭示新闻编辑室的议程设置逻辑与公共关注度的动态耦合关系。数据集以小时为粒度采集,并提供了稳定的故事标识符,便于跨表面、跨时段的多维联合分析,成为新闻议程研究与内容流转分析的经典数据基础。
解决学术问题
该数据集有效回应了新闻传播领域中长期存在的两个核心议题:其一,新闻媒体如何在不同时间段内对议题进行显著性分配,即议程设置强度的时序演化问题;其二,编辑选择与公众注意力之间的差异与共振,即“首页故事”与“最多阅读”列表之间的一致性与背离模式。通过对BBC这一全球性新闻机构的高频观测,研究者得以从经验层面检验议程设置理论、新闻价值理论及注意力经济假说,推动了计算传播学从静态横断面分析向动态纵向机制的转向。
衍生相关工作
基于该数据集,学界已衍生出多项具有影响力的研究工作。例如,研究者利用数据中的故事滞留时间与位置变化,构建了新闻议题的“注意力衰变模型”,量化了不同主题类别在公众视野中的存续差异;另有工作通过首页与最多阅读列表的对比,揭示了编辑议程与用户消费之间的“双峰分布”现象,为新闻推荐算法的公平性讨论提供了实证支撑。此外,该数据集还被用于训练新闻热度预测的时间序列模型,推动了新闻时序分析在计算传播学与媒体工程中的交叉应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务