遇见数据集

corpus-social-media-government-nz

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

新西兰政府社交媒体语料库/档案是一个规范化的、多来源的公共记录数据集,专门收录新西兰政府机构在社交媒体平台及相关公共网络渠道发布的内容。该数据集旨在为信息发现、来源追溯和上下文证据保留提供结构化数据支持。数据集内容涵盖了Bluesky、X(原Twitter)、YouTube、LinkedIn、RSS订阅、政府网站页面及电子邮件通讯等多种来源的政府公开记录。数据经过规范化处理,每条记录均包含来源平台、来源账户、原始URL、捕获时间戳、发布时间戳、内容哈希值、媒体引用、原始数据路径及提取方法等关键元数据字段。数据以JSON Lines(压缩格式)和Parquet两种格式提供,便于不同场景下的处理与分析。根据统计,数据集包含来自8类来源的共计9,247条记录,其中RSS来源记录最多(3,887条),其次是YouTube(1,821条)和Bluesky(1,587条)。该数据集适用于文本分类、文本生成、公共信息分析、政府传播研究、社交媒体档案学及数字人文等领域的研究与应用。需要注意的是,当前数据收集主要依赖网站、RSS和Bluesky的自动化归档,其他平台(如新闻通讯和电子邮件)的完整收录工作仍在进行中。

The New Zealand Government Social Media Corpus/Archive is a standardized, multi-source public record dataset dedicated to collecting content published by New Zealand government agencies on social media platforms and related public web channels. This dataset aims to provide structured data support for information discovery, source tracing, and contextual evidence preservation. The dataset covers government public records from multiple sources including Bluesky, X (formerly Twitter), YouTube, LinkedIn, RSS feeds, government website pages, and email newsletters. The data has been standardized, with each record containing key metadata fields such as source platform, source account, original URL, capture timestamp, publication timestamp, content hash value, media references, original data path, and extraction method. The data is provided in two formats: JSON Lines (compressed) and Parquet, facilitating processing and analysis in different scenarios. According to statistics, the dataset contains a total of 9,247 records from 8 categories of sources, among which RSS feed records are the most numerous (3,887), followed by YouTube (1,821) and Bluesky (1,587). This dataset is applicable to research and applications in fields such as text classification, text generation, public information analysis, government communication research, social media archival science, and digital humanities. It should be noted that current data collection mainly relies on automated archiving of websites, RSS feeds and Bluesky; the complete collection of records from other platforms (such as newsletters and emails) is still in progress.

创建时间:
2026-06-28
原始信息汇总

数据集概述

数据集名称:New Zealand Government Social Media Corpus/Archive
规范名称corpus-social-media-government-nz
许可证:其他(other
任务类别:文本分类、文本生成
语言:英语(en
标签:语料库、社交媒体、政府、新西兰、区域:新西兰、公共记录、RSS、Bluesky、Threads、YouTube


数据集内容

该数据集包含标准化的新西兰政府社交媒体记录,并保留了RSS及邻近的公共网络来源记录,用于溯源、出处和来源上下文证据。

文件与结构

  • normalized_archive.jsonl.gz:来自各源/月分片的组合标准化记录(JSONL格式压缩)
  • normalized_archive.parquet:组合标准化记录(Parquet格式)
  • normalized/:按源/月划分的标准化JSONL分片
  • raw/:标准化前捕获的原始来源载荷
  • corpus_manifest.json:校验和、覆盖计数、日期范围及已知缺口

来源覆盖情况

  • Bluesky:1587条记录
  • courtsofnz.govt.nz:11条记录
  • 电子邮件:11条记录
  • LinkedIn:2条记录
  • RSS:3887条记录
  • 网页页面:219条记录
  • X(Twitter):689条记录
  • YouTube:1821条记录

数据出处

记录源自新西兰政府社交媒体及邻近的公共来源页面,保留了以下元数据(如适用):

  • 来源平台
  • 来源账号
  • 来源URL
  • 捕获时间戳
  • 原始时间戳
  • 内容哈希
  • 媒体引用
  • 原始路径
  • 提取方法

已知缺口

  • 除网站、RSS和Bluesky之外的平台捕获需要经批准的API、导出或手动导入流程,方可进行自动归档。
  • 新闻通讯和电子邮件订阅的接入尚未配置针对性的邮箱/路由设置。
  • 原始来源包已包含在Actions构件和完整归档压缩包中;若来源条款要求,可另行添加受限的原始发布渠道。
搜集汇总
数据集介绍
corpus-social-media-government-nz 数据集图片
构建方式
该数据集源自新西兰政府社交媒体及邻近公共网络资源的系统化采集与规范化处理。构建过程中,首先对多源原始负载进行抓取,涵盖蓝空、线程、优兔等平台以及政府网站、RSS源和电子邮件渠道的数据。随后,通过统一的标准化流程,将原始记录转化为规范化格式,并压缩为JSONL及Parquet文件存储。数据集还包含了原始载荷快照及清单文件,以记录校验和、覆盖统计、日期范围及已知空缺,确保可追溯性和来源上下文证据的完整性。
特点
数据集的核心特点在于其多平台异构数据的统一规范化整合,提供了从蓝空、优兔、X、领英、RSS及政府网站等八类来源的共计逾八千条记录。每个记录均保留了来源平台、账户、URL、捕获时间戳、原始时间戳、内容哈希、媒体引用、原始路径及提取方法等详尽的来源元数据。此外,数据集明确标识了捕获覆盖的局限性,如需要API批准或手动导入的通道,以及待处理的邮件订阅入口,展现了数据的透明性与诚实性。
使用方法
研究者可通过Hugging Face数据集库直接加载该资源,使用`load_dataset`函数指定数据集名称即可获取规范化后的记录。数据主要适用于文本分类与文本生成任务,用户可依据任务需求选择JSONL或Parquet格式文件进行分析。由于原始载荷包含在完整归档包中,高级用户可结合清单文件中的校验和与日期范围信息,进行数据验证或自定义预处理。对于受限来源的缺口,建议采用外部API或手动工作流补充数据,以确保研究的全面性。
背景与挑战
背景概述
在数字治理与政务公开的浪潮中,社交媒体已成为政府与公众互动的重要渠道。新西兰政府社交媒体语料库(corpus-social-media-government-nz)由相关研究机构于近年创建,旨在系统性地归档和标准化新西兰政府机构在多个社交平台(如Bluesky、YouTube、RSS等)上发布的公开记录。该数据集通过保留原始载荷与归一化处理,解决了政务社交媒体数据分散、格式异构的痛点,为公共记录留存、传播分析及问责研究提供了坚实的基础。其核心研究问题在于如何构建一个可追溯、可验证的政务社交媒体存档体系,对政策透明度、信息治理及开放政府运动具有重要推动作用。
当前挑战
该数据集面临的挑战首先体现在政务社交媒体存档的领域问题上:平台数据的碎片化与API访问限制导致收录范围存在已知缺口,如Newsletter和邮件订阅的自动化接入尚未实现,且部分平台(如LinkedIn、X)的原始数据获取依赖额外授权。其次,构建过程中需应对数据结构高度异构的难题,从RSS的标准化订阅到Bluesky去中心化协议的适配,再到视频平台元数据的提取,归一化流程需兼顾精度与效率。此外,原始源数据的版权与隐私合规要求,以及对长期存储中格式兼容性的维护,进一步增添了档案完整性与可持续性的技术挑战。
常用场景
经典使用场景
该数据集汇聚了新西兰政府在新兴社交媒体平台(如BlueSky、YouTube、X)与传统公共数字界面(如RSS订阅、官网页面)上的公开记录,为研究政府数字传播行为的时空演变提供了标准化样本。研究者可通过该语料库追踪政策发布、危机沟通、公众互动等话语模式的动态特征,尤其适用于对比不同平台间政府信息呈现策略的异同,或分析社交媒体时代公共机构话语权的迁移路径。
实际应用
在实际应用中,该数据集可赋能政府机构内部的社交媒体内容审计与合规性监测,帮助其回溯信息发布的规范性。社会科学研究者可借此构建政府话语的舆情预警模型;档案管理领域则可利用其RSS原始快照与规范化记录的对照关系,设计面向公共数字遗产的长期保存策略。此外,新闻媒体与透明度监督机构可基于该数据自动化生成政府信息透明度的定量报告。
衍生相关工作
该数据集衍生出的经典工作包括政府社交媒体情感分析与主题建模、跨平台政府话语的协调性检测、以及基于时序的公共政策议程设定研究。未来方向可拓展至多语言政府语料库的构建方法学探索、政府数字足迹与线下公共服务质量之间的关联建模,乃至构建新西兰政府信息传播的数字孪生模拟系统,为全球政府开放数据运动提供方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务