GoogleTrendArchive
收藏资源简介:
该数据集包含来自Google“Trending Now”功能的超过760万条趋势搜索实例,持续收集自2024年11月28日至2026年1月3日,覆盖所有可用的地理区域(200多个国家/地区)。与Google Trends等聚合回顾工具不同,Trending Now捕捉了实时激增的搜索查询,为研究集体注意力动态提供了前所未有的时间粒度。每个实例代表特定搜索词或查询集群根据Google算法成为“趋势”的时刻,包含搜索量区间、精确时间戳、趋势持续时间、地理位置和相关查询变体。数据集由苏黎世大学和斯坦福人工智能实验室的社会计算小组策划,语言为多语言,许可证为CC-BY-4.0。
This dataset contains over 7.6 million trending search instances sourced from Google's "Trending Now" feature, continuously collected from November 28, 2024 to January 3, 2026, covering all available geographic regions (over 200 countries and regions). Unlike aggregated retrospective tools such as Google Trends, "Trending Now" captures real-time surging search queries, providing unprecedented temporal granularity for research on collective attention dynamics. Each instance represents the moment when a specific search term or query cluster is classified as "trending" by Google's algorithms, and includes search volume ranges, exact timestamps, trend durations, geographic locations, and related query variants. The dataset is curated by the Social Computing Group of the University of Zurich and the Stanford Artificial Intelligence Laboratory, supports multiple languages, and is licensed under CC-BY-4.0.
Google Trend Archive 数据集概述
数据集基本信息
- 数据集名称:Google Trend Archive: Global Real-Time Search Trends (2024-2026)
- 维护者/作者:Aleksandra Urman, Anikó Hannák, Joachim Baumann (苏黎世大学社会计算小组 & 斯坦福人工智能实验室)
- 发布日期:2026年
- 许可协议:CC-BY-4.0
- DOI:https://doi.org/10.57967/hf/7531
- 数据集地址:https://huggingface.co/datasets/aurman/GoogleTrendArchive
- 联系方式:urman@ifi.uzh.ch
数据集描述
该数据集包含来自Google“正在流行”功能的超过760万条趋势搜索实例,数据持续采集自2024年11月28日至2026年1月3日,覆盖所有可用的地理区域(200多个国家/地区)。与Google Trends等聚合回顾性工具不同,“正在流行”功能捕获的是实时激增的搜索查询,为研究集体注意力动态提供了前所未有的时间粒度。
数据集内容与结构
- 数据量:超过7,600,000条趋势搜索
- 时间覆盖范围:2024年11月28日 - 2026年1月3日(因技术问题存在约14天的数据缺口)
- 地理覆盖范围:1358个国家和地区
- 数据格式:UTF-8编码的CSV文件
- 语言:多语言
- 字段构成:
- 趋势标识符:搜索查询或相关查询集群的代表性术语
- 搜索量:指示近似搜索量的分桶流量范围
- 开始时间戳:Google系统首次标记该趋势出现的时间
- 结束时间戳:趋势结束并恢复到基线水平的时间
- 趋势细分:Google聚类在一起的相关查询变体的逗号分隔列表
- 探索链接:指向相应Google Trends页面以供进一步调查的URL
任务类别与标签
- 任务类别:文本分类、时间序列预测
- 标签:google-trends, trending-now, attention-dynamics, information-diffusion, temporal-analysis, search-trends
- 规模类别:1M<n<10M
预期用途
- 信息传播建模
- 事件检测
- 比较文化研究
- 危机沟通
- 时间模式分析
- 预测建模
- 媒体生态系统分析
- 政治传播研究
非预期用途
- 用于对特定人群的监视或监控
- 用于营销或商业定向
- 用于得出关于人口信念的确定性结论
- 用于识别或追踪个人
- 用于训练有害应用的模型
数据来源与处理
- 原始数据生产者:Google的“正在流行”系统
- 数据收集:使用自动化软件持续监控所有可用地理位置的Google Trends“正在流行”页面
- 预处理步骤:时间戳标准化、持续时间计算、地理代码标准化、格式整合、数据验证和质量检查
- 验证程序:跨时间段和位置的完整性自动检查、时间戳一致性验证、重复数据去重、与人工抽查趋势的对比、收集失败记录
局限性、风险与建议
- 技术局限性:搜索量以分桶形式提供;Google的趋势识别算法不透明;存在数据缺失;趋势代表相对激增而非绝对搜索量。
- 代表性问题:搜索行为不能均匀代表全部人口;数字鸿沟和互联网普及率差异导致某些人口统计特征被过度/不足代表;搜索引擎市场份额因国家而异;地理覆盖范围有限。
- 算法中介:Google使用专有算法决定何为“趋势”;基于Google政策的内容过滤可能排除某些趋势;反映的是Google对显著搜索高峰的选择。
- 解释风险:搜索趋势显示人们搜索什么,而非搜索原因或结论;存在对人群进行不当概括或刻板印象的风险;敏感主题的模式可能污名化社区;缺乏社会背景可能导致误解。
- 使用建议:承认跨国比较中的代表性限制;解释模式时考虑互联网访问的结构性不平等;避免没有额外证据的因果主张;分析/呈现敏感主题时保持谨慎;解释集体注意力模式时考虑社会背景;以适当的认知谦逊呈现发现;认识到这代表了一个平台对集体注意力的视角。
维护与贡献
- 维护计划:数据集托管在Hugging Face并由作者维护。当前版本是2024年11月28日至2026年1月3日的快照。计划每2-3个月更新一次,数据收集正在进行中,更新将通过存储库中的变更日志进行沟通。
- 资助信息:瑞士国家科学基金会博士后流动奖学金P500-2 235328 (JB);SNSF项目资助215354 (AU and AH)
- 社区贡献:欢迎衍生数据集、错误报告和扩展数据收集的协作。




