遇见数据集

与疾病X相关的搜索兴趣大规模数据集

收藏
arXiv2023-12-19 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

本数据集由埃默里大学计算机科学系开发,涵盖了2018年2月至2023年8月期间全球94个地区的与疾病X相关的搜索兴趣数据。数据集通过Google Trends收集,每月记录一次搜索兴趣,旨在为大流行病准备和研究提供关键数据支持。该数据集的应用领域包括大数据分析、数据挖掘、医疗保健、流行病学和数据分析,特别关注疾病X的研究。

This dataset was developed by the Department of Computer Science at Emory University. It comprises search interest data related to Disease X across 94 global regions spanning from February 2018 to August 2023. Collected via Google Trends, the dataset records search interest on a monthly basis, aiming to provide critical data support for pandemic preparedness and research. Its application areas include big data analysis, data mining, healthcare, epidemiology, and data analytics, with a particular focus on research related to Disease X.

提供机构:
埃默里大学
创建时间:
2023-12-19
搜集汇总
数据集介绍
与疾病X相关的搜索兴趣大规模数据集 数据集图片
构建方式
该数据集的构建依托于谷歌趋势(Google Trends)这一公开平台,系统性地挖掘了全球范围内与“疾病X”相关的搜索兴趣数据。研究团队首先将时间跨度设定为2018年2月至2023年8月,以世界卫生组织将“疾病X”纳入重点监测疾病名录的起始月份为起点。通过设定“疾病X”作为主题词,并选择“全球范围”及“所有类别”的搜索设置,获取了初步的全球搜索趋势。随后,利用谷歌趋势的“区域兴趣”功能,筛选出在此期间对“疾病X”表现出显著搜索热度的94个地理区域。针对每个区域,逐月导出其搜索兴趣指数,并以逗号分隔值(CSV)格式保存。最终,借助微软Excel的Power Query工具,将94个独立的CSV文件整合为一个包含94个工作表的Excel工作簿,每个工作表以区域命名,存储该区域逐月的搜索兴趣数据。
特点
该数据集的核心特点在于其大规模、多区域与时间序列的综合性。它涵盖了来自全球94个不同地理区域的搜索兴趣数据,这些区域横跨六大洲,包括新加坡、美国、巴西、印度、日本等,提供了前所未有的地理多样性视角。时间跨度长达五年半(2018年2月至2023年8月),以月为粒度,使得研究者能够细致观察搜索兴趣的动态演变。数据严格遵循FAIR科学数据管理原则,具备可发现性(拥有唯一且永久的DOI)、可访问性(通过DOI在线获取)、互操作性(以标准.xlsx格式存储)和可重用性(支持无限次分析与研究)。此外,数据来源谷歌趋势具有匿名性、实时性和全球覆盖性,相较于传统调查方法,能更高效、低成本地捕捉公众对未知病原体的信息需求与关注度变化。
使用方法
该数据集的使用方法灵活多样,适用于跨学科的研究场景。研究者可直接下载Excel工作簿,利用数据分析工具(如Python的Pandas、R语言或SPSS)读取各区域逐月的搜索兴趣数值(范围0-100)。通过时间序列分析,可揭示特定区域或全球范围内对“疾病X”关注度的波动规律,例如识别关注高峰月份及其与公共卫生事件、媒体报道的关联。结合地理信息系统(GIS)技术,可绘制搜索热度的世界地图,比较不同区域间的差异与相似性。此外,数据可与社交媒体数据、流行病学报告或政策文件进行关联分析,用于构建预测模型、评估公众风险感知或监测信息传播的“翻译鸿沟”。该数据集为大数据、数据挖掘、医疗健康与流行病学等领域的研究者提供了宝贵的基础资源。
背景与挑战
背景概述
在全球公共卫生领域,世界卫生组织于2018年2月将“疾病X”纳入其重点疾病蓝图,用以指代一种可能引发未来大流行的未知病原体。这一概念的提出,旨在推动各国对病毒类别的整体性研究,而非仅针对特定病毒株,从而强化对大流行的预防与应对能力。在此背景下,由埃默里大学Nirmalya Thakur领导的团队于2023年创建了一个大规模数据集,系统收集了2018年2月至2023年8月期间来自全球94个地理区域的与疾病X相关的谷歌搜索兴趣数据。该数据集填补了现有研究在疾病X网络行为数据方面的空白,为大数据、数据挖掘、流行病学及医疗健康等交叉领域提供了关键资源,其遵循FAIR科学数据管理原则,确保了数据的可发现、可访问、可互操作与可重用性,对全球公共卫生准备具有重要的参考价值。
当前挑战
该数据集面临的核心挑战涵盖两大层面。首先,在领域问题层面,疾病X作为一种假设性病原体,其未知性使得传统流行病学监测手段难以直接应用,亟需通过挖掘网络搜索行为来洞察公众的认知、关注与信息需求,然而现有研究多聚焦于已爆发疫情(如COVID-19、流感等),缺乏针对疾病X的针对性数据与分析方法。其次,在构建过程中,数据集依赖谷歌趋势工具,其数据仅反映相对搜索量而非绝对数值,且谷歌未公开完整的算法与数据生成方法论,可能导致结果波动;此外,数据仅涵盖能访问互联网并使用谷歌搜索引擎的用户群体,存在代表性偏差;同时,部分区域因搜索量过低而未被纳入,限制了全球覆盖的完整性。
常用场景
经典使用场景
在公共卫生与流行病学领域,该数据集最经典的使用场景在于追踪与“疾病X”相关的全球公众搜索兴趣演变。研究者可借助Google Trends提供的月度搜索兴趣指数,系统分析94个地理区域在2018年2月至2023年8月期间对“疾病X”的关注程度。通过可视化不同区域的时间序列趋势,能够揭示公众对潜在未知病原体的认知波动,并识别出搜索兴趣激增的关键时间节点与地域分布特征。该场景为理解全球公共卫生意识动态提供了量化基础,尤其适用于探索媒体曝光、政策发布与公众信息需求之间的关联。
实际应用
在实际应用中,该数据集可为全球及地方公共卫生机构提供决策支持框架。例如,当“疾病X”引发潜在疫情时,卫生组织可依据不同区域的搜索兴趣波动,快速识别公众的信息需求热点与误解集中领域,从而制定更具针对性的科普策略与风险沟通方案。此外,结合社交媒体数据,该资源有助于实时监测虚假信息的传播路径,并为疫苗推广、防控措施的宣传效果评估提供基线参考。在供应链与应急响应规划中,搜索兴趣的时空分布还能辅助资源调配的优先级判断,提升整体准备工作的敏捷性与精准度。
衍生相关工作
该数据集的发布催生了一系列衍生性研究工作。首先,基于其提供的多区域时间序列,研究者构建了预测“疾病X”搜索兴趣的机器学习模型,例如结合季节性自回归移动平均(SARIMA)或长短期记忆网络(LSTM),以模拟公众关注度的短期演变。其次,部分工作将该数据集与Twitter、新闻语料库等进行多模态融合,通过情感分析与主题建模揭示搜索行为背后的社会心理动因。此外,也有学者借鉴该数据集的构建范式,开发针对其他新兴传染病(如MPox、新型流感)的类似搜索兴趣数据库,从而扩展了数字流行病学的基础设施,形成了可复用的方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务