遇见数据集

U.S. Data Center Siting Dataset

收藏
github2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

一个可复现的数据集和建模提案,用于评估在电力、水资源、网络、土地和成本约束下的美国数据中心选址。

A reproducible dataset and modeling proposal for evaluating U.S. data center site selection under constraints including electricity, water, network, land, and cost.

创建时间:
2026-08-27
原始信息汇总
  • 研究状态:提案阶段
  • 地理范围:覆盖美国50个州
  • 数据快照时间:2026年8月27日
  • 核心用途:评估美国数据中心选址,考虑电力、水资源、网络、土地和成本等约束条件
  • 关键数据量:推断出951个独立站点,涉及45个州,核心模型特征15个,硬性可行性规则13条,开放结果标签基础3个,主基准实验4个,排序扩展2个

数据分布

  • 弗吉尼亚州是最大的数据中心集群,由于邻近观察共享基础设施、市场、气候和监管条件,不适合随机划分训练集和测试集
  • 站点类型分为三种互斥类别:明确多边形园区、未匹配的建筑和点
  • 实体解析边界对总数影响显著,更宽的名称、运营商和距离阈值会合并更多记录并减少推断总数

核心特征模式

数据集保留15个可观测特征,分为五大类:

因子 代表性测量
电力 IT负载、PUE、变电站距离、输电电压
水资源与冷却 水冷比例、市政服务区域距离
网络 对称1Gbps提供商数量、高速光纤距离
土地与建设 园区面积、连续可行面积、坡度、发达土地邻近度
成本与市场 土地成本、电价、税率、市场距离

可用性等级A表示清晰的国家级公开图层或可验证的项目字段,等级B表示需要本地记录、项目文档、地理空间处理或单位统一的可获取变量。缺失值保持缺失,不用主观权重替代。

硬性可行性门控

13条规则筛选机场、水体、坡度、塌陷区、洪水风险、公园墓地、基础设施距离、保护土地、交通通行权、军事区域和发达土地限制。失败的站点在回归、分类或排序前即被排除,即使其他模型输入有利也无法补偿。

结果标签策略

标签证据链:FracTracker项目表 → DataCenterTracker事件历史 → IM3运营站点交叉检查 → 官方决策证据 → 严格标签

  • positive_strict:有日期官方证据表明最终批准、许可发放、建设或运营
  • negative_strict:有日期最终政府、规划、分区或许可拒绝,且后来未推翻
  • 已撤回、因其他原因取消、延迟、暂停和进行中的项目在首个基准中作为独立结果

仅预测时间t0前可观测的特征可进入训练,取消、暂停、新闻覆盖和决策后基础设施变更不能作为捷径预测器。

建模基准

采用两种架构,分别评估回归和序数分类两种监督形式,共4个实验,使用相同的嵌套空间交叉验证折叠和一个锁定地理测试集:

  • 回归目标:预测连续推荐分数y_score,越高越好
  • 序数多分类目标:预测y_grade ∈ {1,…,K},1级最佳,K在训练折叠内选择

候选模型包括机器学习(弹性网络、GAM、SVR、随机森林、Extra Trees、XGBoost、LightGBM、CatBoost、序数逻辑回归)和深度学习(MLP、TabNet、FT-Transformer;序数版本用CORAL或CORN损失)。

学习排序扩展比较融合排序器(R1)与因子级排序后融合(R2),主要指标为NDCG@K,辅助指标包括Top-K命中率、成对准确率、Spearman相关性和排序稳定性分析。

数据溯源

主要上游来源包括:IM3开源数据中心图集、CERF数据中心、IM3预测美国数据中心位置、FracTracker开放美国数据中心追踪器、追踪美国AI数据中心建设、FCC宽带数据收集、USGS公共供水服务区域、HIFLD/GeoPlatform、NLCD和Census TIGERweb。

局限性

  • 站点计数依赖显式实体解析边界,需要抽样人工审查
  • 基础设施距离不建立备用电力、水资源或网络容量
  • 多个项目特定特征需要许可、公用事业意见或本地税收和地块记录
  • 独立严格标签需官方确认,取消、暂停、撤回和待定非自动否定
  • 历史特征需在t0重建,当前值可能导致时间泄漏
  • 若从y_score离散化等级,切点不能提供独立验证目标
  • 深度学习在独立标记样本大幅增加前不作为主要结果
搜集汇总
数据集介绍
U.S. Data Center Siting Dataset 数据集图片
构建方式
该数据集针对美国数据中心选址的复杂多维决策问题,构建了一套可复现的实体解析与特征工程框架。其核心构建逻辑首先基于IM3开源数据中心图谱等多源地理空间数据,通过空间叠加与身份匹配规则,将原始的点、建筑、园区三层异构记录解析为951个互斥的独立站点实体,并明确了州级分布。随后,数据集成为了15项可观测的核心特征,覆盖电力、水冷、网络、土地与成本五大关键因子,并严格区分了特征的数据可得性等级。此外,研究设定了13条硬性可行性规则,作为选址的前置筛选门槛,确保不合规站点在模型评分前即被排除。最终,通过整合FracTracker、DataCenterTracker及官方记录构建了独立的严格标签体系,并设计了冻结时间点的历史特征重建机制,以规避时间泄漏风险,为后续的建模评估奠定了严谨的数据基础。
特点
该数据集的特点在于其严谨性、可复现性与对现实复杂性的深刻考量。它不依赖单一数据源,而是通过多源交叉验证与实体解析,生成了一套明确的站点清单,并公开了空间去重与身份匹配的规则,使得结果可审计、可复现。其核心特征集摒弃了难以观测的主观变量,聚焦于可量化的基础设施与成本指标,并明确了数据缺失的处理原则,避免主观臆断。尤为突出的是,其硬性可行性规则与独立标签策略,区分了项目获批、拒绝、撤销等多种结局,并严格控制了时间窗口,防止前视偏差,体现了科学建模的严谨态度。同时,数据集对弗吉尼亚州等地理聚集现象的明确提示,以及针对空间相关性的考量,都为后续的模型设计提供了重要指引,而其对局限性(如基础设施距离不代表容量)的坦诚说明,更突显了其作为研究基线的可信度。
使用方法
该数据集的使用方法遵循一套清晰的科学流程,主要围绕提供的两个Jupyter Notebook展开。研究者可通过运行01号Notebook,复现从原始数据到951个推断站点的完整实体解析过程,并详细了解15项核心特征的定义、13条硬性可行性规则的具体内容以及独立标签的构建细节。随后,基于02号Notebook,使用者可以开展模型基准测试,包括回归与序数分类两种任务,并选用多种机器学习或深度学习算法。数据集明确提供了嵌套式空间交叉验证的划分原则,要求同项目或邻近站点必须处于同一折中,以便获得可靠的泛化性能评估。此外,研究者还可利用其扩展的学习排序模块,结合融合排名器等进行更深入的分析。所有原始数据与处理脚本均存储于本仓库,确保用户能够完全复现研究过程,并根据自身需求调整实体解析阈值或特征定义,进行定制化研究。
背景与挑战
背景概述
随着人工智能与云计算技术的迅猛发展,数据中心作为数字基础设施的核心载体,其选址决策对能源消耗、水资源利用、网络连通性及区域经济布局产生深远影响。然而,美国现有公开数据源在数据一致性、空间粒度及项目生命周期覆盖上存在显著缺口,难以支撑科学化、可复现的选址评估。为此,由美国多机构联合团队提出U.S. Data Center Siting Dataset,于2026年8月发布,旨在构建一个融合多源异构数据、具备严格实体解析与可验证标签体系的全国性选址评估数据集。该数据集整合了IM3数据中心的原子、建筑及园区图层,推断出951个独立站点,覆盖45个州,并定义了15项核心特征与13条硬性可行性规则,为机器学习模型在站点评分、分级与排序任务上提供了标准化的实验基准,填补了该领域缺乏可对比研究平台的空白。
当前挑战
该数据集面临的挑战主要源于领域复杂性与构建过程两方面。在领域层面,数据中心选址需综合权衡电力供应、水冷系统、网络基础设施、土地成本及政策约束等多维因素,且各因素间存在非补偿性关系,任何单一指标的劣势都可能导致项目不可行;同时,站点空间集聚性强,弗吉尼亚州等区域集中了大规模站点,导致传统随机划分训练集与测试集方法失效,需依赖嵌套空间交叉验证以避免空间自相关性带来的评估偏差。在构建层面,首要挑战是实体解析的模糊性,不同图层间缺少统一项目主键,需通过空间与属性阈值进行推断,而阈值选取会显著影响站点总数及其空间分布;其次,独立结果标签的获取极为困难,现有公开数据库如FracTracker和DataCenterTracker虽提供了丰富的候选项目与事件记录,但缺乏统一的唯一标识及最终决策结果,需结合官方审批文件进行逐案核实,耗时且易产生标注疏漏;此外,历史特征在预测时间点的重建面临数据缺失与时序泄漏风险,当前值不能直接用于训练,进一步加剧了数据准备的复杂性。这些挑战共同构成了构建高质量、可复现选址数据集的重大障碍。
常用场景
经典使用场景
该数据集为美国境内数据中心选址研究提供了标准化的实体解析与特征抽取框架,其核心使用场景聚焦于量化评估候选场址在多维约束下的可行性。研究者可依据其15项核心特征(涵盖电力、水冷、网络、土地及成本因子)与13条硬性过滤规则,对951个推断的独立站点进行系统化评分与分级。数据集内置的空间交叉验证协议与固定地理测试集,保障了模型评估的严谨性与可复现性,尤其适用于构建全国尺度的选址适宜性图谱与比较分析。
衍生相关工作
该数据集衍生的工作脉络涵盖方法论深化与应用拓展两大方向。其一,基于其实体解析与硬规则框架,后续研究可发展出更精细的时空动态选址模型,例如引入气候变迁与电网脱碳情景下的长期可行性推演;其二,其学习排序(learning-to-rank)扩展实验为多准则决策分析提供了新范式,可迁移至其他关键基础设施(如5G基站、储能电站)的布点研究;此外,与IM3与美国能源部项目的关联催生了开源数据中心的联合图谱,推动了跨学科(数据科学、环境工程与公共政策)的协作研究生态。
数据集最近研究
最新研究方向
该数据集聚焦于美国数据中心选址的多维约束评估,其最新研究前沿在于整合电力、水资源、网络覆盖、土地资源及成本等非补偿性硬性规则,通过实体解析与机器学习基准建模,构建一套可复现的候选站点评分与排序框架。当前方向紧密关联人工智能算力扩张与数据中心碳中和的宏观议题,尤其针对弗吉尼亚等超大规模集群区域,利用嵌套空间交叉验证与学习排序扩展,解决数据泄漏与时空动态性问题,并谨慎融合开放标签源(如FracTracker与DataCenterTracker)以追溯项目生命周期的事件脉络,从而为区域能源规划、基础设施韧性评估及可持续选址决策提供严谨的方法论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务