U.S. Data Center Siting Dataset
收藏资源简介:
一个可复现的数据集和建模提案,用于评估在电力、水资源、网络、土地和成本约束下的美国数据中心选址。
A reproducible dataset and modeling proposal for evaluating U.S. data center site selection under constraints including electricity, water, network, land, and cost.
- 研究状态:提案阶段
- 地理范围:覆盖美国50个州
- 数据快照时间:2026年8月27日
- 核心用途:评估美国数据中心选址,考虑电力、水资源、网络、土地和成本等约束条件
- 关键数据量:推断出951个独立站点,涉及45个州,核心模型特征15个,硬性可行性规则13条,开放结果标签基础3个,主基准实验4个,排序扩展2个
数据分布
- 弗吉尼亚州是最大的数据中心集群,由于邻近观察共享基础设施、市场、气候和监管条件,不适合随机划分训练集和测试集
- 站点类型分为三种互斥类别:明确多边形园区、未匹配的建筑和点
- 实体解析边界对总数影响显著,更宽的名称、运营商和距离阈值会合并更多记录并减少推断总数
核心特征模式
数据集保留15个可观测特征,分为五大类:
| 因子 | 代表性测量 |
|---|---|
| 电力 | IT负载、PUE、变电站距离、输电电压 |
| 水资源与冷却 | 水冷比例、市政服务区域距离 |
| 网络 | 对称1Gbps提供商数量、高速光纤距离 |
| 土地与建设 | 园区面积、连续可行面积、坡度、发达土地邻近度 |
| 成本与市场 | 土地成本、电价、税率、市场距离 |
可用性等级A表示清晰的国家级公开图层或可验证的项目字段,等级B表示需要本地记录、项目文档、地理空间处理或单位统一的可获取变量。缺失值保持缺失,不用主观权重替代。
硬性可行性门控
13条规则筛选机场、水体、坡度、塌陷区、洪水风险、公园墓地、基础设施距离、保护土地、交通通行权、军事区域和发达土地限制。失败的站点在回归、分类或排序前即被排除,即使其他模型输入有利也无法补偿。
结果标签策略
标签证据链:FracTracker项目表 → DataCenterTracker事件历史 → IM3运营站点交叉检查 → 官方决策证据 → 严格标签
positive_strict:有日期官方证据表明最终批准、许可发放、建设或运营negative_strict:有日期最终政府、规划、分区或许可拒绝,且后来未推翻- 已撤回、因其他原因取消、延迟、暂停和进行中的项目在首个基准中作为独立结果
仅预测时间t0前可观测的特征可进入训练,取消、暂停、新闻覆盖和决策后基础设施变更不能作为捷径预测器。
建模基准
采用两种架构,分别评估回归和序数分类两种监督形式,共4个实验,使用相同的嵌套空间交叉验证折叠和一个锁定地理测试集:
- 回归目标:预测连续推荐分数
y_score,越高越好 - 序数多分类目标:预测
y_grade ∈ {1,…,K},1级最佳,K在训练折叠内选择
候选模型包括机器学习(弹性网络、GAM、SVR、随机森林、Extra Trees、XGBoost、LightGBM、CatBoost、序数逻辑回归)和深度学习(MLP、TabNet、FT-Transformer;序数版本用CORAL或CORN损失)。
学习排序扩展比较融合排序器(R1)与因子级排序后融合(R2),主要指标为NDCG@K,辅助指标包括Top-K命中率、成对准确率、Spearman相关性和排序稳定性分析。
数据溯源
主要上游来源包括:IM3开源数据中心图集、CERF数据中心、IM3预测美国数据中心位置、FracTracker开放美国数据中心追踪器、追踪美国AI数据中心建设、FCC宽带数据收集、USGS公共供水服务区域、HIFLD/GeoPlatform、NLCD和Census TIGERweb。
局限性
- 站点计数依赖显式实体解析边界,需要抽样人工审查
- 基础设施距离不建立备用电力、水资源或网络容量
- 多个项目特定特征需要许可、公用事业意见或本地税收和地块记录
- 独立严格标签需官方确认,取消、暂停、撤回和待定非自动否定
- 历史特征需在t0重建,当前值可能导致时间泄漏
- 若从y_score离散化等级,切点不能提供独立验证目标
- 深度学习在独立标记样本大幅增加前不作为主要结果




