遇见数据集

US County Economics — Artifact Bundle

收藏
github2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

一个自包含的数据集包,涵盖约3,200个美国县,包含GDP、收入、税收、人口、迁移、行业部门构成和家庭标准化指标,所有数据已预先连接并标记到单个.duckdb文件中。数据源来自美国政府的公共领域数据,包括BEA、IRS和Census,构建为奖章架构(原始→策划→语义),最终生成多个语义表,如county_all_flags、county_hh等,用于LLM查询和分析。

A self-contained dataset package covering approximately 3,200 U.S. counties, which includes GDP, income, tax revenue, population, migration, industrial sector composition, and household standardized metrics. All data has been pre-joined and labeled into a single .duckdb file. The data sources are public-domain datasets from U.S. federal government agencies including BEA, IRS, and Census. Built on the Medallion Architecture (raw → curated → semantic), the package ultimately generates multiple semantic tables such as county_all_flags, county_hh, etc., for LLM-based querying and analysis.

创建时间:
2026-06-09
原始信息汇总

数据集概要

US County Economics — Artifact Bundle 是一个面向约3,200个美国县的综合性经济数据集,整合了GDP、收入、税收、人口、迁移、行业构成及家庭标准化指标,预连接并标注后打包为单一 .duckdb 文件。

数据来源与覆盖范围

  • BEA CAGDP2: 县级GDP与行业数据,2001–2024年,覆盖3,126个县。
  • BEA CAINC1: 个人收入、人口、人均收入,1969–2024年,覆盖3,148个县。
  • IRS Statistics of Income: 调整后总收入与工资数据,2015–2022年,覆盖3,203个县。
  • Census Population Estimates Program: 人口与迁移数据,2020–2024年,覆盖3,143个县。

数据架构

采用 medallion架构(raw → curated → semantic),主要语义表格包括:

  • semantic.county_all_flags: 96列宽表,每县每年一行,包含所有指标及55+布尔标志。
  • semantic.county_hh: 家庭标准化指标(如收入、工资、每报税单位GDP),便于城乡比较。
  • semantic.county_industry_flags: 行业份额及主导标志,基于BEA NAICS代码。
  • semantic.county_migration: 国内及国际迁移流量。

标志体系

布尔标志预先回答常见问题,分为三类:

  • NULL: 数据不可用(区分未知与否定)。
  • 相对标志: 基于排名(如年度内前四分位)。
  • 绝对标志: 基于结构阈值(如工资份额、迁移方向)。 示例标志:is_boomtown(繁荣城镇)、is_left_behind(落后地区)、is_energy_dominant(能源主导)、is_commuter_county(通勤县)、is_domestic_migration_magnet(国内迁移磁石)、is_investment_hh_county(投资家庭县)。

使用方式

  • LLM查询: 向LLM提供 .duckdb 文件及 BUNDLE.json 清单(含提示字段)。
  • 示例代码(Python): python import duckdb con = duckdb.connect("turbolapper.duckdb", read_only=True) con.execute(""" SELECT county_name, state_fips, ROUND(yoy_gdp_growth_pct, 1) AS gdp_growth, ROUND(yoy_pop_growth_pct, 2) AS pop_growth, dominant_sector FROM semantic.county_all_flags WHERE year = 2022 AND is_boomtown IS TRUE ORDER BY yoy_gdp_growth_pct DESC LIMIT 10 """).df()

文档与扩展

  • BUNDLE.json: 机器可读清单,含来源、表格、年份范围、LLM提示。
  • docs/SCHEMA_REFERENCE.md: 所有表格与列描述。
  • docs/GEO_CATALOG.md: 地理参考(FIPS代码、州表、CPI都市区)。
  • docs/TEST_QUESTIONS.md: 55个规范问题及参考SQL。
  • docs/KNOWN_UNKNOWNS.md: 已知缺失标志与数据源优先级(如Census SAIPE贫困率、USDA城乡连续代码、BLS失业率、BEA区域价格平价)。

构建与许可

  • 构建: 使用 turbolapper引擎uv run turbolapper ingest,约2-3 GB下载)。
  • 许可证: 构建代码为MIT;数据为公共领域(美国政府数据:BEA、IRS、Census Bureau)。
搜集汇总
数据集介绍
US County Economics — Artifact Bundle 数据集图片
构建方式
该数据集整合了美国经济分析局(BEA)、国税局(IRS)及人口普查局(Census Bureau)四大公开政府数据源,涵盖逾3,200个县的GDP、收入、税收、人口、迁移及产业结构等核心指标。采用Medallion架构,经过原始层、清洗层至语义层的逐级转换,最终形成包含96列宽表`semantic.county_all_flags`、家庭归一化指标表`semantic.county_hh`、行业主导标志表及迁移流量表等语义化数据产品,所有表格预先关联并整合至单一的DuckDB文件中。
特点
数据集以丰富的布尔标志体系为特色,包含55个以上预计算标志如`is_boomtown`、`is_left_behind`等,每个标志根据数据可用性、年度分位数或结构性阈值严格定义,区分未知与否定情形。家庭归一化指标消除了城乡人口密度差异,使跨区域家庭层面决策可比。元数据文件`BUNDLE.json`提供机器可读的清单,便于大型语言模型自动解析数据源、表结构及年份范围,极大提升了数据可发现性与查询效率。
使用方法
用户可直接将.duckdb文件与BUNDLE.json清单指向任何大型语言模型,利用`llm_prompt_hint`字段自动获取查询上下文。通过Python中的DuckDB连接库,以只读模式接入数据库,使用标准SQL语言执行复杂分析,例如筛选2022年十大经济繁荣县并获取其GDP增长率、人口增长及主导产业信息。完整模式描述参考`docs/SCHEMA_REFERENCE.md`,同时提供55道典例问题与参考SQL语句助力快速上手。
背景与挑战
背景概述
美国县级经济数据集(US County Economics — Artifact Bundle)由Adviser Labs团队于2024年构建,整合了美国经济分析局、国税局及人口普查局的公开数据,覆盖约3200个县,时间跨度从1969年至2024年。该数据集以单一DuckDB文件形式提供,包含GDP、收入、税收、人口、移民及产业构成等96维指标,并通过旗帜标识(如boomtown、left-behind)预解答频率最高的查询问题。其核心研究问题在于为大型语言模型提供结构化经济知识图谱,降低地理经济分析的门槛,推动LLM在区域经济决策中的可靠应用。作为首个面向LLM优化的县级经济数据集,它填补了宏观经济数据与生成式AI之间的鸿沟,对经济政策模拟、区域不平等研究及数据密集型社会科学研究具有重要影响力。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,县级经济数据长期被分散于不同政府机构,缺乏统一语义层,导致LLM难以直接进行跨源推理;同时,小县数据稀疏性使统计误差与缺失值处理成为关键难题,例如人口不足千人的县GDP波动极大。构建过程中,四大原始数据源的时间跨度与粒度不一(如BEA数据自1969年起,IRS数据仅2015-2022年),需设计复杂的对齐策略;此外,55个布尔旗帜的评判标准需兼顾相对排名与绝对阈值,避免引入主观偏差,而南北卡罗来纳州等地的县界调整进一步增加了地理一致性维护的复杂度。
常用场景
经典使用场景
在美国区域经济研究中,US County Economics — Artifact Bundle 数据集为学者提供了一个横跨数十年、覆盖约3200个县的统一经济数据生态。其最经典的使用场景在于借助预计算的经济增长、人口流动与产业主导力等布尔标志,快速识别并量化诸如“繁荣城镇”或“落后地区”等具有典型特征的地理单元。通过单一查询便可获取县域GDP增长、人口变化及主导产业的联动指标,从而支持跨时间与跨区域的比较分析,极大地简化了传统上需要从多个分散公共数据源拼接信息才能完成的复杂研究任务。
实际应用
在实际应用层面,US County Economics 数据集为政策制定者、经济发展机构及企业选址分析提供了精准决策辅助。例如,地方政府可利用其中关于县域内迁与外迁的迁移流数据,评估人才吸引力并制定针对性的社区振兴策略。商业分析团队则可借助家庭归一化指标,在密度差异悬殊的城乡县之间进行购买力或薪资水平的横向比较,从而识别具备投资潜力的新兴市场。此外,住房、零售与能源等行业能够基于产业链占比旗帜,定位那些在特定工业领域具有支配地位的县域,从而优化供应链布局与资源投放,使数据驱动的地方经济规划变得切实可行。
衍生相关工作
该数据集衍生的相关工作主要体现在预计算标志体系与LLM驱动的交互式分析范式上。基于“旗哲学”构建的55余项布尔标志,如is_boomtown与is_left_behind,催生了一系列关于县域经济分类与动态监测的实证研究,使得学者无需从零搭建数据管道即可复现或扩展分析。同时,数据集中嵌入的LLM提示字段与测试问题集,为自然语言交互式的经济数据分析开辟了新方向,推动了将大型语言模型应用于结构化公共数据查询的工具链发展。这种模式有望被其他区域或主题的数据集借鉴,形成一套标准化、可用于自动化分析的公共数据生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务