ca-sco-properties
收藏资源简介:
本数据集包含美国加利福尼亚州审计长办公室的无人认领财产记录。数据按财产所有者姓氏的首字母进行分桶,从字母 a 到 z 共分为 26 个分片,另有一个 other 分片用于处理姓氏首字母非标准字母的情况,总计 27 个独立的数据分片。这种组织结构旨在确保每个分片的数据量保持在 Hugging Face 平台的 5 GB 过滤器-索引大小限制以内。数据文件以 Parquet 格式存储。数据集通过自动化流程(GitHub Actions)每周更新,以反映最新的无人认领财产信息。该数据集适用于与政府公开数据、财产追踪、数据分析或公共记录研究相关的任务。
This dataset contains unclaimed property records from the California State Auditor's Office. The data is bucketed by the first letter of property owners' surnames, split into 26 shards ranging from "A" to "Z", plus an additional "other" shard for cases where the first letter of a surname is non-standard, totaling 27 independent data shards. This structure is designed to ensure that the data size of each shard stays within the 5 GB filter-index size limit of the Hugging Face platform. All data files are stored in Parquet format. The dataset is updated weekly via an automated workflow (GitHub Actions) to reflect the latest unclaimed property information. This dataset is applicable to tasks related to government open data, property tracking, data analysis, or public records research.
数据集概述
- 数据集名称:CA SCO Unclaimed Property
- 数据集来源:California State Controllers Office(加州主计长办公室)
- 数据内容:无人认领财产记录(unclaimed property records)
数据组织
数据集按物主姓氏首字母划分为多个子集(split),共27个split,分别对应字母a到z以及other(其他)。每个split的数据存储在独立的Parquet文件中:
- a到z:每个字母对应一个split
- other:包含其他情况的分片
存储文件模式示例:
- a-split:
data/a-*.parquet - b-split:
data/b-*.parquet - ……
- z-split:
data/z-*.parquet - other-split:
data/other-*.parquet
数据更新
- 更新频率:每周更新一次(Weekly)
- 更新方式:通过GitHub Actions自动执行
技术说明
- 数据格式:Parquet
- 设计目的:控制每个split的文件大小在Hugging Face的5 GB过滤索引限制以下




