遇见数据集

t22000t/bike-sharing-tabular

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个即用型的UCI自行车共享数据集(小时粒度,17,379行×17列),附带了来自8架构表格建模管道的基准指标,用于直接比较。数据集由Fanaee-T和Gama(2014年)收集和发布,包含从2011年1月到2012年12月的小时观测数据。目标变量是每小时自行车租赁数量cnt(范围1-977),属于计数数据,建议使用泊松分布。特征包括7个连续特征(如温度、湿度、风速、时间特征)和5个分类特征(如季节、天气、星期几、假日、工作日)。数据集中没有缺失值,且不包含个人敏感信息,每个行是华盛顿特区Capital Bikeshare系统每小时聚合的自行车租赁计数。

许可证:CC BY 4.0 易读名称:每小时自行车共享需求(泊松分布(Poisson)版) 规模类别: - 10K < n < 100K 语言: - 英语 任务类别: - 表格回归(tabular-regression) 标签: - 表格数据(tabular) - 回归(regression) - 泊松分布(Poisson) - 计数数据(count-data) - 时间序列(time-series) - 基准测试(benchmark) - UCI 配置项: - 配置名称:default 数据文件:hour.csv # 每小时自行车共享需求(泊松分布(Poisson)版) 这是**UCI机器学习仓库(UCI ML Repository)自行车共享数据集**的小时级粒度版本(17,379行 × 17列),可直接使用,附带**8种架构的表格建模流水线基线指标**,便于直接进行性能对比。 原始数据由**Fanaee-T与Gama(2014)** 收集并发布。来源:[UCI机器学习仓库(UCI ML Repository)ID 275](https://archive.ics.uci.edu/dataset/275/bike+sharing+dataset)。 ## 概览 | 字段 | 取值 | |---|---| | 行数 | 17,379条小时级观测数据 | | 时间范围 | 2011年1月 — 2012年12月 | | 列数 | 17列(16个特征 + 1个目标变量) | | 目标变量 | `cnt`(小时级自行车租赁总数量) | | 目标变量取值范围 | 1 — 977 | | 目标变量均值/中位数 | 189 / 142 | | 分布族 | **泊松分布(Poisson)**(计数数据) | | 连续特征 | 7项(温度、湿度、风速、时间特征等) | | 分类特征 | 5项(季节、天气、星期几、节假日、工作日) | | 缺失值 | 无 | ## 推荐分布族 `cnt`为非负计数变量,因此**带对数连接函数的泊松分布(Poisson)族**是自然选择。[表格数据建模流水线](https://github.com/timothy22000/tabular_data_modelling_pipeline) 已内置现成配置:[`configs/example_bike_sharing.py`](https://github.com/timothy22000/tabular_data_modelling_pipeline/blob/master/configs/example_bike_sharing.py)。 ## 使用方法 ### 方式1:通过Hugging Face Datasets库加载 python from datasets import load_dataset ds = load_dataset("t22000t/bike-sharing-tabular", split="train") print(ds[0]) ### 方式2:使用纯Pandas加载 python import pandas as pd df = pd.read_csv("hf://datasets/t22000t/bike-sharing-tabular/hour.csv") print(df.shape, df["cnt"].describe()) ### 方式3:通过配套建模流水线使用 bash git clone https://github.com/timothy22000/tabular_data_modelling_pipeline cd tabular_data_modelling_pipeline pip install -e ".[all]" python scripts/download_data.py --dataset bike_sharing python train.py --config configs/example_bike_sharing.py --input data/bike_sharing.csv ## 特征字典 | 特征名称 | 类型 | 描述 | |---|---|---| | `instant` | 整数 | 记录ID(训练前需丢弃) | | `dteday` | 日期 | 日期字符串(需丢弃,改用`yr`/`mnth`) | | `season` | 分类 | 1=春季,2=夏季,3=秋季,4=冬季 | | `yr` | 整数 | 0=2011年,1=2012年 | | `mnth` | 整数 | 1-12(月份) | | `hr` | 整数 | 一天中的小时(0-23) | | `holiday` | 分类 | 0/1(是否为节假日) | | `weekday` | 分类 | 0=周日 … 6=周六 | | `workingday` | 分类 | 1=工作日,0=非工作日 | | `weathersit` | 分类 | 1=晴朗,2=薄雾,3=小雨/小雪,4=强降水 | | `temp` | 浮点数 | 归一化摄氏温度(除以41) | | `atemp` | 浮点数 | 归一化体感温度(除以50) | | `hum` | 浮点数 | 归一化湿度(除以100) | | `windspeed` | 浮点数 | 归一化风速(除以67) | | `casual` | 整数 | **数据泄露特征** - 非注册用户租赁量(需从特征集中排除) | | `registered` | 整数 | **数据泄露特征** - 注册用户租赁量(需从特征集中排除) | | `cnt` | 整数 | **目标变量** - 总租赁量(`casual + registered`) | `casual`与`registered`的和即为`cnt`,需从特征集中移除,内置配置已自动完成该步骤。 ## 基线指标(8架构流水线) _基线指标将在模型仓库[`t22000t/bike-sharing-tabular-models`](https://huggingface.co/t22000t/bike-sharing-tabular-models)上线后补充。_ ## 数据集划分 本数据集为单个CSV文件,包含2011年1月至2012年12月的17,379条小时级数据。建模流水线默认采用`seed=42`的确定性80/20随机划分。若需更贴合实际的时间序列划分,请将`DatasetConfig.split_col`设置为自行构建的列(例如“2012-09之前/之后”)。 ## 个人与敏感信息 无敏感信息。每条记录均为美国华盛顿特区Capital Bikeshare系统的聚合小时级自行车租赁计数,不包含任何骑手个体数据。 ## 许可证与署名 **CC BY 4.0**。原始发表文献: > Fanaee-T, Hadi, and Gama, Joao. _Event labeling combining ensemble detectors and background knowledge._ Progress in Artificial Intelligence (2014): pp. 1-15, Springer Berlin Heidelberg. UCI机器学习仓库(UCI ML Repository)链接:https://archive.ics.uci.edu/dataset/275/bike+sharing+dataset ## 引用格式 bibtex @article{fanaee2014event, title = {Event labeling combining ensemble detectors and background knowledge}, author = {Fanaee-T, Hadi and Gama, João}, journal = {Progress in Artificial Intelligence}, pages = {1--15}, year = {2014}, publisher = {Springer Berlin Heidelberg} } @software{tabular_data_modelling_pipeline, author = {Mun, Timothy}, title = {tabular-data-modelling-pipeline}, url = {https://github.com/timothy22000/tabular_data_modelling_pipeline}, year = {2026} } ## 相关资源 - 🤖 [t22000t/bike-sharing-tabular-models](https://huggingface.co/t22000t/bike-sharing-tabular-models) - 本数据集上预训练的模型 - 📂 [t22000t/house-prices-tabular](https://huggingface.co/datasets/t22000t/house-prices-tabular) - 配套数据集(伽马分布族) - 📦 [tabular-data-modelling-pipeline](https://github.com/timothy22000/tabular_data_modelling_pipeline) - 底层建模流水线

提供机构:
t22000t
搜集汇总
数据集介绍
t22000t/bike-sharing-tabular 数据集图片
构建方式
该数据集源自Fanaee-T与Gama于2014年发布的UCI Bike Sharing Dataset,专注于华盛顿Capital Bikeshare系统每小时自行车租赁量的计数数据。其构建方式基于原始数据集的每小时粒度整理,共包含17,379行观测记录,时间跨度覆盖2011年1月至2012年12月。数据集由17个字段构成,其中涵盖7个连续型特征(如温度、湿度、风速)、5个类别型特征(如季节、天气、工作日标识)以及目标变量cnt(每小时租赁总数)。值得注意的是,casual和registered两个字段因直接构成目标值的组成部分而被标记为泄漏特征,需在建模时排除。数据集以单一CSV文件hour.csv形式存储,同时配套了基于8种架构的表格建模流程基线指标,便于研究者进行直接性能对比。
特点
该数据集的核心特点在于其计数数据的泊松分布属性,目标变量cnt取值范围为1至977,均值与中位数分别为189和142,呈现典型的右偏分布特征,非常适合采用对数连接的泊松族进行建模。数据集无任何缺失值,且所有连续特征均经过归一化处理,例如温度除以41、湿度除以100等,确保了数值范围的统一性。此外,数据集中时间特征丰富,包含年份、月份、小时、星期几及节假日标识,为时间序列分析与季节性模式挖掘提供了充分支撑。数据集还额外提供了基线指标,涵盖8种不同神经网络架构在泊松损失下的表现,可作为模型性能的参考基准。
使用方法
该数据集的使用方式灵活多样,支持通过HuggingFace Datasets库直接加载,调用`load_dataset('t22000t/bike-sharing-tabular', split='train')`即可获取完整数据。亦可通过Pandas读取远程CSV文件,使用`pd.read_csv('hf://datasets/t22000t/bike-sharing-tabular/hour.csv')`实现快速导入。对于追求标准化建模流程的用户,可借助配套的tabular-data-modelling-pipeline工具,通过克隆仓库并执行预设配置脚本自动完成数据下载与模型训练。该流水线默认执行80/20随机划分,并内置泄漏特征剔除逻辑;若需时间序列感知的划分,用户可自行构造分割列以模拟真实预测场景。
背景与挑战
背景概述
共享单车系统作为城市智慧交通的重要组成部分,其需求预测对资源配置与运营效率具有关键意义。Bike Sharing Demand - Hourly 数据集由 Fanaee-T 与 Gama 于 2014 年创建,源自 UCI 机器学习库,收录了美国华盛顿特区 Capital Bikeshare 系统 2011 年 1 月至 2012 年 12 月间共计 17,379 条逐小时租赁记录。该数据集聚焦于利用气象、时间等外部特征预测单车瞬时租赁数量,填补了细粒度计数数据回归领域的标准化基准空白。凭借其清晰的特征结构与泊松分布特性,该数据集已成为评估表格数据模型性能的重要标杆,在事件检测、时序建模与智能交通系统研究中具有广泛影响力。
当前挑战
该数据集面临的核心挑战来自三个方面。首先,目标变量‘cnt’为泊松分布的非负离散计数,需采用对数链接函数建模,且数据存在随时间波动的周期性模式,对模型捕捉时间依赖能力提出高要求。其次,特征中存在‘casual’与‘registered’两个与目标变量直接线性相关的泄露变量,必须严格剔除以防信息污染,这对数据预处理流程的规范性构成考验。最后,原始数据仅提供单一时间序列,缺乏官方划分的训练验证集,研究者若按随机拆分可能破坏时序因果结构,在实际应用中需自行构造时间感知的数据分割策略,以提升模型泛化能力。
常用场景
经典使用场景
Bike Sharing Demand 数据集(小时粒度)是时序计数回归任务的经典基准,广泛应用于预测共享单车系统每小时的租赁需求。研究者利用其17,379条记录、16个特征(含温度、湿度、风速等连续变量以及季节、天气、工作日等类别变量)与泊松分布特性的目标变量cnt,构建并评估各类回归模型。该数据集特别适合检验模型对非负整数计数数据的拟合能力,常被用于对比广义线性模型、梯度提升树、神经网络等不同架构在计数预测上的表现。
实际应用
在实际应用中,该数据集支撑了共享单车的动态调度与补货系统优化、城市交通流量监控以及智能出行平台的资源分配。运营商可基于历史租赁模式预测高峰时段与低需求区域的运力缺口,从而减少车辆闲置或供不应求的情况。此外,数据集也被用于开发面向智慧城市的数据驱动决策工具,如实时需求预警与租车点容量规划,帮助降低运营成本并提升用户体验。
衍生相关工作
该数据集衍生了多项经典工作,包括Fanaee-T & Gama(2014)提出的结合集成检测器与背景知识的事件标注框架,以及基于该数据集的泊松回归、贝叶斯推断、时间序列分解等方法论研究。后续工作还扩展出多架构表格模型基准测试(如tabular-data-modelling-pipeline),并催生了配套的预训练模型库(bike-sharing-tabular-models),促进了同系列数据集(如house-prices-tabular)的构建,形成了涵盖不同分布族的数据集体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务