遇见数据集

london-cycles

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集记录了伦敦自行车租赁计划(Londons cycle hire scheme)中每个自行车停靠站的15分钟快照数据,数据自2022年4月29日起从TfL BikePoint API持续收集。数据集包含两个主要部分:观测数据(observations)和站点属性数据(stations)。观测数据以Hive分区格式存储(data/year=YYYY/month=MM/day=DD/part.csv),每一行对应一个站点在某个快照时刻的状态,包含查询时间、站点ID、可用自行车数、空闲车位数和总车位数。站点属性数据(stations.csv)是版本化的,每个站点可能有多个版本,记录其在不同时间区间内的属性(如名称、坐标、安装日期等),并支持与观测数据通过站点ID和时间区间进行连接。数据规模:每天约85-95个快照(历史平均),2025年后有所下降。该数据集适用于交通分析、城市规划、时间序列预测等任务。注意:数据存在一些已知问题,如部分坐标为零、夏令时导致的日期偏移、一天内多个位置变化以及快照间隔不固定等。

This dataset contains 15-minute snapshots of each bike docking station from Londons cycle hire scheme, continuously collected from the TfL BikePoint API since April 29, 2022. The dataset consists of two main parts: observations and station attributes. Observations are stored in Hive partition format (data/year=YYYY/month=MM/day=DD/part.csv), with each row representing the status of a station at a snapshot moment, including query time, station ID, number of available bikes, number of empty docks, and total number of docks. Station attributes (stations.csv) are versioned, with each station potentially having multiple versions recording its attributes (e.g., name, coordinates, installation date) over different time intervals, and can be joined with observations via station ID and time intervals. Data volume: approximately 85-95 snapshots per day (historical average), declining after 2025. This dataset is suitable for tasks such as traffic analysis, urban planning, and time series forecasting. Note: There are known issues, such as some coordinates being zero, date offsets due to daylight saving time, multiple location changes within a day, and irregular snapshot intervals.

创建时间:
2026-08-27
原始信息汇总

数据集概述:伦敦公共自行车网络使用数据

该数据集记录了伦敦公共自行车租赁系统(Santander Cycles)的实时使用情况,覆盖自 2022年4月29日 起,所有停靠站的 每15分钟 快照数据。数据来源于 TfL BikePoint API,采集代码托管于 GitHub(fferegrino/london-cycles-db)。

数据集配置

数据集包含两个配置:

  • observations(观测数据):存放于 data/年份=YYYY/月份=MM/日期=DD/part.csv 路径下,每行代表某个停靠站在某次快照中的状态。文件采用 Hive 分区结构,按日聚合。
  • stations(站点信息):即 stations.csv 文件,记录站点的版本化属性信息。

观测数据字段

字段名 类型 说明
query_time UTC 时间戳(秒级) API 查询时间,同一快照内所有行相同
place_id 字符串 站点唯一标识符(如 BikePoints_1),用于关联站点表
bikes 整数 当前可用自行车数量
empty_docks 整数 当前空闲停车桩数量
docks 整数 停车桩总数

观测数据不直接包含经纬度坐标——这些属于站点属性,保存在 stations.csv 中,以避免重复存储造成约40%的数据膨胀。

站点信息表字段

stations.csv 为版本化表,每行对应站点属性的一个版本,有效期由 [valid_from, valid_to) 界定。空 valid_to 表示该版本仍为当前有效版本。

字段名 说明
place_id 关联观测数据的站点标识
common_name 站点可读名称
lat, lon 该版本有效期内站点的经纬度
terminal_name TfL 终端标识符
installed, temporary TfL 状态标志
install_date, removal_date 安装/移除日期(UTC,格式 YYYY-MM-DD),可为空
valid_from, valid_to 该版本有效期的起止日期(UTC)

版本化原因:站点属性并非静态。2022–2026 年间,34 个站点发生过坐标变更(最大移动约 82 米),31 个站点被重命名,存续站点集合也有数十个的变化。使用当前状态表将无法正确关联历史观测数据。

数据关联方式

关联观测数据与站点信息时,需按 query_time 所在日期匹配站点版本的有效区间,SQL 示例:

sql SELECT f.query_time, f.place_id, s.common_name, s.lat, s.lon, f.bikes, f.empty_docks, f.docks FROM read_csv_auto(data/**/part.csv, hive_partitioning = true) AS f JOIN read_csv_auto(stations.csv) AS s ON s.place_id = f.place_id AND s.valid_from <= CAST(f.query_time AS DATE) AND (s.valid_to IS NULL OR CAST(f.query_time AS DATE) < s.valid_to)

若仅以 place_id 关联,约 100 个拥有多个版本的站点将产生重复行。

已知数据特征与注意事项

以下为上游 API 的已知数据特性,数据集未做静默修正:

  • 坐标 (0,0) 异常:TfL 曾为站 BikePoints_852(2022年)报告了零岛坐标,这类情况不会开启新版本,而是沿用最近一次已知的正确位置。
  • 安装/移除日期 1 小时偏移:TfL 以毫秒时间戳上报这些字段,在英国夏令时边界存在恰好 3,600,000 毫秒(1小时)的偏移。数据集已将其转换为 UTC 日期,以吸收偏移,但少数邻近午夜的值仍可能受影响。
  • 同一天两个位置:站点搬迁期间,TfL 可能在同一天报告新旧两个位置(如 BikePoints_244,2025-04-15,相距 299 米)。按天粒度的版本化会记录主要位置,因此少数观测会解析到稳定位置,而非过渡位置。
  • 时间快照不固定:虽然设计为每 15 分钟一次快照,但每日快照数量变化较大,不应假设固定节奏。采集依赖 GitHub Actions 的调度,延迟触发的任务不会补采。2022–2024 年平均每天约 85–95 个快照,2025 年约 65 个,2026 年初一度低至每天约 16 个,随后修复了采集任务。
  • 未记录 locked 状态:该字段反映的是实时停靠状态,变化频繁(历史上共 32,794 次变更,而坐标变更仅 34 次),因此未被纳入数据集中。

许可证

数据采用 CC-BY-SA 3.0 许可证,依据 TfL 条款提供。数据来源为 TfL Open Data,其中包含 OS data © Crown copyright and database rights 2016。

搜集汇总
数据集介绍
london-cycles 数据集图片
构建方式
伦敦共享单车网络使用数据集源自TfL BikePoint API,自2022年4月29日起,每15分钟采集一次所有停靠站的快照数据。采集流程依托GitHub Actions自动化运行,每次执行获取四个快照以缓解调度不确定性,每日夜间将当天分散的快照文件合并为单一的part.csv。数据集采用分区存储结构,按年、月、日组织,同时提供独立的stations.csv文件记录站点属性的版本化信息,每个版本以有效区间[valid_from, valid_to)界定,确保历史观测数据与站点动态变更可准确关联。
特点
该数据集的核心特色在于其精细的时间粒度与完整的版本化站点元数据。15分钟级的快照可支持高分辨率的时间序列分析,而站点属性的版本化机制则精准刻画了站点迁移、更名等动态演变,避免了静态表导致的关联误差。针对上游API的已知异常,如零坐标、夏令时偏移及日内双位置等,数据集以文档化方式保留原始状态,而非静默修正,保障了数据的可追溯性与科研严谨性。
使用方法
使用时需将观测数据与站点表按place_id及时间有效性进行连接,SQL示例中通过hive分区读取part.csv,并以query_time的日期字段匹配站点的有效区间,确保每个观测对应正确的站点属性。鉴于约百个站点存在多个版本,简单按place_id连接会引发行数膨胀,必须遵循版本区间条件。数据提供了详细的异常说明,便于用户理解数据缺口与字段限制,适用于城市交通流分析、共享单车需求预测及城市规划研究等场景。
背景与挑战
背景概述
在城市交通精细化治理与可持续出行倡导的时代背景下,共享单车系统作为绿色交通的组成部分,其运行状态的高频监测对于理解城市空间动态具有重要意义。伦敦自行车租赁网络使用数据集(london-cycles)由数据科学家Fernando F. Corrales等人依托伦敦交通局(TfL)的BikePoint API开发,自2022年4月29日起持续收集,每15分钟记录所有站点快照,形成大规模时间序列数据。该数据集的核心科学问题在于揭示共享单车系统在分钟级尺度上的时空演变规律,为城市流动性研究、交通需求预测及基础设施规划提供高分辨率实证基础。作为开放数据资源,它连接了交通工程、城市计算与公共政策等多学科领域,推动了城市数据科学的发展,并为全球类似城市共享单车系统提供了可复制的数据采集与处理范式。
当前挑战
该数据集面临的挑战体现在领域问题与构建过程两个维度。领域层面,共享单车系统固有的动态性使得站点级供需预测、异常事件检测(如极端天气或大型活动引发的流量波动)成为难题,同时多站点、长时间序列数据的高维特性对高效存储、查询及可视化提出技术瓶颈。构建过程中,首要挑战源于上游API不稳定性:GitHub Actions调度存在延迟导致每日快照数量波动(2025年日均约65次,早期低至16次),迫使采集策略从每小时触发调整为每小时四次;其次,站点属性随时间迁移(如坐标偏移、重命名)要求设计版本化表结构以维持数据可追溯性;此外,API返回的异常值(如坐标(0,0)、午夜时间偏移)需进行审慎清洗,而避免将瞬时状态(如‘locked’字段)混入静态属性表亦是数据治理的微妙之处。这些挑战不仅考验数据工程师的应变能力,也促使研究社区反思城市感知基础设施的可靠性与数据质量保障机制。
常用场景
经典使用场景
伦敦自行车租赁网络数据集以其高时间分辨率的站点级租还记录,成为城市交通动态分析与共享出行行为建模的基石。研究者常利用该数据揭示自行车流量在日内、周内及季节间的波动规律,结合气象与地理信息,构建时空预测模型以刻画需求峰值。其站点属性版本化设计尤为关键,允许纵向追踪站点更迁、更名及设施变动,为长期城市基础设施演变研究提供了坚实的数据支撑。该数据集亦是验证图神经网络、Transformer等先进时序架构在稀疏高维场景下性能的经典基准。
解决学术问题
该数据集有效解决了共享单车系统研究中长期存在的时空异质性与数据不完整问题。通过提供15分钟粒度的连续观测,它使研究者能够量化需求在小时尺度上的强非平稳性,并分离出天气、事件等外生因素的干扰效应。版本化的站点表消除了因站点搬迁导致的坐标漂移和数据错配,提升多源数据融合的准确性。基于此,学术工作得以深入探讨供需平衡的空桩率预测、动态调度策略优化,以及交通模式与城市功能区的耦合关系,显著推动了城市计算和可持续交通领域的方法论进步。
衍生相关工作
该数据集催生了诸多衍生研究方向与工作。一方面,它被用作训练和评估站点级租还需求预测模型的基准,比较线性回归、梯度提升树及深度学习方法的性能,形成了系列可复现的预测框架。另一方面,研究者基于其时间序列特性开发异常检测算法,识别设备故障或突发事件的异常模式。站点版本化信息启发了对共享单车网络动态性的研究,例如量化站点搬迁对使用率的影响。此外,该数据与城市POI、天气数据结合,衍生出城市功能区识别、骑行公平性分析等交叉学科成果,其开源模式也为构建类似城市数据基础设施提供了范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务