遇见数据集

freight-rail-data-pipeline

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

该数据集是货运铁路数据管道的快照,涵盖了美国铁路货运量、铁路服务指标以及海洋集装箱运价数据。数据来源包括美国农业部农业运输(USDA AgTransport)和Freightos FBX等公共API,遵循CC BY 4.0许可。数据集包含10个表格,总计约5147万行记录,总大小约1251.7 MB。具体表格包括:每周铁路交通量、货运指标、汽车承运人普查、铁路装载量、欧洲铁路货运、铁路安全事件、铁路服务指标、铁路运价、跨境货运和运单发货。该数据集适用于物流、供应链分析、铁路运输研究、货运经济学等任务。

This dataset is a snapshot of the freight rail data pipeline, covering U.S. rail freight volumes, rail service metrics, and ocean container freight rate data. Data sources include public APIs such as USDA AgTransport and Freightos FBX, licensed under CC BY 4.0. The dataset contains 10 tables with approximately 51.47 million rows and a total size of about 1251.7 MB. Specific tables include: weekly rail traffic, freight indicators, motor carrier census, rail carloadings, Eurostat rail freight, rail safety incidents, rail service metrics, rail tariff rates, transborder freight, and waybill shipments. This dataset is suitable for tasks such as logistics, supply chain analysis, rail transportation research, and freight economics.

创建时间:
2026-08-03
原始信息汇总

数据集概述:Freight Rail Data Pipeline — Snapshot

基本信息

  • 语言:英语(en)
  • 标签:货运、铁路、航运、物流、供应链、管线
  • 大小类别:小于 1MB(注:实际构建信息显示总大小为 1251.7 MB
  • 许可证:CC BY 4.0

数据内容

该数据集包含铁路车辆装载量、铁路服务指标和海运集装箱运费率数据,共由 10 个数据表组成,总行数为 51,468,850 行。

数据表详情

数据表 行数 描述
aar_weekly_traffic 52 美国铁路协会周度交通数据
freight_indicators 25,632 货运指标
motor_carrier_census 2,085,534 汽车承运人普查数据
rail_carloadings 199,286 铁路车辆装载量
rail_eurostat_freight 1,329 欧盟统计局铁路货运数据
rail_safety_incidents 476,074 铁路安全事件
rail_service_metrics 1,553,679 铁路服务指标
rail_tariff_rates 6,802 铁路运价费率
transborder_freight 27,015,354 跨境货运数据
waybill_shipments 20,105,108 运单发货数据

数据来源

数据来源于公共 API,具体包括:

  • USDA AgTransport(美国农业部农业交通相关接口)
  • Freightos FBX(货运价格指数数据)

使用方法

方法一:使用 Hugging Face datasets 库

python from datasets import load_dataset

ds = load_dataset("ZanderL1337/freight-rail-data-pipeline", trust_remote_code=True) df = ds["aar_weekly_traffic"].to_pandas()

方法二:直接读取 Parquet 文件

python import pandas as pd

df = pd.read_parquet("path/to/parquet/file.parquet")

构建信息

  • 生成日期:2026-08-14
  • 管线名称:freight-rail-data-pipeline(GitHub 地址:https://github.com/Zanderl1987/freight-rail-data-pipeline)
  • 数据表数量:10 个
  • 总行数:51,468,850
  • 总大小:1251.7 MB
搜集汇总
数据集介绍
freight-rail-data-pipeline 数据集图片
构建方式
该数据集源自勤勉构筑的数据管线,整合了美国铁路协会(AAR)周度交通量、铁路服务指标、海运集装箱运价等多维公开数据源。通过系统化采集与清洗,构建了涵盖11张数据表的全面资料库,包括铁路货运量、多式联运、公路承运人普查、欧洲铁路货运、安全事件记录、运价及跨境运输等关键字段。数据生成于2026年8月14日,总计包含逾5146万行记录,体积达1251.7 MB,充分展现了货运铁路领域的丰富数据生态。
使用方法
使用者可通过HuggingFace datasets库便捷加载,如使用load_dataset函数并指定trust_remote_code参数,即可将特定表如aar_weekly_traffic转换为Pandas DataFrame进行分析。同时,数据集提供Parquet文件格式,支持直接使用pandas.read_parquet对独立文件进行读取,适应不同开发环境。该设计简化了数据存取流程,便于快速集成至数据科学工作流,助力研究或工业应用中的量化分析与模型构建。
背景与挑战
背景概述
随着全球供应链的日益复杂化,货运铁路作为大宗物资运输的关键动脉,其数据的系统化整合与分析成为物流与供应链管理研究的前沿课题。2026年8月,由ZanderL1337主导的freight-rail-data-pipeline数据集正式发布,旨在构建一个涵盖铁路货运量、服务水平、安全事件及国际集装箱运费等多维度的开源数据管道。该数据集整合了来自美国农业部AgTransport与Freightos FBX等公共API的十余类数据表,总计超过5000万条记录,为研究者提供了前所未有的货运铁路全景视图,推动了运输经济学、物流优化与安全分析等领域的数据驱动研究,对行业决策与政策制定具有重要参考价值。
当前挑战
该数据集面临的挑战首先体现于领域问题的复杂性:货运铁路数据的异质性与多源性要求高效的数据融合与清洗,以统一不同源头的语义和时间粒度,而跨地域的运输规范差异更增加了数据可比性的难度。其次,构建过程中的挑战尤为显著:需处理海量实时API数据流的稳定采集与错误容错,应对数据模式随源站更新的演进问题,并确保数十亿级数据行(如transborder_freight的2700万行)的存储压缩与快速检索。此外,数据质量保障(如缺失值、异常值检测)及隐私合规(如安全事件与运单信息的脱敏)亦构成持续的技术与伦理双重考验,要求构建可扩展、可复现的自动化管道以维持数据集的时效性与完整性。
常用场景
经典使用场景
该数据集作为货运铁路领域综合性数据快照,汇聚了铁路周度交通量、货运指标、汽车承运商普查、铁路装载量、欧洲铁路货运、安全事件、服务指标、运价费率、跨境货运及运单运输等多元异构表格。其经典使用场景在于构建供应链与物流领域的多源数据融合基准,服务于货运需求预测、铁路运营效率评估与政策仿真等研究任务,为学术界提供了一站式标准化数据入口。
解决学术问题
该数据集系统性地整合了分散于美国农业部AgTransport与Freightos FBX等公共API的货运数据,有效解决了以往研究中数据获取碎片化、格式不一致、时间跨度不统一等痛点。其涵盖的运价、运量、安全与服务指标等多维信息,支撑了货运需求弹性分析、铁路安全风险因素识别、跨境贸易流模拟等学术探索,显著降低了数据清洗与整合成本,推动了实证研究的可复现性。
实际应用
在实际应用中,该数据集可直接赋能物流企业优化铁路运力配置与调度决策,协助货运代理基于历史运价趋势进行合同谈判与预算编制。政府交通规划部门可依托其中的跨境货运与安全事件数据,评估基础设施投资影响并制定安全监管策略。此外,供应链咨询公司可利用其构建行业基准指标,为客户提供竞争力对标与运营改进建议,实现从数据到商业洞察的转化。
数据集最近研究
最新研究方向
该数据集整合了美国铁路周度交通量、多式联运运量、铁路服务指标、海运集装箱运费及跨境货物流动等多维数据,为供应链韧性与物流效率研究提供了高时效性的数据基座。当前研究前沿聚焦于利用此类细粒度货运流数据构建数字孪生模型,以模拟全球供应链中断情景下的铁路网络响应机制;同时,结合机器学习方法对铁路事故率与运输服务可靠性进行预测性分析,推动铁路安全管理的智能转型。数据中囊括的宏观货运指标与微观运单记录,亦为探究贸易政策变动、港口拥堵对铁路货运结构的长短期影响提供了实证支撑,助力多式联运系统的优化调度与碳排放核算,对构建绿色、韧性的现代物流体系具有重要的理论与实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务