遇见数据集

SF-LIFE

收藏
arXiv2026-05-30 更新2026-06-05 收录
官方服务:

资源简介:

SF-LIFE是由多个研究机构联合创建的大规模模拟移动数据集,旨在为交通、移动性和机器学习研究提供无噪声、完整的多模态轨迹数据。该数据集包含3万亿条位置记录,模拟了50万个智能体在70天内的1Hz频率移动轨迹,数据融合了基于智能体的人类生活模式仿真产生的日常议程,并利用旧金山湾区9个县40多家交通机构的OpenStreetMap和GTFS数据生成详细运动轨迹,覆盖公交、铁路、自行车、汽车和步行等多种交通模式。数据集通过基于马斯洛需求层次理论的智能体行为框架生成,结合人口普查数据和真实交通基础设施,模拟了智能体的强制性活动与需求驱动活动。其核心应用领域包括交通优化、人类移动性分析、城市计算和空间数据分析,旨在克服真实世界追踪数据中的隐私、噪声和完整性限制,为算法开发和模型基准测试提供高质量的合成数据资源。

SF-LIFE is a large-scale simulated mobility dataset jointly created by multiple research institutions, aiming to provide noise-free, complete multi-modal trajectory data for transportation, mobility and machine learning research. This dataset contains 3 trillion location records, simulating 1Hz-frequency movement trajectories of 500,000 agents over 70 days. The data integrates daily agendas generated by agent-based human lifestyle pattern simulations, and generates detailed movement trajectories using OpenStreetMap and GTFS data from over 40 transportation agencies across 9 counties in the San Francisco Bay Area, covering multiple transportation modes including bus, railway, bicycle, car and walking. The dataset is generated through an agent behavior framework based on Maslow's hierarchy of needs, combining census data and real transportation infrastructure to simulate agents' mandatory activities and demand-driven activities. Its core application fields include transportation optimization, human mobility analysis, urban computing and spatial data analysis. It aims to overcome the privacy, noise and integrity limitations of real-world tracking data, providing high-quality synthetic data resources for algorithm development and model benchmarking.

创建时间:
2026-05-30
搜集汇总
数据集介绍
SF-LIFE 数据集图片
构建方式
SF-LIFE数据集的构建基于智能体建模与多模式路由的协同框架。首先,利用美国人口普查数据与LODES通勤数据库,生成包含50万合成智能体的虚拟人口,并赋予其年龄、性别、职业及车辆拥有等属性。随后,依据马斯洛需求层次理论,智能体在日常活动中受食物、社交、差事等动态需求驱动,结合工作或上学等强制性活动,生成个性化的每日日程。这些日程被输入至Valhalla多模式路由引擎,结合旧金山湾区OpenStreetMap路网与超过40家公交机构的GTFS数据,模拟智能体在步行、自行车、汽车、公交及轨道等交通方式下的1Hz高频轨迹,最终产出为期70天的完整、无噪声轨迹数据集。
特点
该数据集的核心特点在于其前所未有的规模与精细度。它包含超过3万亿个位置记录,覆盖旧金山湾区9个县、约18130平方公里的区域,集成逾1000条公交线路与10000个站点。所有轨迹均无GPS信号丢失或设备故障,且基于真实交通基础设施生成,保证了多模态移动的逼真性。此外,数据集提供了丰富的语义标注,包括智能体活动类型(如工作、就餐、娱乐)、交通模式标签、人口统计信息及建筑功能分类,为因果关系分析(如为何访问某地)与行为模式挖掘提供了独特支撑。其伦理合规性通过合成数据避免了隐私问题,同时保持了统计有效性。
使用方法
使用者可通过Hugging Face仓库获取数据集,其存储结构按智能体数量(15至50万)与时间采样频率(1秒至60分钟)提供多种版本,以适应不同计算资源与实验需求。数据以Parquet格式组织,分为按智能体分文件的布局与按桶分组的大规模布局,并附带智能体-桶映射文件。用户可加载轨迹表(含时间戳、坐标与模式码)进行移动预测或异常检测,也可结合日程表与人口统计表进行活动-出行链分析或流量建模。此外,配套的OSM路网文件支持空间网络分析,而GTFS数据可从511 SF Bay门户独立获取以扩展研究。
背景与挑战
背景概述
城市交通研究与人类流动模式分析高度依赖于大规模、高保真的移动数据集。然而,现有真实世界轨迹数据因隐私限制、信号丢失与模态单一而存在显著缺陷。为弥合这一鸿沟,SF-LIFE数据集由多所美国高校与机构于2026年协同发布。该数据集基于旧金山湾区的OpenStreetMap路网与包含40余家交通机构的GTFS系统,利用基于人类需求的智能体模拟与Valhalla多模式路由引擎,生成了50万合成个体在70天内、采样频率达1Hz、总计逾3万亿条记录的高精度轨迹。其核心研究问题在于建立一个兼具统计真实性与隐私伦理性的开源基准,以驱动交通优化、城市计算与机器学习领域的算法评测与模型训练。
当前挑战
该数据集面临的核心挑战涵盖领域问题与构建过程两个层面。在领域层面,现有真实轨迹数据集普遍受限于采样稀疏、噪声干扰、模式覆盖不全及隐私法规约束,难以支撑大规模多模态出行行为分析与智能交通系统优化。构建过程中,挑战集中于多源异构数据的深度融合,例如将OSM道路网、GTFS时刻表与人口普查统计数据关联为统一模拟环境;其次,50万智能体需在动态社会网络与需求驱动行为框架下协同运算,对计算架构的可扩展性提出严苛要求;最后,将行为议程经由Valhalla引擎转化为每秒级别的运动学轨迹,涉及跨模态路径规划与大规模并行仿真的高精度衔接。
常用场景
经典使用场景
在交通与城市计算领域,SF-LIFE数据集为大规模多模态轨迹分析提供了理想实验场。研究者可利用其涵盖500,000个智能体、持续70天、采样频率达1Hz的完整轨迹,深入剖析旧金山湾区复杂的出行模式。该数据集整合了来自九个县超过40家公交机构的GTFS数据,支持公交、铁路、自行车、私家车与步行等多种交通方式的联合分析,特别适合用于验证轨迹聚类、路径挖掘、活动识别等经典算法,以及评估模型在极高数据密度下的鲁棒性与扩展能力。
实际应用
在实际应用层面,SF-LIFE为城市交通规划、公交网络优化与智慧出行服务提供了坚实的仿真基础。规划部门可利用该数据集模拟不同政策场景下居民出行分布的变化,评估新线路开通或运营调整对交通系统整体负荷的影响。智能导航服务商可借助其中标注清晰的多模式出行链,训练更精准的出行时间预测模型与动态路径推荐算法。此外,紧急响应机构亦能基于该数据模拟灾害疏散场景下的流量演化,为应急预案设计提供量化依据。
衍生相关工作
SF-LIFE的发布催生了一系列重要的衍生研究工作。在算法评测方面,已有学者基于该数据集构建了轨迹预测与异常检测的标准化基准平台,推动了时空深度学习模型的公平比较。在理论建模层面,研究者借鉴其需求驱动行为框架,拓展了多智能体交通仿真系统的底层行为规则库。此外,围绕该数据还发展了高效的轨迹压缩与索引技术,以及针对多模态出行数据的可视化分析工具,这些工作共同构成了一个以SF-LIFE为核心的研究生态,持续推动城市计算领域的繁荣发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务