遇见数据集

Indonesian-running-photos

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

Fotoyu Album Archive 是一个从Fotoyu相册中归档的照片和视频集合数据集,主要作为基于Cloudflare的高性能CDN,用于提供静态媒体资源服务,同时也可用于图像/视频分类和机器学习模型训练。数据集包含从Fotoyu树状结构(用户管理的相册)中抓取的高分辨率照片和HLS流媒体视频,所有文件采用2字符前缀分片系统组织,以避免超过Hugging Face平台的目录文件数量限制。数据集结构按相册别名组织,包含图片文件和视频目录(内含HLS播放列表和分段文件)。数据采集通过专门的下载器工具完成,包括API连接、本地归档、分片和批量上传等步骤。数据集适用于计算机视觉分类任务和前端应用直接资源调用,但需注意其遵循CC BY-NC 4.0非商业许可,且包含的公开照片可能涉及个人隐私,使用时需尊重相关边界。

Fotoyu Album Archive is a dataset comprising archived photos and videos from Fotoyu albums, primarily serving as a Cloudflare-based high-performance CDN for static media resource delivery, and also applicable for image/video classification and machine learning model training. The dataset includes high-resolution photos and HLS streaming videos crawled from the Fotoyu tree structure (user-managed albums). All files are organized using a 2-character prefix sharding system to avoid exceeding directory file limits on the Hugging Face platform. The dataset structure is organized by {album-alias}, containing image files and video directories (including HLS playlists and segment files). Data collection is completed through a dedicated downloader tool, involving steps such as API connection, local archiving, sharding, and batch uploading. The dataset is suitable for computer vision classification tasks and direct resource invocation in front-end applications, but note that it follows the CC BY-NC 4.0 non-commercial license, and the included public photos may involve personal privacy, requiring respect for relevant boundaries during use.

创建时间:
2026-06-26
原始信息汇总

数据集概述

数据集名称:Fotoyu Album Archive
许可证:Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0)
任务类型:图像分类、视频分类
标签:摄影、存档、HLS视频、CDN
数据集规模:10,000 < 样本数 < 100,000


数据集描述

该数据集是从 Fotoyu 相册中归档的照片和视频集合,通过 potoyu-tree-downloader 工具抓取生成。旨在作为基于 Cloudflare 的高速 CDN 提供静态媒体资源,同时可用于图像/视频分类和机器学习模型训练。

  • 策划者:使用 potoyu-tree-downloader 的系统管理员
  • 共享者:管理员贡献者
  • 语言:英语、印尼语(用于相册标签/元数据)

数据来源

  • 存储库:https://github.com/Stalker-moment/potoyu-tree-downloader

用途

直接用途

  • 静态资源服务(CDN):主要用途是作为公共 CDN,前端应用可直接从仓库的 resolve/main/ 路径获取优化后的图片和视频流。
  • 分类与计算机视觉:可用于训练和评估自定义人类活动、事件及跑步摄影分类模型。

超出范围的使用

  • 未经原始照片所有者和创作者明确许可,不得用于商业广告。

数据集结构

采用 2字符前缀分片系统,以避免文件夹超过 Hugging Face 每目录 10,000 个文件的提交限制。

目录布局

dataset-root/ └── {album-alias}/ ├── {prefix}/ # 唯一 leafId 的最后2个字符 │ └── {leafId}.jpg # 原始图片文件或视频缩略图 │ └── videos/ └── {prefix}/ └── {leafId}/ ├── index.m3u8 # HLS 流播放列表 ├── segment0.ts # 视频流分片 ├── segment1.ts └── ...

  • {album-alias}:代表特定图库或相册的自定义字母数字名称。
  • {prefix}:唯一字母数字 leafId 的最后两个字符(例如,若 leafId...a7b9c2,则 prefixc2)。划分最多 3,844 个目录,确保每个目录仅包含数百个文件。
  • videos/{prefix}/{leafId}/:存放 HLS 流播放列表文件(.m3u8)和视频分片(.ts)。

数据集创建

策划理由

将数千张高分辨率图片和视频直接从单台 VPS 提供服务会导致高网络带宽成本和全球用户延迟。将资源同步到 Hugging Face 数据集可将媒体请求转移到 Hugging Face 的全球边缘缓存(Cloudflare),从而加快加载速度并降低带宽费用。

源数据

源数据来自 Fotoyu 用户策划的相册。

数据收集与处理

  1. 抓取:后端下载器使用共享授权令牌连接到 Fotoyu API 端点。
  2. 本地归档:下载并结构化媒体文件,保存到本地。解析视频播放列表并完全归档其分片文件(.ts)。
  3. 分片与上传@huggingface/hub 集成将待处理文件分组为每批 100 项,每 40 秒提交一次 Git 提交,以避免达到 Hugging Face 每小时 128 次提交的速率限制。

偏见、风险与限制

  • 速率限制:仓库提交上限为每小时 128 次,批量更新需保持节流。
  • 隐私:存档的公开照片可能包含个人身份信息,应尊重适当的隐私边界和许可证。
搜集汇总
数据集介绍
Indonesian-running-photos 数据集图片
构建方式
该数据集源自对Fotoyu相册的存档操作,通过名为potoyu-tree-downloader的应用程序,利用共享授权令牌连接Fotoyu API来抓取媒体文件。数据收集后,视频播放列表及分段文件被完整归档,并采用两字符前缀分片系统组织文件结构,确保每个目录不超出Hugging Face的文件数限制。上传过程借助@huggingface/hub集成,以每批100个文件、每40秒一次提交的节奏进行,以规避平台速率限制。
使用方法
使用该数据集时,可直接通过Hugging Face的resolve/main/路径获取优化后的图片与视频流,适用于前端应用的媒体加载。对于机器学习任务,可将图像和视频数据用于分类模型的训练与评估,特别是针对人类活动、事件及跑步摄影等场景。需注意,该数据集受CC BY-NC 4.0许可保护,禁止未经授权的商业广告用途。
背景与挑战
背景概述
Indonesian-running-photos数据集由系统管理员借助potoyu-tree-downloader工具于近期构建,旨在汇聚源自Fotoyu相册的跑步主题摄影与视频资料,并借助Hugging Face平台实现全球高速分发。该数据集核心研究问题聚焦于基于真实场景的人体运动图像与视频分类,为计算机视觉领域提供丰富的活动识别训练素材。通过将媒体资产托管至Hugging Face的云端边缘缓存,数据集有效降低了传统自建服务器的高昂带宽成本与延迟,对推动轻量化、高可用性运动数据集的发展具有示范意义。
当前挑战
数据集面临多重挑战。在领域问题层面,需应对复杂动态场景下的跑步姿态分类难题,包括光照变化、遮挡及多角度拍摄带来的识别鲁棒性需求。构建过程中,首先遭遇Hugging Face平台每小时128次提交的频率限制,迫使上传过程必须精细分组与节流;其次,单目录超过一万文件的存储上限要求引入双字符前缀分片机制,增加了数据组织复杂度。此外,公开存档中可能包含个人身份信息,如何在遵循CC-BY-NC-4.0许可的前提下兼顾隐私边界与数据可用性,亦是持续面临的伦理挑战。
常用场景
经典使用场景
Indonesian-running-photos数据集汇聚了大量源自Fotoyu相册的摄影与视频档案,其核心设计初衷在于为图像与视频分类任务提供高质量的训练素材。研究者可借助该数据集中的跑步主题照片,构建能够精准识别人类活动、运动姿态及赛事场景的深度学习模型。数据集内嵌的HLS视频流进一步拓展了其时序分析能力,使得基于动作序列的分类与行为识别研究得以开展。此外,该数据集通过分片存储机制优化了文件管理,适用于大规模分布式训练场景,成为运动视觉分析领域一座兼具规模与实用性的数据基石。
解决学术问题
在计算机视觉与多媒体分析领域,Indonesian-running-photos数据集有效缓解了针对特定运动主题(如跑步)的高质量标注数据匮乏之困。传统公开数据集多以通用场景或实验室环境为主,缺乏对真实世界跑步活动多样性的覆盖,而该数据集通过汇聚不同光线、视角和背景下的跑者图像与视频,为模型泛化能力提升提供了关键支撑。它解决了从静态图像到动态视频流跨模态分类的衔接难题,推动了迁移学习在细粒度动作识别中的理论探索。这一数据资源的开源,不仅促进了运动科学与人机交互等交叉学科的研究进展,更对构建更具鲁棒性的视觉理解系统产生了深远影响。
实际应用
除去学术研究,Indonesian-running-photos数据集在实际应用中展现出多重价值。其最初作为依托Hugging Face边缘缓存的高性能CDN服务,助力前端应用快速加载优化后的跑步主题图片与HLS视频流,显著降低全球用户的网络延迟与带宽消耗。基于该数据集训练的模型可部署于智能体育评测系统,自动分析跑者的步态、姿态乃至疲劳程度,为运动训练提供数据驱动反馈。在媒体资产管理行业,该数据集亦可用于自动化标签与内容归档,提升体育摄影作品的管理效率。此外,其在隐私合规前提下的开放共享模式,为同类垂直领域数据集的构建与发布树立了标杆。
数据集最近研究
最新研究方向
该数据集聚焦于印度尼西亚跑步摄影的视觉内容归档与智能分类,正推动计算机视觉在运动行为识别领域的前沿探索。研究者利用其HLS视频流与高分辨率图像构建的CDN架构,结合照片中的人物姿态与场景语义,开发能够精准捕捉跑步动作特征、人群活动模式及赛事氛围的多模态分类模型。这一研究方向与全球运动科学数字化趋势相呼应,尤其在非商业性公共赛事档案的自动化标注与检索中发挥关键作用。数据集的全球边缘缓存部署极大降低了媒体服务的延迟与带宽成本,为实时运动分析系统的规模化应用提供了基础设施保障,同时其CC BY-NC 4.0许可激励学术界在尊重隐私边界的前提下,探索体育影像数据的伦理化利用范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务