遇见数据集

xiaoluo-openp2p-action15s-gallery

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Action Atlas 是一个用于视频分类任务的游戏交互片段图库数据集。该数据集包含最多7个不同游戏、每个游戏最多50个真实游戏片段(共约350个片段),这些片段来自 xiaoluo11 和 elefantai/p2p-full-data(仅GTA5)两个来源。每个片段时长为15秒,分辨率为300帧(20FPS),使用H.264编码,不含音频。数据集保留了原始输入(如可读文本),对于无法直接读取的输入,通过视觉内容推断动作。在构建过程中,通过每秒采样2帧的方式筛选片段,以确保包含可见的交互结果、简单HUD显示且无字幕干扰;然而这种采样方式可能遗漏瞬时文本信息,并且不是逐帧的人工认证。数据集包含 data.json(可用图库媒体)和 capacity_report.json(实际输出、基于时长的上限和每游戏条件预测)。注意:优先选择并非随机,因此估计的产出可能偏乐观。数据集规模小于1000个样本。

Action Atlas is a dataset of game interaction clips for video classification tasks. It contains up to 7 different games, with at most 50 real game clips per game (approximately 350 clips in total), sourced from xiaoluo11 and elefantai/p2p-full-data (only GTA5). Each clip is 15 seconds long, at a resolution of 300 frames (20 FPS), encoded with H.264, and without audio. The dataset retains original inputs (e.g., readable text) and infers actions from visual content when inputs are not directly readable. During construction, clips are selected by sampling 2 frames per second to ensure visible interaction results, simple HUD display, and no subtitle interference; however, this sampling method may miss transient text information and is not frame-by-frame human certification. The dataset includes data.json (available gallery media) and capacity_report.json (actual output, duration-based upper limit, and per-game condition predictions). Note: The selection is not random, so estimated output may be optimistic. The dataset size is less than 1000 samples.

创建时间:
2026-09-10
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Action Atlas - xiaoluo and OpenP2P GTA5 gallery
  • 数据集地址:https://huggingface.co/datasets/mikusama99/xiaoluo-openp2p-action15s-gallery
  • 任务类别:video-classification(视频分类)
  • 数据规模:n<1K(少于1000条)

数据集描述

Action Atlas 是一个不断增长的回顾性画廊,涵盖七款游戏,每款游戏最多包含50个真实片段。

提取目标为本地10,000个片段,本仓库仅保存画廊子集。

数据来源

  • https://huggingface.co/xiaoluo11
  • https://huggingface.co/datasets/elefantai/p2p-full-data(仅限GTA5)

来源仓库的修订版本和输入哈希均保留在片段元数据中。来源和游戏权利归各自所有者所有,需查阅来源条款。

视频规格

  • 时长:15秒
  • 帧数:300帧
  • 帧率:20 FPS
  • 编码格式:H.264
  • 音频:无音频

数据处理说明

  • 可读的原始输入会被保留;否则动作从视觉中推断。
  • 筛选过程以每秒2帧的频率采样,检测可见的交互结果、简单HUD以及无字幕。
  • 采样可能遗漏短暂文本,并非逐帧人工认证。

文件说明

  • data.json:仅包含可用的画廊媒体。
  • capacity_report.json:区分实际输出、基于时长的上限以及条件下的各游戏预测。
  • 优先选择并非随机,因此估计产出可能偏乐观。

查看器

https://huggingface.co/spaces/mikusama99/xiaoluo-openp2p-action15s

搜集汇总
数据集介绍
xiaoluo-openp2p-action15s-gallery 数据集图片
构建方式
该数据集构建于跨游戏交互行为分析的研究背景之下,聚焦于从《侠盗猎车手5》等七款游戏中提取可复用的动作片段。构建者以十五秒为固定窗口,从来源仓库中筛选出具备明确交互结果、简洁界面且无字幕干扰的片段,每个游戏至多保留五十段真实剪辑。原始视频以二十帧每秒、三百帧、H.264编码且无音轨的形式存储,并保留可读的原始输入;当输入不可读时,则依据视觉线索推断动作类别。筛选过程采用每秒两帧的抽样策略,以识别可见的交互结果,并记录来源仓库修订版本与输入哈希值,确保元数据的可追溯性。
特点
该数据集的核心特征在于其跨游戏、短时长与动作导向的采样设计。七款游戏各提供至多五十段十五秒无音频片段,每段恰好三百帧,分辨率与编码格式统一,便于批量处理与比较分析。数据规模虽不足一千条,但保留了原始输入的完整可读性,或通过视觉推断补充动作语义,从而增强了跨游戏行为表征的鲁棒性。采样策略优先选择具有明显交互结果和简洁HUD的片段,但抽样可能遗漏瞬态文本,且并非逐帧人工认证,因此容量报告中区分了实际输出、时长上限与条件性游戏预测,并指出优先级选择并非随机,导致估计产量可能偏乐观。
使用方法
该数据集适用于视频分类、动作识别与跨游戏交互行为建模等任务场景。使用者可通过加载data.json获取所有可用的画廊媒体,并借助capacity_report.json理解实际输出与条件性预测之间的差异。配套的查看器空间提供了可视化浏览界面,便于快速检索与预览片段。由于片段不含音频且时长固定,研究者可直接将其输入至三维卷积网络、时序变换器或双流架构中,用于训练或评估动作分类器。需注意,优先级选择非随机,使用时应结合游戏来源与元数据中的哈希值,以复现筛选条件并避免对产量估计的过度解读。
背景与挑战
背景概述
游戏视频理解领域长期面临公开交互数据稀缺的困境,动作识别与行为预测研究多依赖图像或短片段,难以覆盖完整交互动态。2024年,xiaoluo11与OpenP2P等贡献者基于《侠盗猎车手5》等七款游戏,构建了Action Atlas画廊,每款游戏采集至多50个15秒真实片段,目标本地提取10,000片段,并以20 FPS、300帧、H.264无音频标准化存储。该数据集保留来源版本与哈希,为视频分类与游戏交互分析提供了可追溯的基准资源,推动了开放世界游戏行为建模的实证研究。
当前挑战
该数据集所应对的核心领域问题在于游戏视频分类与交互动作识别,其难点在于开放世界场景中动作边界模糊、视觉特征高度多样且缺乏音频线索。构建过程中,筛选依赖每秒两帧采样检测可见交互结果、简易HUD及无字幕,可能遗漏瞬时文本,且无法实现逐帧人工认证;优先选择策略非随机,导致产量估计偏乐观。此外,来源与游戏权利归属各异,需遵循原始条款,而本地万段提取目标与画廊子集之间的容量差距,亦对数据扩展与质量一致性构成持续挑战。
常用场景
经典使用场景
在视频理解与行为识别领域,该数据集凭借其精细的15秒、300帧、20FPS的标准化视频片段,为细粒度动作分类与时空交互建模提供了高质量素材。其涵盖七款游戏的玩法片段,天然适合作为视频分类模型的训练与评测基准,尤其是针对需要捕捉瞬时交互结果的任务,如动作起止检测与多类行为识别。由于片段长度统一且无音频干扰,研究者可专注于纯视觉模态下的动作表征学习,推动视频分类算法在复杂交互场景中的鲁棒性验证。
衍生相关工作
围绕该数据集,后续工作可能催生一系列视频动作识别基准模型与轻量化分类网络,例如基于3D卷积或Transformer的时序建模方法。其开放的画廊视图与容量报告机制,亦可能启发数据蒸馏与主动学习研究,推动在有限标注预算下构建高效视频理解系统。同时,源数据集的衍生版本或跨游戏迁移研究有望涌现,促进多领域动作语义对齐与领域自适应技术的进步。
数据集最近研究
最新研究方向
在视频理解与交互行为分析领域,该数据集聚焦于从游戏画面中提取细粒度动作语义的前沿探索。基于15秒、300帧的标准化剪辑,研究者致力于构建跨游戏的动作识别基准,尤其关注无音频条件下视觉推断的鲁棒性,以及HUD元素与瞬时文本的筛查策略。当前热点包括利用此类画廊数据微调视频分类模型,以提升对稀疏交互事件的检测能力,并缓解非随机采样带来的乐观偏差。其意义在于为游戏AI、人机交互分析及弱监督视频学习提供可复用的评测资源,推动动作图谱在真实场景中的泛化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务