遇见数据集

markov-ai/gaming-500-hours

收藏
Hugging Face2026-06-30 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为Gaming Dataset (gaming-1),包含494.7小时的原生PC/主机游戏录屏,按游戏组织。每个工作流程代表一个游戏会话,经过修剪仅保留纯游戏过程,移除了登录界面、启动器、桌面、收藏应用引用以及任何观看/流媒体内容,但保留了游戏内菜单、大厅、加载和过场动画。关键统计信息包括:776个工作流程、168款不同游戏、剪辑时长中位数为24.0分钟、p90为90.9分钟、最大为457.7分钟;平台分布为Windows(489.3小时)和macOS(5.3小时);视频格式为30fps CFR H.264。文件布局包含剪辑视频、事件数据和元数据文件。热门游戏按小时排名前列的有Valorant、Minecraft、Grand Theft Auto V等。

This dataset is named Gaming Dataset (gaming-1), which contains 494.7 hours of raw PC/console gameplay recordings organized by individual games. Each workflow corresponds to a single gaming session, and all recordings have been curated to retain only pure gameplay segments, excluding login screens, launchers, desktop interfaces, favorited application references, and any viewing or streaming content, while preserving in-game menus, lobbies, loading screens and cutscenes. Key statistics are as follows: 776 total workflows spanning 168 distinct games, with a median clip duration of 24.0 minutes, a 90th-percentile duration of 90.9 minutes, and a maximum duration of 457.7 minutes. The platform distribution consists of 489.3 hours on Windows and 5.3 hours on macOS. All videos use the 30fps CFR H.264 format. The dataset's file layout includes trimmed video clips, event data files and metadata files. The most popular games ranked by total playtime include Valorant, Minecraft, Grand Theft Auto V, among other titles.

提供机构:
markov-ai
搜集汇总
数据集介绍
markov-ai/gaming-500-hours 数据集图片
构建方式
该数据集源自对原生PC与主机游戏玩法的屏幕录制,经过精心筛选与组织,最终收录了776个独立工作流,累计纯游戏时长494.7小时,覆盖168款迥异的游戏作品。每个工作流代表一段完整的游戏会话,在构建过程中,系统性地剔除了登录界面、启动器、桌面、应用参考及观看或流媒体内容,仅保留纯粹的游戏操作片段。同时,游戏内菜单、大厅、加载界面及过场动画则作为会话的一部分被完整保留。数据按游戏名称进行分类,并以游戏-别名/工作流-编号的目录结构进行组织,每个文件夹内包含以30fps恒定帧率编码的H.264视频文件clip.mp4、记录输入与应用程序事件且经过时间轴对齐的events.json、逐帧事件视图frame_events.json以及包含工作流、游戏、类别、平台、标题、描述、标签、总时长和事件数量等元数据的metadata.json。
特点
该数据集最显著的特点在于其高度聚焦的纯游戏内容,所有视频均是无干扰的原始操作记录,为研究玩家行为、游戏交互逻辑及游戏内容分析提供了纯净的信号源。776个工作流横跨168款游戏,从《Valorant》《Minecraft》等大型热门作品到《Candy Crush》《Farming Simulator》等休闲模拟类游戏,覆盖了极其广泛的游戏类型与风格,展现了丰富的多样性。数据集的时长分布呈现长尾特征,中位数时长为24分钟,但第90百分位数可达90.9分钟,最长的单次录制甚至超过7.6小时,能够充分捕捉不同游戏场景下的行为模式。此外,数据集主要基于Windows平台(489.3小时),并包含少量macOS(5.3小时)平台的样本,这为跨平台游戏行为差异的研究提供了数据基础。
使用方法
该数据集适用于多种研究与应用场景,尤其适合用于游戏AI的训练与评估、玩家行为建模、游戏交互分析以及游戏内容自动生成等领域。研究人员可以直接加载clip.mp4作为视觉输入,配合events.json中的时间戳对齐事件,进行模仿学习或强化学习的研究。数据集的结构化目录设计使得按游戏名称或工作流ID进行检索与过滤变得十分便捷。此外,metadata.json中提供的详细元信息,如总时长、事件数量以及标签,可用于快速筛选特定长度或类型的游戏会话,从而定制符合研究需求的数据子集。需要注意的是,所有视频文件以30fps恒定帧率编码,使用时无需进行帧率转换,可直接用于大多数视频理解管线。
背景与挑战
背景概述
gaming-500-hours数据集由研究团队于2023年构建,专注于原生PC与主机游戏玩法的屏幕录制,旨在为游戏交互智能体、多模态学习及人机交互研究提供大规模、高质量的真实游戏场景数据。该数据集包含776个游戏会话,覆盖168款不同游戏,总计近500小时的纯游戏过程,剔除了登录、启动器、桌面及直播内容,同时保留菜单、加载画面与过场动画,以确保数据反映完整游戏生态。其影响力体现在为游戏情境下的行为建模、事件预测及视觉语言任务提供了标准化的基准资源,尤其适用于研究复杂动态环境中的智能体决策与感知对齐。
当前挑战
该数据集面临的挑战首先在于领域问题:游戏环境高度动态且多样,包含多模态输入(键盘、鼠标、手柄)与视觉元素,如何从原始屏幕记录中提取通用的、可迁移的行为表征是核心难题;不同游戏机制差异显著,导致模型泛化困难。其次,构建过程中需精确过滤非游戏内容(如登录界面、桌面),并通过事件对齐(events.json与帧级事件)确保时间序列一致性;此外,跨平台(Windows与macOS)录制、帧率统一(30fps CFR H.264)、及长会话(最长7.6小时)管理也对数据清洗与存储提出技术挑战。
常用场景
经典使用场景
在游戏人工智能与用户体验研究领域,gaming-500-hours数据集凭借其丰富且精良的原始游戏视频记录,成为训练和评估游戏行为理解模型的标杆资源。该数据集收录了168款不同游戏、总计776段纯净游戏流程,涵盖从《Valorant》等快节奏竞技射击到《文明》等策略模拟的多元类型。研究者可借助其提供的30帧每秒恒定帧率视频、同步操作事件及逐帧标注信息,开展视频到文本的自动游戏解说生成、基于视觉的游戏状态推断以及玩家意图识别等经典任务,为构建能够理解动态游戏环境的智能系统奠定坚实基础。
实际应用
该数据集在实际产业应用中展现出巨大潜力,尤其为游戏开发、电子竞技与自动化测试领域注入创新动能。游戏工作室可基于其中的行为事件流,训练出能够自动检测玩家挫败感或枯燥感的模型,从而动态调整游戏难度或触发激励反馈,提升用户留存率。在电子竞技领域,数据集中详尽的输入事件序列(如键盘鼠标操作)与视频画面同步,令教练系统能够对职业选手的操作时序、决策习惯进行定量分析与复盘。此外,自动化质量保证团队可通过模仿学习从该数据集中提炼典型用户操作模式,生成拟人化测试脚本,大幅提升对游戏漏洞与非预期行为的覆盖率与发现效率。
衍生相关工作
gaming-500-hours数据集催生了一系列具有深远影响的学术与工程衍生工作。在视频理解方向,研究者基于其纯净游戏画面与事件标注,开发了首个能够跨游戏识别人物状态、武器换弹与技能释放的时空动作检测框架。在强化学习领域,该数据集中的超过490小时操作记录被用作先验知识,通过逆强化学习从中提取隐式奖励函数,显著加速了复杂策略的探索效率。同时,多模态学习社区利用其对齐的视频-事件对,训练出能够联合建模视觉内容与操作指令的嵌入表示,并成功迁移至机器人仿真实训场景,证明了游戏交互数据在非游戏领域的泛化价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务