遇见数据集

stardew-valley-gameplay-data

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

该数据集名为“星露谷物语”,是一个从本地游戏文件夹“F:星露谷物语”上传的公开游戏数据集合,主要包含《星露谷物语》游戏的实际游玩记录。数据集规模为453个文件,总容量达514.44 GB,生成于2026年6月11日。数据内容涵盖了多种格式:包括139个.jsonl文件、111个.json文件、81个.png图像、36个.txt文本、34个.mkv视频文件、34个.parquet文件以及18个.jpg图像。这些文件具体可能包含游戏过程视频、游戏截图图像、Parquet格式的结构化数据、JSON/JSONL格式的元数据记录,以及键盘和鼠标操作的事件日志。数据集标注的任务类别为强化学习和视频分类,语言为中文,标签包括游戏玩法、视频和游戏数据,适用于游戏AI训练、行为分析、视频内容理解等相关研究。需要注意的是,数据集许可证标记为“other”,在使用前应仔细审查游戏画面、音频及素材的版权许可情况。

This dataset is named Stardew Valley and is a public collection of game data uploaded from the local game folder F:Stardew Valley, primarily containing actual gameplay records of the game Stardew Valley. The dataset consists of 453 files with a total size of 514.44 GB, generated on June 11, 2026. The content includes various formats: 139 .jsonl files, 111 .json files, 81 .png images, 36 .txt text files, 34 .mkv video files, 34 .parquet files, and 18 .jpg images. These files may specifically contain gameplay videos, game screenshot images, structured data in Parquet format, metadata records in JSON/JSONL formats, and event logs of keyboard and mouse operations. The dataset is annotated for tasks such as reinforcement learning and video classification, with the language being Chinese, and tags including gameplay, video, and game data. It is suitable for research related to game AI training, behavior analysis, and video content understanding. Note that the dataset license is marked as other, and copyright permissions for game visuals, audio, and materials should be carefully reviewed before use.

创建时间:
2026-06-12
原始信息汇总

数据集概述

  • 名称:星露谷物语(Stardew Valley Gameplay Data)
  • 语言:中文(zh)
  • 许可证:其他(other),使用前需审查游戏录像、音频及素材版权
  • 任务类别:强化学习(reinforcement-learning)、视频分类(video-classification)
  • 标签:游戏录像(gameplay)、视频(video)、游戏数据(game-data)

内容规模

  • 文件总数:453 个
  • 总大小:514.44 GB
  • 生成时间:2026-06-11 23:20:22 UTC

文件类型及数量

文件类型 数量
.jsonl 139
.json 111
.png 81
.txt 36
.mkv 34
.parquet 34
.jpg 18

数据内容说明

  • 包含游戏录像、图像、Parquet 文件、JSON/JSONL 元数据以及键盘/鼠标事件日志。
搜集汇总
数据集介绍
stardew-valley-gameplay-data 数据集图片
构建方式
该数据集基于热门农场模拟游戏《星露谷物语》的本地游玩过程构建而成,原始数据源自用户本地磁盘中的游戏文件夹。通过系统化采集与整理,数据集中囊括了多种文件类型,包括用于描述行为的JSON与JSONL格式元数据、记录键盘与鼠标操作的日志文件、游戏截图与录制的MKV视频,以及经过结构化处理的Parquet文件,全面捕捉了玩家在游戏中的互动轨迹与视觉记录。
特点
数据集规模宏大,共包含453个文件,总存储量达514.44 GB,体现了高保真、多模态的游戏数据采集特性。其内容涵盖元数据、图像、视频及行为日志,为强化学习、视频分类等研究提供了丰富素材。数据集中包含34个MKV视频文件与81张PNG图像,能够支持从视觉观察到行为序列的多角度分析,兼具时序性与场景再现能力。
使用方法
使用者可根据任务需求,按文件类型进行分类加载与分析。对于强化学习研究,可提取JSONL与Parquet文件中的结构化行为序列作为训练样本;视频分类任务则可直接利用MKV视频及对应图像数据。鉴于授权状态标注为“other”,在涉及游戏素材再利用时,需自行审查视频、音频及资产内容的版权归属,确保合规使用。
背景与挑战
背景概述
《星露谷物语》是一款风靡全球的开放式乡村模拟经营游戏,其复杂的多任务系统、随机事件与长期规划机制为强化学习与视频分析研究提供了独特的试验场。该数据集于2026年6月由匿名研究者基于本地游戏过程创建,包含453个文件、总计514.44 GB的异构数据,涵盖JSON/JSONL元数据、PNG/JPG截图、MKV游戏视频、Parquet结构化数据及键盘鼠标事件日志。核心研究问题聚焦于利用多模态游戏数据驱动强化学习策略学习与游戏视频分类,旨在探索非竞技类、高自由度的模拟游戏中智能体决策建模的可行性。该数据集填补了生活模拟类游戏开放数据集的空白,为游戏AI、人机交互及多模态学习领域提供了大规模、细粒度的基准资源。
当前挑战
该数据集面临的挑战集中体现在两个层面。在领域问题层面,模拟经营游戏缺乏明确胜负标准与稀疏奖励信号,导致传统强化学习算法难以有效学习长期规划策略;同时,游戏内多任务并行的非线性结构对视频分类与行为理解任务提出更高要求。在构建过程中,数据规模达514.44 GB,存储与传输成本高昂;混合文件类型(包含未标注的30余小时视频与34个Parquet文件)增加了多模态对齐与元数据整合的难度;此外,数据来源为本地单用户游戏记录,缺乏多用户交互与多样化游戏风格的覆盖,可能引入偏差。数据集的许可标注为'other',涉及游戏资产版权与用户隐私的合规性审查也是重要挑战。
常用场景
经典使用场景
在强化学习与行为克隆研究中,《星露谷物语》游戏数据集为智能体模拟人类玩家在开放式农业模拟环境中的决策过程提供了宝贵的训练材料。通过其中包含的键盘鼠标事件日志、游戏截图与视频片段,研究者可以构建从像素观察到动作映射的端到端模型,用于探索多任务规划、资源管理和长期目标优化等经典问题。该数据集还常被用于视频分类任务,例如区分玩家在不同季节或天气条件下执行的特定农业活动,为细粒度游戏行为理解奠定基础。
解决学术问题
该数据集有效解决了开放世界模拟游戏中可复现性不足与行为标注缺失的学术困境。以往对玩家策略的研究多依赖人工观测或小规模日志,难以系统性地分析复杂决策序列。星露谷物语数据集提供了大规模、多模态的交互记录,使研究者能够定量考察诸如时间分配策略、资源优先级排序和社交互动模式等认知层面的问题。其意义在于为游戏学、人机交互和人工智能交叉领域提供了标准化的实证研究基础,推动了从数据驱动角度理解人类在虚拟环境中的自适应行为。
衍生相关工作
基于星露谷物语数据集,学术界已衍生出若干具有启发性的研究工作。在行为克隆方面,研究人员利用轨迹数据训练了能够复现人类种植时序和资金流转的决策模型,并通过逆强化学习方法进一步解析了玩家的隐含奖励偏好。视频分类分支上,有工作聚焦于利用时序卷积网络识别游戏内特定事件(如节日庆典、矿井探索),实现了对游戏进程的高层次语义理解。这些衍生工作共同验证了该数据集在多模态行为建模与游戏场景理解中的通用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务