遇见数据集

Pathfinder Second Edition monster level prediction dataset

收藏
arXiv2026-07-10 更新2026-07-14 收录
官方服务:

资源简介:

该数据集是首个专为桌面角色扮演游戏怪物等级预测而构建的公开资源,由克拉科夫AGH大学的研究团队基于Pathfinder第二版游戏系统的公开数据精心整理而成。数据集包含6007条怪物条目,涵盖302本官方源书,每条记录包含怪物等级(-1至25级)及多维数值属性,特征集涵盖基础属性、防御与攻击能力、魔法力量等结构化信息。其创建过程通过提取并解析复杂的JSON对象,结合领域知识进行特征工程,确保数据因果关联性。该数据集旨在支持游戏设计中的自动化平衡性评估,通过机器学习模型预测怪物等级,为游戏设计师提供计算机辅助工具,以提升角色扮演游戏系统设计的效率与科学性。

This dataset is the first public resource specifically developed for monster level prediction in tabletop role-playing games (TTRPGs), carefully curated by a research team from AGH University in Kraków using publicly available data from the Pathfinder Second Edition game system. The dataset contains 6007 monster entries spanning 302 official sourcebooks. Each record includes monster levels ranging from -1 to 25, along with multi-dimensional numerical attributes, and the feature set covers structured information such as basic attributes, defensive and offensive capabilities, and magical power. During its creation, complex JSON objects were extracted and parsed, and feature engineering was conducted with domain knowledge to ensure the causal relevance of the data. This dataset aims to support automated balance evaluation in game design, enabling machine learning models to predict monster levels and providing computer-aided tools for game designers, thereby enhancing the efficiency and scientific rigor of role-playing game system design.

创建时间:
2026-07-10
搜集汇总
数据集介绍
构建方式
在桌面角色扮演游戏(TTRPG)设计领域,怪物平衡性调整是一项繁复且至关重要的任务。为此,本研究基于《开拓者:第二版》(Pathfinder Second Edition)公开数据库,构建了首个专用于TTRPG怪物等级预测的数据集。该数据集囊括了来自302本资料集、冒险模组与剧本的6007个怪物条目,最新数据收录至2026年4月26日。原始怪物条目以复杂的JSON对象呈现,研究团队通过精细的特征工程,从原始数据中提取了三个递进层次的特征集:基础集包含力量、敏捷等8项核心属性;扩展集增设了感知、豁免检定、攻击加成及法术相关特征等12项;全集则进一步纳入了移动速度、免疫数量及法术环位分布等13项复杂衍生特征,最终形成了33维的数值特征向量。
特点
该数据集最显著的特点在于其深度契合游戏设计领域的实际需求。依托《开拓者:第二版》高度数学化的规则系统,数据集中的每个怪物均由上述33个数值属性精密刻画,这些属性与其等级(-1至21级)之间存在复杂的非线性因果关系。数据集呈现出典型的序数回归特征:等级为有序离散变量,但等级间并非等距增长。值得注意的是,数据具有鲜明的时间序列特性——较新的怪物设计往往基于旧有怪物进行演化,这一特性通过每只怪物所属的源书籍出版日期得以精确记录。此外,等级分布具有明显的长尾不平衡性,低等级(-1至0级)与高等级(19至21级)怪物数量相对稀少,为序数回归模型带来了富有挑战性的学习任务。
使用方法
在使用本数据集进行等级预测时,研究者应将其界定为表格序数回归问题。数据集默认采用时间先后顺序进行训练集与测试集的划分:以2025年8月1日为界,之前的怪物作为训练集,之后的构成测试集,从而模拟真实设计场景中基于已有数据预测未来新作的情境。更为精细的评估策略是采用滚动窗口法(Expanding Window),以怪物成书出版的批次为单位,逐步扩展训练集并滚动测试,最终取平均指标作为模型性能的稳健评估。研究团队已开源完整代码库,涵盖特征工程、16种基线模型(包括回归取整、专用序数回归算法及序数感知神经网络)的对比实验,以及基于SHAP值的可解释性分析工具,为后续研究提供了标准化的工作流基准。
背景与挑战
背景概述
在桌面角色扮演游戏(TTRPG)的生态中,怪物设计是核心但耗时费力的环节,尤其像《开拓者》第二版这样的系统,每只怪物由数十项数值属性定义,其整体实力被概括为序数等级。2026年,波兰AGH科技大学的Jolanta Śliwa与Jakub Adamczyk创建了首个专门用于TTRPG怪物等级预测的数据集,源自6007条公开的《开拓者》第二版怪物条目。该研究旨在利用机器学习辅助游戏设计师,将怪物等级预测形式化为表格序数回归问题,并系统对比了16种模型。这一开创性数据集不仅为游戏平衡性提供了数据驱动的工具,更填补了机器学习应用于游戏设计领域的空白,对推动TTRPG产业的智能化和高效化具有重要影响力。
当前挑战
该数据集面临的挑战首先源于领域问题的复杂性:怪物等级是离散且有序的序数变量,等级间差距不具等比性,传统回归或分类方法难以准确捕捉其内在排序关系;同时标签分布极度不平衡,高等级怪物数量稀少,给模型带来偏置风险。在构建过程中,挑战更为显著:原始JSON数据结构庞杂且含大量无关信息,需依赖领域知识精心筛选出8至33个与等级直接因果相关的特征。此外,怪物设计具有强烈的时间依赖性——新怪物往往基于旧作迭代,因此必须设计符合真实工作流的评估方案,如时间序划分和扩展窗口验证,以避免随机拆分带来的数据泄露。最终,尽管树集成模型表现卓越,但极端稀有类别及依赖特殊能力的怪物仍构成预测难点,有待未来通过引入特殊能力特征予以攻克。
常用场景
经典使用场景
在桌面角色扮演游戏(TTRPG)设计领域,Pathfinder Second Edition monster level prediction dataset 最为经典的使用场景是作为怪物强度自动评估的基准数据集。研究者可将其用于训练和验证各类机器学习模型,以预测怪物从 -1 到 25 的整数等级。该数据集包含了来自 302 本官方源书的 6007 个怪物条目,涵盖基本属性、扩展属性和全量属性三种特征集合,为模型提供了丰富的数值输入。其经典应用流程包括特征工程、模型训练与时间序列化的滚动窗口评估,特别适合验证树集成模型与神经网络在序数回归任务上的表现。
衍生相关工作
该数据集衍生了多项具有启发性的经典工作。其一,研究者利用反事实生成方法,探索如何通过最小化属性改动使怪物达到目标等级,为游戏设计提供专家系统式的优化建议。其二,基于可解释人工智能分析,深入研究了防御统计(如护甲等级、生命值)与近战攻击等特征的重要性排序,验证了模型判断与人类直觉的一致性。其三,该数据集促进了针对 TTRPG 专属的时间序列评估协议在游戏研究中普及,如扩展窗口与按出版日期划分的时序测试。此外,针对神经网络在表格数据上的局限性比较工作,也为后续序数回归专用网络架构的设计提供了实证经验。
数据集最近研究
最新研究方向
在桌游设计领域,该数据集开创性地将机器学习应用于Pathfinder Second Edition系统中怪物等级的序数回归预测,揭示了树集成模型(如随机森林、LightGBM)优于神经网络和经典回归方法的显著优势。这一前沿方向不仅验证了数据驱动方法在自动化怪物平衡设计中的可靠性,还通过可解释AI分析证实模型决策与人类直觉及游戏规则高度一致。随着TTRPG市场持续增长,该数据集为计算机辅助游戏设计提供了首个标准化基准,推动了从创意生成到机械平衡的智能化转型,有望降低设计成本并赋能业余游戏主持人创造个性化内容。
相关研究论文
  • 1
    Application of machine learning to monster level prediction in tabletop RPG game design克拉科夫AGH大学·计算机科学学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务