遇见数据集

PreTrainHOIAssistant

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

HOI4 Vanilla Pretrain 数据集是从策略游戏《钢铁雄心IV》(Hearts of Iron IV)的原始游戏数据中提取的预训练语料库,旨在为大语言模型提供训练数据。数据集涵盖了游戏的核心内容,包括事件、国策树、理念、科技、国家/省份历史、本地化文本(10种语言)、Clausewitz引擎的模组文档,以及所有可下载内容(DLC)的相关数据。每个源实体都提供了三种不同的表示视图:原始的Clausewitz脚本(约70%)、解析后生成的规范JSON结构(约15%)以及模板生成的自然语言描述(约15%),这有助于模型学习游戏特定的领域特定语言、结构化表示以及与通用文本的关联。数据规模方面,数据集共包含10,316个文档,其中训练集9,773个,验证集543个。总字符数约3,860万,总单词数约298万。数据基于游戏版本1.19.1(Thunder at our Gates)提取。数据构成非常多样,按文档类型划分包含超过40种类型,按语言划分绝大多数为英文,其余包括法语、葡萄牙语(巴西)、德语、简体中文、波兰语、日语、西班牙语等少量文档,以及一个代码文档。按数据来源(DLC)划分,大部分数据来自游戏本体(vanilla),其余数据分布在超过30个不同的DLC包中。数据集在构建过程中进行了严格的三阶段去重处理,包括基于SHA-1的完全重复检测、基于抽象语法树(AST)结构哈希的逻辑重复检测,以及使用MinHash-LSH算法检测近似重复文档,确保了数据质量。数据集采用MIT许可证发布。

The HOI4 Vanilla Pretrain dataset is a pretraining corpus extracted from the raw game data of the strategy game Hearts of Iron IV, designed to provide training data for large language models. The dataset covers core game content, including events, national focus trees, ideas, technologies, country/province history, localization texts (10 languages), Clausewitz engine mod documentation, and all downloadable content (DLC) related data. A key feature is that each source entity provides three different representation views: original Clausewitz scripts (about 70%), parsed canonical JSON structures (about 15%), and template-generated natural language descriptions (about 15%), which helps models learn game-specific domain languages, structured representations, and associations with general text. In terms of data scale, the dataset contains 10,316 documents, with 9,773 in the training set and 543 in the validation set. The total character count is approximately 38.6 million, and the total word count is about 2.98 million. The data is based on game version 1.19.1 (Thunder at our Gates). The data composition is highly diverse. By document type, it includes over 40 types, with larger volumes in documentation (3,027), ai_strategy (1,047), generic (417), event (849), idea_group (115), etc. By language, the majority are English (10,147 documents), with the rest including small numbers of French, Portuguese (Brazil), German, Simplified Chinese, Polish, Japanese, Spanish documents, and one code document. By data source (DLC), most data comes from the base game (vanilla, 10,183 documents), with the rest distributed across over 30 different DLC packs. The dataset underwent strict three-stage deduplication during construction, including SHA-1-based exact duplicate detection, AST-based logical duplicate detection, and MinHash-LSH algorithm for approximate duplicate detection, ensuring data quality. The dataset is released under the MIT license.

创建时间:
2026-07-15
原始信息汇总

数据集概述

数据集名称:HOI4 Vanilla Pretrain Dataset

描述:从游戏《钢铁雄心IV》(Hearts of Iron IV)原版游戏数据中提取的预训练语料库,适用于大型语言模型。数据集包含事件、焦点树、思想、科技、国家/地区历史、本地化(10种语言)、克劳塞维茨模组文档以及DLC内容。每个实体提供三种表示视图:原始克劳塞维茨脚本、规范JSON和模板化自然语言描述。

许可证:MIT

数据集规模

  • 文档总数:11,320(训练集10,751,验证集569)
  • 总字符数:36,310,410
  • 总词数:2,834,850
  • 总令牌数(空白分词):2,834,850
  • 游戏版本:1.19.1
  • 数据集大小:36,325,723 字节

数据集特征

每个样本包含以下字段:

  • id:字符串,唯一标识符
  • text:字符串,文本内容
  • view:字符串,表示视图类型(raw、json、nl)
  • source:结构体,包含以下子字段:
    • file:字符串,源文件名
    • doc_type:字符串,文档类型
    • source_key:字符串,源键
    • dlc:字符串,所属DLC
    • game_version:字符串,游戏版本
  • language:字符串,语言代码
  • meta:结构体,包含以下子字段:
    • n_chars:int64,字符数
    • n_words:int64,词数
    • n_tokens_word:int64,单词令牌数
    • n_tokens_gpt2:int64,GPT-2令牌数
    • n_tokens_cl100k:int64,cl100k令牌数
    • n_bytes:int64,字节数
    • mean_word_length:float64,平均词长
    • symbol_to_word_ratio:float64,符号与词的比例
    • duplicate_line_fraction:float64,重复行比例
    • sha1:字符串,SHA-1哈希值
    • ast_hash:字符串,AST结构哈希值
    • extractor:字符串,提取器标识

数据集划分

  • 训练集:10,751个样本
  • 验证集:569个样本

数据集组成

按文档类型分布(Top 10)

文档类型 文档数 字符数
documentation 3,340 1,280,371
ai_strategy 1,319 1,701,124
wiki 1,230 812,562
event 850 598,054
scripted_trigger 764 334,945
modifier 747 438,739
oob_template 669 981,328
state_history 625 241,902
decision 581 427,624
mio 545 791,433

其他文档类型包括:country_history、country、faction、localization、focus_tree、misc_config、doctrine、special_project、idea_group、music_config、operation、game_rule、combat_tactic、scripted_loc、peace_conference、resistance、equipment、autonomous_state、scorer、scripted_gui、country_tag、state、technology、generic、opinion_modifier、balance_of_power、unit_leader、intelligence_agency、ability、general_history、raid、building、lua_code、tech_folder、resource、weather、ideology、terrain、on_action、difficulty、profile、wargoal。

按语言分布

语言 文档数 字符数
en(英语) 13,298 35,787,727
fr(法语) 32 5,068
pt-BR(巴西葡萄牙语) 31 4,272
zh-Hans(简体中文) 21 3,126
pl(波兰语) 21 3,063
ja(日语) 21 2,834
es(西班牙语) 21 3,122
de(德语) 21 3,084
code(代码) 3 498,114

按来源(DLC)分布:主要来源为原版游戏(vanilla),其他来源包括多个DLC内容包。

表示视图

每个实体以三种形式呈现(根据文档ID确定性分配):

  • raw(约70%):重新序列化的克劳塞维茨脚本,用于学习游戏领域特定语言
  • json(约15%):解析后AST的规范JSON,结构化表示
  • nl(约15%):模板化的自然语言描述,衔接通用文本

视图类型记录在每个样本的view字段中。

数据去重

文档经过三阶段去重处理:

  1. 精确SHA-1哈希:字节完全相同的文档
  2. AST结构哈希:逻辑相同但显示文本不同的文档
  3. MinHash-LSH(参数:num_perm=128, bands=16, rows=8, threshold=0.8):近似重复文档
    • 阈值处召回率94.7%
    • 不相似文档误报率0.1%
    • 真实近似重复(Jaccard>=0.9)召回率99.99%

去重按语言隔离进行,翻译文本不会跨语言合并。

加载方式

python from datasets import load_dataset

从Hub加载

ds = load_dataset("hoi4-vanilla-pretrain")

从本地导出文件加载

ds = load_dataset("parquet", data_files={ "train": "data/train-.parquet", "validation": "data/validation-.parquet", })

引用格式

bibtex @misc{hoi4_vanilla_pretrain, title = {HOI4 Vanilla Pretrain Dataset}, year = {2026}, note = {Extracted from Hearts of Iron IV v1.19.1 (Thunder at our Gates)}, }

搜集汇总
数据集介绍
PreTrainHOIAssistant 数据集图片
构建方式
PreTrainHOIAssistant数据集源自经典大战略游戏《Hearts of Iron IV》的原始游戏数据,经过系统性提取与结构化处理,构建为面向大型语言模型的预训练语料库。数据集覆盖游戏核心机制,包括事件、焦点树、理念、科技、国家与地区历史、本地化文本(涵盖10种语言)、Clausewitz模组文档及DLC内容。每个数据实体采用三重表示视图:原始Clausewitz脚本格式、规范JSON的AST解析结构,以及基于模板的自然语言描述,分别约占70%、15%和15%的比例,从而在领域特定语言、结构化数据与通用文本之间建立桥梁。数据集共包含11,320个文档,划分为训练集(10,751条)和验证集(569条),基于游戏版本1.19.1提取,并以MIT许可协议开放。
特点
该数据集的核心特点在于其多层次、多源异构的数据融合与严格的质量控制。数据涵盖50余种文档类型,从文档说明、AI策略、事件脚本到本地化文本与Lua代码,全面映射游戏逻辑的复杂性。尤为突出的是,数据集引入了三级去重机制:首先基于SHA-1哈希移除完全一致的字节相同文档,其次通过AST结构哈希识别逻辑相同但表述不同的条目,最后采用MinHash-LSH算法(128个排列、16个波段、8行,阈值0.8)精确剔除近似重复内容,实现94.7%的召回率与0.1%的极低误报率,同时确保跨语言翻译内容不被误合并。此外,每条记录附有丰富的元数据,包括字符数、词数、多种分词器下的令牌数、符号与词比例、重复行占比等,为模型训练与数据分析提供了详尽的统计支撑。
使用方法
使用PreTrainHOIAssistant数据集极为便捷,通过Hugging Face的datasets库即可一键加载。用户可调用load_dataset('hoi4-vanilla-pretrain')直接从Hub获取数据,或下载本地Parquet文件后以load_dataset('parquet', data_files={...})方式加载。数据集包含'default'配置,训练与验证分片清晰。每条记录提供'id'、'text'、'view'、'source'(含文件路径、文档类型、来源键、DLC归属及游戏版本)、'language'及'meta'字段,其中'meta'存储了详细的文本统计特征。用户可根据'view'字段筛选所需表示形式(raw/json/nl),或依据'doc_type'与'language'进行针对性采样,适用于游戏领域大语言模型的预训练、微调或下游任务。
背景与挑战
背景概述
PreTrainHOIAssistant数据集诞生于2026年,由专注于游戏智能与自然语言处理交叉领域的研究团队构建,核心目标是为大规模语言模型提供源自策略游戏《钢铁雄心IV》原生数据的预训练语料。该数据集系统性地抽取了游戏内事件、国策树、理念、科技树、国家与省份历史、多语言本地化文本(覆盖10种语言)、Clausewitz引擎模组文档及DLC内容,共计超过11,320份文档,约36.3百万字符。其独特之处在于为每个实体提供三种表征视图:原始Clausewitz脚本、规范JSON结构及模板化自然语言描述,从而弥合了结构化游戏逻辑与自由文本之间的鸿沟。这一数据集为领域特定的语言模型预训练开辟了新路径,尤其推动了游戏规则理解、策略推理及多语言游戏内容生成等相关研究的发展。
当前挑战
PreTrainHOIAssistant数据集主要应对两大层面的挑战。在领域问题上,传统语言模型难以准确理解复杂策略游戏的规则引擎与动态决策逻辑,例如《钢铁雄心IV》中嵌套的事件链、条件国策及国家关系演算,这要求模型能够从结构化脚本与自然语言描述中联合学习因果推理与状态机建模。在数据集构建过程中,核心挑战包括:从Clausewitz专有DSL解析出近50种不同文档类型的高保真抽象语法树,确保AST结构哈希与MinHash-LSH近重复检测在跨语言场景下不错误合并语义独立的翻译文本;在JSON、原始脚本与自然语言三类视图间保持语义一致性,并平衡训练集中不同文档类型的分布(如scripted_loc类文档占比过高)以避免模型偏差;同时需处理GOTTERDAMMERUNG等DLC中新增数据与旧版本的兼容性问题。
常用场景
经典使用场景
在策略游戏研究领域,PreTrainHOIAssistant数据集为大型语言模型的预训练提供了独特且丰富的语料资源。该数据集完整提取了《钢铁雄心IV》原版游戏中的事件、焦点树、科技树、国家历史、本地化文本及克劳塞维茨引擎模组文档等多元内容,并以原始脚本、规范JSON和模板化自然语言三种视图呈现。这一设计使其成为训练能够理解和生成游戏逻辑代码、策略描述及多语言文本的智能模型的核心素材,广泛服务于游戏AI的指令理解与决策生成场景。
实际应用
在实际应用中,PreTrainHOIAssistant数据集的潜力广泛渗透于数字娱乐产业的多个层面。在游戏开发领域,它可赋能自动化模组生成工具,辅助设计者快速生成符合游戏语法的平衡性事件或AI策略脚本;在教育与模拟训练场景中,基于该语料训练的模型能对历史推演或战争决策进行智能问答与推理解释。此外,其多语言本地化数据也为跨语言游戏内容适配与低资源语言翻译系统优化提供了高价值实践数据。
衍生相关工作
围绕PreTrainHOIAssistant数据集,学界与工业界已衍生出一系列开创性工作。例如,研究者基于其JSON视图与自然语言视图的对应关系,提出了游戏逻辑的文本到代码生成模型,显著降低了模组开发门槛;另有工作利用其克劳塞维茨文档数据,构建了面向策略游戏的指令微调与上下文决策框架。未来,该数据集还可能催生领域特定的语言模型预训练基线,以及面向复杂交互场景的多模态推理评估套件,持续推动游戏智能体与可解释AI的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务