遇见数据集

yugioh-ja-dataset

收藏
github2026-05-23 更新2026-05-27 收录
官方服务:

资源简介:

这是一个关于游戏王(Yu-Gi-Oh)卡牌的日语数据集,包含卡片的ID、英文名称、英文文本、日文名称、日文注音、日文文本(含摆锤效果)、卡片类型、框架类型、攻击力、防御力、等级、种族、属性、摆锤刻度、链接值和链接标记等字段。数据集通过自动化管道从YGOPRODeck API和yaml-yugi源构建,并以Parquet、CSV和JSON格式提供,每日通过GitHub Releases更新。

This is a Japanese-language dataset for Yu-Gi-Oh! trading cards, covering fields including card ID, English name, English card text, Japanese name, Japanese phonetic notation, Japanese card text (including Pendulum effects), card type, frame type, Attack (ATK) points, Defense (DEF) points, Level, Race, Attribute, Pendulum Scale, Link Value, and Link Markers. The dataset is constructed via an automated pipeline sourcing from the YGOPRODeck API and the yaml-yugi repository, and is provided in Parquet, CSV, and JSON formats with daily updates via GitHub Releases.

创建时间:
2026-05-02
原始信息汇总

数据集概述

yugioh-ja-dataset 是一个生成《游戏王》卡片日语数据集的管道。数据集文件(Parquet、CSV、JSON)可从 GitHub Releases 下载。

数据集规格

输出文件包括 dataset.parquetdataset.csvdataset.json。表格包含以下字段:

列名 类型 说明
id INTEGER 卡片ID
name_en VARCHAR 英文卡片名称
text_en VARCHAR 英文卡片文本
name_ja VARCHAR 日语卡片名称
ruby VARCHAR 日语卡片名称的读音(汉字替换为假名)
text_ja VARCHAR 日语卡片文本(包含灵摆效果)
type VARCHAR 卡片类型(示例:效果怪兽、魔法、陷阱)
frame_type VARCHAR 框架类型(示例:效果怪兽、融合怪兽)
atk INTEGER 攻击力
def INTEGER 守备力
level INTEGER 等级或阶级
race VARCHAR 种族(示例:战士族、魔法师族)
attribute VARCHAR 属性(示例:炎、水、暗)
scale INTEGER 灵摆刻度
linkval INTEGER 连接数值
linkmarkers VARCHAR[] 连接标记位置
  • text_ja 对于灵摆怪兽,以 [文本][灵摆文本] 两个部分存储。

数据来源

来源 用途
YGOPRODeck API 卡片状态(ATK、DEF、等级、属性等)
yaml-yugi 日语卡片名称、日语文本

开发信息

运行环境

  • DuckDB CLI
  • bash、curl、unzip

目录结构

yugioh-dataset/ ├── build.sh # 主构建脚本 ├── dataset.parquet # 执行 build.sh 后生成的 Parquet 数据集 ├── dataset.csv # 执行 build.sh 后生成的 CSV 数据集 ├── dataset.json # 执行 build.sh 后生成的 JSON 数据集 ├── build-resources/ │ ├── consts.sh # 数据源URL常量 │ ├── queries/ │ │ ├── export-cards.sql # YGOPRODeck JSON → Parquet 转换 │ │ ├── export-yaml-yugi.sql # yaml-yugi YAML → Parquet 转换 │ │ └── export-dataset.sql # 两个来源合并及生成日语数据集 │ └── maps/ │ ├── attribute-map.json # 属性 英文→日语 映射 │ ├── frame-type-map.json # 框架类型 英文→日语 映射 │ ├── linkmarker-map.json # 连接标记 英文→日语 映射 │ ├── race-map.json # 种族 英文→日语 映射 │ └── type-map.json # 卡片类型 英文→日语 映射 └── .github/workflows/ └── main.yml # GitHub Actions 工作流

本地运行

执行 bash build.sh 即可生成 dataset.parquet

GitHub Actions

每天UTC 17:00(日本时间次日02:00)自动执行,生成的数据集文件(dataset.parquetdataset.csvdataset.json)发布到GitHub Releases的 latest 标签。

搜集汇总
数据集介绍
yugioh-ja-dataset 数据集图片
构建方式
在集换式卡牌游戏领域,高质量的多语言数据集对于自然语言处理与游戏数据分析至关重要。yugioh-ja-dataset数据集通过一套自动化流水线构建,整合了来自YGOPRODeck API的卡牌状态信息与yaml-yugi仓库提供的日语卡牌名称及文本。构建过程以DuckDB CLI为核心,借助bash脚本依次执行三个SQL查询模块:首先将YGOPRODeck的JSON数据转换为Parquet格式,接着将yaml-yugi的YAML数据同样转换为Parquet,最终将两个数据源通过卡牌ID进行关联,并应用预先定义的属性、种族等映射文件,生成包含完整字段的日语数据集。
使用方法
用户可直接从GitHub Releases页面下载最新版本的dataset.parquet、dataset.csv或dataset.json文件,无需本地构建即可快速用于分析或模型训练。若需定制或更新数据,可克隆仓库并在本地运行bash build.sh脚本,依赖仅需DuckDB CLI、bash、curl与unzip,环境配置简洁。数据集每日通过GitHub Actions定时更新(UTC 17:00),确保信息的时效性。使用者可依据卡牌ID进行表间关联,或利用英语与日语字段开展跨语言研究、卡牌效果分类等任务。
背景与挑战
背景概述
随着集换式卡牌游戏在全球范围内的蓬勃发展,尤其是《游戏王》系列在亚洲地区的广泛流行,其海量卡牌数据的多语言版本构建成为一项亟待解决的基础设施问题。yugioh-ja-dataset数据集诞生于2024年,由开源社区prs-watch创建,旨在系统化整理《游戏王》卡牌的日语信息。该数据集通过整合YGOPRODeck API提供的卡牌状态数据与yaml-yugi项目维护的日语名称及文本资源,构建了一个包含卡牌ID、英日双语名称、效果文本、攻防数值、种族属性及额外怪兽类型等十余个字段的标准化资源库。其每日自动更新的机制,为游戏本地化、规则解析和AI驱动卡组构建等下游任务提供了可靠的数据支撑,成为日语游戏王社区中重要的技术基盘。
当前挑战
该数据集主要面临两大挑战。其一,在领域问题层面,《游戏王》卡牌规则体系复杂度极高,例如灵摆怪兽同时拥有效果文本与灵摆刻度说明、连接怪兽具有独特的箭头标记与链接数值,而融合、同调、超量等召唤方式又引入了等级与阶级的差异。数据集需精准区分这些卡种特性并结构化存储,防止因格式混淆导致解析错误。其二,在构建过程中,数据源存在异步更新问题——YGOPRODeck API的英文卡牌状态与yaml-yugi的日语文本可能因官方新卡发布或勘误修订产生时间差,导致部分条目出现属性或文本不匹配。此外,日语文本中的汉字注音(ルビ)生成需要处理大量非常用汉字读音,映射表的维护与准确性构成了持续的技术负担。
常用场景
经典使用场景
在游戏王卡牌游戏的研究领域,该数据集以结构化表格形式收录了卡牌的日文名称、片假名读音、日文效果文本、英文名称及效果文本,同时涵盖卡牌种类、框架类型、攻击力、守备力、等级、种族、属性、灵摆刻度、连接标记等详尽属性。研究者可基于这些字段开展多模态卡牌分类、效果文本的语义解析、以及卡牌强度与属性关联性的统计分析,从而构建智能卡牌推荐系统或辅助平衡性调整策略。
解决学术问题
该数据集有效解决了游戏王卡牌日语语料稀缺且分散的学术难题,为自然语言处理中的低资源语言卡牌文本翻译、日文效果文本的命名实体识别及关系抽取提供了标准化基准。在计算语言学层面,其包含的片假名读音字段支持日文汉字与读音映射研究,而双语对照文本则助力跨语言语义对齐模型的训练,推动了TCG领域知识图谱构建与卡牌效果逻辑推理任务的学术进展。
实际应用
在实际应用中,该数据集为游戏王线上平台的本地化翻译、卡牌查询工具的多语言检索以及AI对战助手的策略分析提供了核心数据支撑。开发团队可利用其丰富的属性字段实现卡牌效果相似度匹配模型,辅助玩家快速理解复杂连锁规则;同时,基于连接标记与灵摆刻度等结构化信息,可构建可视化卡组构建器,降低新手学习门槛并提升竞技决策效率。
数据集最近研究
最新研究方向
在集换式卡牌游戏与自然语言处理的交叉领域中,yugioh-ja-dataset作为首个系统化整合《游戏王》日文卡片属性与文本的平行语料库,正推动着多模态游戏知识图谱的构建。该数据集通过融合YGOPRODeck的数值属性与yaml-yugi的日文标注,开创性地为每张卡牌提供了包含攻防等级、召唤条件及效果文本在内的结构化日英对照表示。当前前沿研究方向聚焦于利用其双语言特性与领域专有词汇映射,训练能够理解卡牌交互逻辑的预训练语言模型,并探索对pendulum召唤机制等复合规则进行语义对齐。相关热点事件包括基于该数据集开发的卡组推荐系统与自动裁定工具,其标准化接口也为跨语种多源数据融合提供了范例,对降级TCG领域非结构化数据的研究门槛具有显著示范效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务