遇见数据集

ttrpg-rpg-fandom-com-ru

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

RPG Fandom RU数据集是一个针对俄罗斯桌面角色扮演游戏(TTRPG)领域的俄语维基数据转储,原始数据来源于rpg.fandom.com/ru/。该数据集经过处理,将维基页面转换为干净的Markdown格式,并附带YAML元数据。它专门设计用于检索增强生成(RAG)系统、大语言模型(LLM)微调以及TTRPG相关研究。数据集规模约为1,000到10,000个样本,涵盖文本生成和问答任务。数据包括三个主要部分:markdown/目录存放带元数据的Markdown文档,indexes/documents.jsonl包含所有页面的元数据(如唯一ID、标题、原始URL),indexes/chunks.jsonl包含语义片段(400-800 tokens)便于生成嵌入向量。此外,维基中的图片存储在assets/目录中,并通过多模态模型(qwen3.5:2b)自动生成了俄语语义描述,标注了图片类型(如Logo、角色艺术、地图、怪物等)和关键视觉细节。文本内容采用CC-BY-SA许可,而图片可能具有不同的许可(如CC-BY-SA、合理使用或公共领域),仅供研究和教育目的使用。

The RPG Fandom RU dataset is a Russian-language Wiki data dump focused on the Russian tabletop role-playing game (TTRPG) domain, sourced from rpg.fandom.com/ru/. The dataset has been processed to convert wiki pages into clean Markdown format with YAML metadata. It is specifically designed for retrieval-augmented generation (RAG) systems, large language model (LLM) fine-tuning, and TTRPG-related research. The dataset contains approximately 1,000 to 10,000 samples, covering text generation and question-answering tasks. The data includes three main parts: the markdown/ directory containing Markdown documents with metadata, indexes/documents.jsonl with metadata for all pages (e.g., unique ID, title, original URL), and indexes/chunks.jsonl with semantic chunks (400-800 tokens) for generating embeddings. Additionally, images from the wiki are stored in the assets/ directory, and their Russian semantic descriptions have been automatically generated using a multimodal model (qwen3.5:2b), labeling image types (e.g., Logo, Character Art, Map, Monster) and key visual details. The text content is licensed under CC-BY-SA, while images may have different licenses (e.g., CC-BY-SA, fair use, or public domain), intended for research and educational purposes only.

创建时间:
2026-07-31
原始信息汇总

RPG Fandom RU Dataset 数据集详情

数据集简介

该数据集包含俄语维基站点 rpg.fandom.com/ru/ 的完整数据转储,已转换为纯净的 Markdown 格式。数据集专为 RAG(检索增强生成)系统、大语言模型(LLM)微调以及桌面角色扮演游戏(TTRPG)研究而设计。

基本信息

属性 内容
语言 俄语、英语
许可证 CC-BY-SA 4.0
数据规模 1K-10K 条记录
任务类型 文本生成、问答
标注标签 ttrpg、rpg、fandom、wiki、russian

数据集结构

数据集包含以下核心目录与文件:

  • markdown/:经过清洗的文档,附带 YAML 元数据
  • indexes/documents.jsonl:所有页面的元数据索引
  • indexes/chunks.jsonl:语义分块数据(每块 400-800 个 token),可直接用于生成嵌入向量

元数据字段

每条数据包含三个标准字段:

  • id:来自 Fandom 的唯一页面 ID
  • title:页面标题
  • source_url:原始页面 URL

多模态数据说明

图像标注

  • 数据集包含来自维基的图像资源,存储于 assets/ 目录,并以 alt 文本形式集成到 Markdown 文档中
  • 图像标注使用 qwen3.5:2b 多模态模型(通过 Ollama 运行)自动生成
  • 标注语言为俄语,针对俄罗斯 TTRPG 语境进行了定制优化
  • 标注过程自动捕捉对象类型(如标志、角色艺术、地图、怪物等)及关键视觉细节

图像许可

图像许可与文本内容(CC-BY-SA)不同,由权利持有人在 Fandom 平台设定,主要类型包括:

  • CC-BY-SA:标准共享许可证,适用于用户生成内容
  • Fair Use(合理使用):适用于书籍封面、官方美术作品和标志,仅用于资讯目的
  • Public Domain(公有领域):适用于不受版权保护的材料

图像资源严格限定于研究和教育用途。

创作者信息

许可协议

数据集内容采用 CC-BY-SA 许可协议发布。

更新方式

项目仓库提供 Makefile,可通过以下命令同步和更新数据集:

bash make sync make download make convert make rag

搜集汇总
数据集介绍
ttrpg-rpg-fandom-com-ru 数据集图片
构建方式
该数据集以rpg.fandom.com/ru/维基站点的完整转储为基础构建,通过自动化流程将原始维基页面转换为结构清晰的Markdown格式,并保留YAML元数据。构建过程中,图像资源被存入assets目录,同时借助qwen3.5:2b多模态模型对图像进行俄语语义描述,生成捕捉对象类型与视觉细节的alt文本,最终形成涵盖文本与视觉信息的综合性语料库,为俄语桌面角色扮演游戏研究提供数据支撑。
特点
数据集聚焦于俄语桌面角色扮演游戏领域,内容覆盖规则、设定、角色与怪物等多维主题,语言以俄语为主并兼有英语。文本经清洗后以Markdown呈现,附带语义分块索引,每个分块控制在400至800词元,便于嵌入模型处理。图像描述针对俄语TRPG语境定制,且图像许可类型多样,包括CC-BY-SA、合理使用及公有领域,适应不同研究场景的合规需求。
使用方法
该数据集适用于检索增强生成系统、大语言模型微调及TRPG学术研究。使用者可通过documents.jsonl获取页面元数据,利用chunks.jsonl直接生成语义嵌入以构建检索索引,或加载markdown目录下的文档进行模型训练。图像资源以alt文本形式整合于文档中,可结合多模态模型进行跨模态任务。更新时依据仓库Makefile依次执行同步、下载、转换与RAG流程,确保数据时效性。
背景与挑战
背景概述
桌面角色扮演游戏(TTRPG)作为融合叙事、规则与协作的独特文化实践,其知识体系长期散落于社区维基与论坛之中,缺乏系统化整理。ttrpg-rpg-fandom-com-ru数据集由exnihilum.info团队创建并维护,于2024年前后释出,系对俄语RPG Fandom维基的全量转储,以Markdown格式集成YAML元数据与语义分块,旨在服务检索增强生成、大语言模型微调及TTRPG学术研究。该数据集填补了俄语圈层TTRPG结构化语料的空白,为跨语言文化计算与游戏研究提供了可复用的基础设施,亦呼应了维基知识向可计算形态转化的时代趋势。
当前挑战
该数据集所应对的领域问题在于:如何将社区维基中高度非结构化、多语言混杂且富含专有名词的TTRPG知识,转化为适配语义检索与生成任务的高质量语料。构建过程中,清洗Fandom平台复杂的Wiki标记并保留跨页链接结构殊为棘手,多模态标注则面临图像版权异质性的困扰——文本遵循CC-BY-SA许可,图像却可能适用合理使用或公有领域条款,法律边界模糊。此外,俄语TTRPG语境下的术语翻译与语义分块粒度调优,亦对自动化流程的领域适应性提出了严苛要求。
常用场景
经典使用场景
在桌面角色扮演游戏(TTRPG)的数字人文研究与自然语言处理交叉领域,该数据集最为经典的运用在于构建面向俄语TRPG知识体系的检索增强生成系统。研究者将indexes/chunks.jsonl中的语义分块经嵌入模型向量化后存入向量数据库,当用户输入关于规则判例、世界观设定或模组情节的查询时,系统从rpg.fandom.com/ru/的完整Markdown语料中召回相关段落,并驱动大语言模型生成有据可依的回答。该流程既可用于桌游主持人的实时备团辅助,也可支撑智能问答机器人的知识底座。
衍生相关工作
围绕该数据集已衍生出一系列具有延续性的工作。项目仓库中的Makefile流水线支持语料同步、转换与RAG索引的自动化重建,为后续迭代提供了工程范式。多模态标注采用qwen3.5:2b模型生成俄语图像描述,启发了面向TRPG视觉元素的细粒度语义标注研究。此外,documents.jsonl与chunks.jsonl的双层索引结构,被后续俄语领域检索评测与长文档问答任务借鉴,形成了从原始维基到可嵌入语义单元的可复用数据加工路径。
数据集最近研究
最新研究方向
在桌面角色扮演游戏(TTRPG)研究领域,俄语社区长期面临高质量结构化语料稀缺的困境,而该数据集通过将rpg.fandom.com/ru/维基全量转码为洁净Markdown并附带语义分块,为检索增强生成系统与语言模型微调提供了关键基础设施。当前前沿探索聚焦于利用其多模态注释——即经由qwen3.5:2b模型生成的俄语图像描述——来弥合文本规则与视觉素材之间的语义鸿沟,从而支撑沉浸式叙事生成与规则问答任务。这一资源亦回应了学界对非英语TTRPG知识体系进行可复现研究的呼吁,其CC-BY-SA许可与细粒度元数据设计,使得跨语言迁移学习和社区驱动的内容策展成为可能,对保护与活化俄罗斯角色扮演游戏文化遗产具有切实的推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务