遇见数据集

Netruk44/uesp-wiki-content

收藏
Hugging Face2023-04-10 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: namespace dtype: int64 - name: page_id dtype: int64 - name: url dtype: string - name: title dtype: string - name: content dtype: string - name: revision_id dtype: int64 - name: timestamp dtype: string - name: contributor dtype: string - name: content_cleaned dtype: string splits: - name: train num_bytes: 757966297 num_examples: 324930 download_size: 363485644 dataset_size: 757966297 license: other language: - en size_categories: - 100K<n<1M --- # Dataset Card for "uesp-wiki-content" This dataset contains the content of the pages from the [Unofficial Elder Scrolls Pages](https://en.uesp.net/wiki/Main_Page). **License**: The contents of this dataset are licensed under the [Creative Commons by-sa 2.5 License](http://creativecommons.org/licenses/by-sa/2.5/). **Source**: * The content of this dataset was taken from the [dumps](http://dumps.uesp.net/) subdomain of [uesp.net](https://uesp.net) * The contents of this dataset come from the file named "`uespwiki-2022-02-09-current.xml.bz2`", as that was the most recent version available at the time of dataset creation. * The archive file was processed by [mediawiki-dump](https://github.com/macbre/mediawiki-dump) * Using [my own fork](https://github.com/Netruk44/mediawiki-dump/tree/namespace-fix) to fix a bug with cleaning the text. **Caveats**: * The `content_cleaned` column has some known issues. * Words may occasionally be missing if they were a special link type in the original content.

该数据集包含来自Unofficial Elder Scrolls Pages(UESP)的页面内容。数据来源于uesp.net的dumps子域,具体是从名为uespwiki-2022-02-09-current.xml.bz2的文件中提取的,并使用mediawiki-dump工具进行处理。数据集的特征包括namespace、page_id、url、title、content、revision_id、timestamp、contributor和content_cleaned等字段。数据集分为训练集,包含324,930个样本,总大小为757,966,297字节。许可证为Creative Commons by-sa 2.5 License。

提供机构:
Netruk44
原始信息汇总

数据集概述

数据集名称

uesp-wiki-content

数据集内容

包含来自Unofficial Elder Scrolls Pages的页面内容。

数据集特征

  • namespace: int64
  • page_id: int64
  • url: string
  • title: string
  • content: string
  • revision_id: int64
  • timestamp: string
  • contributor: string
  • content_cleaned: string

数据集分割

  • train:
    • 数据量: 757966297 字节
    • 示例数: 324930

数据集大小

  • 下载大小: 363485644 字节
  • 数据集大小: 757966297 字节

许可证

Creative Commons by-sa 2.5 License

语言

  • en

大小分类

100K<n<1M

注意事项

  • content_cleaned 列存在已知问题,可能偶尔缺少特殊链接类型的单词。
搜集汇总
数据集介绍
构建方式
在开放世界角色扮演游戏《上古卷轴》系列的庞大知识体系中,Unofficial Elder Scrolls Pages(UESP)作为非官方维基百科,汇聚了详尽的游戏设定与背景资料。Netruk44/uesp-wiki-content数据集正是源自UESP的页面内容,其构建过程严谨而系统。数据源取自UESP官方提供的dump文件,具体为2022年2月9日发布的“uespwiki-2022-02-09-current.xml.bz2”版本,确保了数据的时效性与权威性。通过mediawiki-dump工具进行解析,并借助定制化分支修复了文本清理中的命名空间漏洞,最终生成了包含页面命名空间、ID、URL、标题、原始内容、修订版本、时间戳、贡献者及清洗后内容等字段的结构化数据集,共计324,930条训练样本。
使用方法
使用该数据集时,用户可直接通过HuggingFace的`datasets`库加载,指定数据集名称`Netruk44/uesp-wiki-content`即可获取训练分割。数据集以JSON格式存储,包含九个字段,其中`content`保留原始维基标记,适合需要保留格式信息的任务;而`content_cleaned`则提供了更干净的文本,适用于下游模型训练。建议在使用前检查`content_cleaned`字段的完整性,必要时结合`content`字段进行补充或二次清洗。对于游戏领域研究,可基于此数据构建《上古卷轴》相关的聊天机器人、知识图谱或文本分类模型。由于采用Creative Commons by-sa 2.5许可,使用者需遵守署名与相同方式共享的条款。
背景与挑战
背景概述
《上古卷轴》系列作为开放世界角色扮演游戏的典范,其庞大的世界观和丰富的文本资料一直是游戏文化研究的重要对象。由Netruk44于2022年创建的数据集uesp-wiki-content,源自非官方上古卷轴页面(UESP)的Wiki内容,旨在系统化整理该游戏宇宙的百科知识。该数据集收录了约32.5万条页面记录,涵盖命名空间、页面ID、标题、原始内容及清洗后文本等字段,为自然语言处理、游戏知识图谱构建及文本挖掘领域提供了高质量语料库。其影响力体现在:首次将UESP的社区协作内容以结构化形式开放,成为研究游戏叙事、虚构世界语言模型训练的基础资源。
当前挑战
该数据集面临的核心挑战包括:其一,Wiki文本的领域特殊性——上古卷轴系列包含大量虚构专有名词、任务描述和跨页面链接,通用自然语言处理模型难以准确解析其语义,需定制词汇表和领域适应策略。其二,数据清洗的复杂性——原始内容中的特殊链接类型可能导致content_cleaned字段出现词汇遗漏,影响下游任务的数据完整性。其三,版权与许可限制——采用CC BY-SA 2.5许可协议,要求衍生作品须保持相同开放权限,限制了商业场景的应用。此外,数据集仅基于2022年快照,缺乏增量更新机制,难以反映UESP社区的持续编辑动态,可能制约长期时效性研究的需求。
常用场景
经典使用场景
在自然语言处理与计算语言学的研究版图中,UESP Wiki Content数据集以其对《上古卷轴》系列游戏世界知识的系统化收录而独树一帜。该数据集囊括了来自非官方上古卷轴百科(UESP)的逾32万篇页面内容,涵盖角色传记、地理志、任务描述、物品图鉴等多元文本类型,经清洗后保留了结构化的标题、正文与元数据。研究者常将其作为领域特定语言建模的优质语料库,用于训练能够理解游戏叙事逻辑与虚构世界观的语言模型,或在多模态学习任务中作为文本-知识对齐的基准资源。其丰富的命名实体与复杂的世界观关联性,亦使其成为知识图谱构建与推理任务中的理想测试平台。
解决学术问题
该数据集为学术研究提供了破解领域自适应与低资源文本理解难题的关键钥匙。传统语言模型在泛化至高度专业化的游戏叙事文本时,常因缺乏领域先验知识而表现不佳,而UESP Wiki Content通过提供大量标注清晰、主题聚焦的文本,助力研究者探索如何将通用预训练模型迁移至特定虚构世界。它有效支撑了关于知识密集型问答、跨文档实体消歧以及叙事连贯性建模的实证研究,推动了少样本学习与提示工程在非标准文本域中的方法论创新。这一数据资源的意义在于,它揭示了大规模开放域知识库与封闭虚构知识体系之间的语义鸿沟,为构建更鲁棒的领域语言理解系统奠定了数据基础。
实际应用
在实际应用层面,UESP Wiki Content数据集为游戏智能交互系统的开发注入了核心动力。基于该数据训练的检索增强生成模型,能够为玩家提供精准的攻略查询、任务指引与角色背景解析,显著提升游戏内问答助手的响应质量。此外,该数据集可被用于构建自动化游戏维基维护工具,辅助社区编辑者完成内容分类、链接修复与版本差异检测。在沉浸式叙事生成领域,它作为创意写作的灵感源泉,支持程序化生成符合《上古卷轴》世界观的支线剧情与对话文本,从而降低游戏开发中手动撰写海量叙事内容的成本。
数据集最近研究
最新研究方向
基于大规模开放世界游戏维基文本的知识图谱构建与自然语言处理应用研究。该数据集收录了《上古卷轴》系列非官方维基(UESP)中超过32万页面的完整内容,涵盖游戏世界观、角色、物品、任务等深度结构化信息。当前前沿方向聚焦于利用此类高度专业化、叙事连贯的文本语料,训练面向开放世界游戏的对话式AI助手、剧情生成模型及交互式知识问答系统。随着大型语言模型在垂直领域应用的兴起,UESP数据集为游戏内智能NPC、动态叙事引擎和玩家辅助工具提供了稀缺的领域对齐训练资源,其跨页面链接结构也为图神经网络与知识推理研究开辟了独特实验场。该资源推动了电子游戏文本挖掘从基础解析向语义理解与生成式AI的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务