遇见数据集

Godot官方文档V4.7

收藏
魔搭社区2026-08-16 更新2026-08-16 收录
官方服务:

资源简介:

# Godot Engine 官方文档数据集(4.7 英文 stable) 本数据集由 Godot Engine 官方文档的 HTML 构建产物(Sphinx 导出)清洗转换而来, 适用于 **检索增强生成(RAG)**、**大模型微调**、**文档问答** 等场景。 ## 数据来源与许可(双许可,注意区分) - 原始数据:`godot-docs-html-stable`(Godot 4.7 分支,英文文档) - 官方文档版权归 Godot Engine 社区所有,采用**双许可**: - **`classes/`(类与 API 参考,本数据集 1079/1590 篇)** → **MIT** 许可 - **其余内容(tutorials / getting_started / community / about / engine_details)** → **CC BY 3.0** 许可 - **署名要求(CC BY 3.0 硬性义务)**:使用、转载、再分发必须署名 *"Juan Linietsky, Ariel Manzur and the Godot Engine community"*。 - 代码示例随对应内容适用上述许可(类参考中的代码示例为 MIT)。 ## 数据集结构 单文件 `data.jsonl`,每行一条 JSON 记录,字段说明: | 字段 | 类型 | 说明 | |------|------|------| | `id` | string | 去重主键,等于相对路径(如 `classes/class_aabb.html`) | | `title` | string | 页面标题(已去除 “Godot Engine … documentation” 品牌后缀) | | `category` | string | 一级分类(见下方统计) | | `path` | string | 相对原始路径 | | `text` | string | 清洗后的正文纯文本(Markdown 风格,已去除导航/脚本/样式/侧边栏/锚点符号) | ## 数据量统计 - 总文档数:**1590** - 正文总字符数:约 **1403 万**(14,035,868) - 按分类分布: | 分类 | 文档数 | |------|--------| | classes(类与 API 参考) | 1079 | | tutorials(教程) | 392 | | engine_details(引擎内部细节) | 66 | | getting_started(入门) | 33 | | community(社区) | 12 | | about(关于) | 7 | | root(首页等) | 1 | ## 使用方法 通过魔塔社区 `datasets` 库加载: ```python from datasets import load_dataset ds = load_dataset("JSON", data_files="data.jsonl")["train"] print(ds[0]["title"]) print(ds[0]["text"][:500]) ``` 或使用魔塔社区 SDK: ```python from modelscope import MsDataset ds = MsDataset.load("本地路径/godot数据集", subset_name="default") for item in ds: print(item["title"], len(item["text"])) ``` 用于 RAG 检索时,可将 `text` 切片后做向量化建库;`title` + `path` 可作为来源标注。 ## 处理说明 - 仅保留 `role="main"` / `class="document"` 的主内容区,移除 `<script>`、`<style>`、 `<nav>`、`<footer>`、`<header>` 及侧边栏等噪音。 - 正文由 HTML 经 `html2text` 转写为 Markdown 风格纯文本,保留标题层级与代码块, 去除图片与相对链接,清理 Sphinx 锚点符号( / ¶)。 - 已剔除 `search.html`、`genindex.html`、`404.html` 等无正文价值的页面。 - 文档为英文;如需中文版,请使用对应语言分支的 HTML 重新生成。

提供机构:
maas
创建时间:
2026-08-08
二维码
社区交流群
二维码
科研交流群
商业服务