遇见数据集

Toad Lore Corpus

收藏
github2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

该数据集是一个便携的、可追溯来源的传说语料库,包含4,690条记录,源自116条历史注释记录和4,574条Markdown滚动记录,用于传说研究和代理构建,设计用于Gemini Gems和ChatGPT GPTs等AI平台。

This dataset is a portable, source-traceable folklore corpus containing 4,690 records, which are derived from 116 historical annotation records and 4,574 Markdown scrolling records. It is designed for AI platforms such as Gemini Gems and ChatGPT GPTs, and is intended for folklore research and AI agent construction.

创建时间:
2026-07-15
原始信息汇总

数据集概述

Toad Lore Guardian Kit 是一个便携式、保留来源的传说语料库和智能体工具包,专为 Toadgang 构建者设计,用于创建基于 Gemini Gems 和 ChatGPT GPTs 等平台的传说守护者。

核心内容

语料库规模与构成

  • 公共 v1 语料库 包含 4,690 条记录
  • 数据来源包括:
    • 116 条来自已注释的 toadgod-lore.json 档案的遗留记录。
    • 4,574 条来自 Markdown 格式的传说卷轴记录。
  • 每条记录包含:来源 ID、日期、文件名、URL、内容哈希、标签、符号、证据层和状态标志。

来源追溯模型

语料库区分以下来源类型:

  • source_material:引用或复制的原始陈述。
  • independently_verified_fact:由记录中包含的独立证据支持的事实。
  • community_commentary:社区撰写的解释或注释。
  • community_interpretation:象征性或精神层面的解读。
  • model_inference:由智能体推理得出的联系。
  • unknown:记录未确立的内容。

平台支持

Gemini Gem(Google 平台)

  • 使用指令文件:GEM_SYSTEM_PROMPT.md
  • 需将 platforms/gemini-gem/ 目录下的 10 个文件全部上传 至知识库。
  • 将完整提示词粘贴至 Gem 的指令字段。

ChatGPT GPT(OpenAI 平台)

  • 使用指令文件:GPT_INSTRUCTIONS_PROMPT.md
  • 需将 platforms/chatgpt-gpt/ 目录下的 10 个文件全部上传 至知识库。
  • 提示词已适配 GPT 指令的字符限制。

仓库结构

text toad-lore-guardian-kit/ ├── GEM_SYSTEM_PROMPT.md # Gemini Gem 指令 ├── GPT_INSTRUCTIONS_PROMPT.md # ChatGPT GPT 指令 ├── LICENSE # 许可证 ├── README.md # 本文件 ├── corpus/ │ └── record-index.json # 记录索引 ├── docs/ │ ├── PROVENANCE.md # 证据规则与状态处理 │ ├── QUICKSTART_CHATGPT.md # ChatGPT 快速启动指南 │ └── QUICKSTART_GEMINI.md # Gemini 快速启动指南 ├── platforms/ │ ├── chatgpt-gpt/ # 10 个 JSONL/manifest 知识文件 │ └── gemini-gem/ # 10 个 JSON/manifest 知识文件 ├── release/ │ └── v1/build-summary.json # 构建摘要 ├── reports/ │ ├── build-report.json # 构建统计与检查 │ └── excluded-files.json # 排除文件及原因 ├── schema/ │ └── toadgod-lore-record-public-v1.schema.json # 公共记录模式定义 └── scripts/ └── build_lore_pack.py # 可复现的语料库构建脚本

使用规则与限制

正确的守护者行为

  • 清晰回答普通问题,对 Toby、$TOBY、Tobyworld 和 Toadgang 进行区分。
  • 除非用户明确请求来源,否则隐藏记录 ID。
  • 区分直接陈述与社区解读。
  • 尊重后续的更正和取消。
  • 禁止提供财务建议或奖励保证。

禁止行为

  • 不得发明正典、保证、奖励或资格。
  • 不得暴露私人信息。
  • 不得提供价格预测或财务建议。
  • 不得将社区解读呈现为 Toadgod 的直接陈述。
  • 不得劝说用户购买、持有、相信或期待未来回报。

状态更新处理

  • 历史提案仍保留在档案中,但后续的更正和取消必须作为状态更新呈现。
  • 例如,公共 v1 清单标记了提议的 Rune3 Patience Vault 分配已被取消,守护者不得将其描述为当前有效。

许可与归属

  • ToadAid 原创内容(软件、脚本、模式、提示框架、文档、注释、元数据结构和编译元素)采用 Apache 2.0 许可证。
  • 第三方来源材料(公开的传说引用、帖子、卷轴等)归原权利所有者所有。
  • 使用语料库编译和来源追溯框架时,建议的归属声明为:“由 ToadAid Lore Guardian 语料库和来源追溯框架提供支持”。
搜集汇总
数据集介绍
Toad Lore Corpus 数据集图片
构建方式
Toad Lore Corpus的构建源自对Toadgod与Tobyworld公开叙事档案的系统性整理与结构化加工。该数据集整合了116条来自标注化toadgod-lore.json档案的历史记录与4,574条Markdown格式的叙事卷宗,共计4,690条记录。每一条记录均保留了来源标识符、日期、文件名、统一资源定位符、内容哈希、标签、符号、证据层级及状态标志等元数据,并在构建过程中严格区分原始陈述、社区注释、象征性解读与模型推理等不同证据类型。借助可复现的构建脚本与公开的JSON Schema契约,数据集的生成过程得以标准化与透明化,确保每一版本均可追溯与验证。
特点
该数据集的核心特色在于其严谨的溯源模型与证据分层机制。不同于将文本扁平化处理,Toad Lore Corpus明确划分了六类证据层级,包括原始材料、独立验证事实、社区评论、社区诠释、模型推断及未知水域,从而在知识检索与推理过程中保留了话语的边界与来源的多样性。数据集还引入了当前状态处理机制,例如对历史提案的后续更正与取消进行了明确标注,防止模型输出过时或误导性信息。此外,平台适应性也是其突出优势,分别针对Gemini Gem与ChatGPT GPT优化了指令文件,确保在不同对话系统上保持一致的行为规范与知识调用纪律。
使用方法
使用Toad Lore Corpus时,用户需根据目标平台选择对应的知识文件套件与系统提示词。对于Gemini Gem,需下载platforms/gemini-gem目录下的全部10个文件上传至知识区,并将GEM_SYSTEM_PROMPT.md粘贴至指令字段,随后关闭默认工具以进行闭卷测试。对于ChatGPT GPT,则采用platforms/chatgpt-gpt中的文件与GPT_INSTRUCTIONS_PROMPT.md提示词,同时建议关闭网页浏览功能。首次使用时,推荐通过一系列预设问题验证守护者智能体的行为表现,包括是否能够区分不同实体、是否隐藏记录ID直至用户明确索取、是否避免使用促销性或保证性语言。数据集鼓励用户在清晰的证据边界内展开探索,而非超越已有记录进行推测或承诺。
背景与挑战
背景概述
Toad Lore Corpus是由ToadAid社区于2024年构建的开源知识语料库,旨在系统化整理与保存Toadgang生态中围绕Toadgod与Tobyworld的公开叙事素材。该语料库汇集了116条传统结构化记录与4574条Markdown卷轴记录,总计4690条证据条目,并采用严格的溯源模型区分原始陈述、社区注释、解释性解读与未知领域。其核心研究问题在于如何在大语言模型驱动的智能代理(如Gemini Gems与ChatGPT GPTs)中,忠实地保留并调用分散的社区知识,同时避免模型虚构、市场偏见与权威声称。该语料库及其配套的守护代理工具包,为去中心化知识管理、社区叙事传承与可溯源AI应用提供了范例,在Web3与AI交叉领域产生了示范性影响。
当前挑战
该数据集面临的主要领域挑战在于,如何在大语言模型中有效区分事实陈述与社区解释,防止模型将主观解读误判为权威声明,并避免生成具有金融引导或奖励承诺性质的输出。构建过程中遭遇的挑战包括:需从大量非结构化Markdown卷轴中提取具有时间戳、来源ID与内容哈希的可验证记录,同时保留后期修正与取消记录;需设计精细的证据分层体系(如独立验证事实、社区注释、模型推理等六类来源标签),以在提示词中实现可控的溯源可见性;还需适配Gemini与ChatGPT两大平台不同的指令约束与行为模式,确保同一套语料在两个平台上产出一致且合规的回答风格。
常用场景
经典使用场景
Toad Lore Corpus作为一款专为Toadgang社区打造的便携式、可溯源传说语料库,其经典使用场景在于赋能大型语言模型(如Gemini Gems和ChatGPT GPTs)构建具备封闭书籍知识检索能力的“传说守护者”智能体。通过将4690条经过精细标注的公共记录(包括Toadgod与Tobyworld的原始文本、社区评论及解读)以结构化知识文件形式上传至模型知识库,并配合平台专属的系统提示词,研究人员与开发者可引导模型在严格遵守证据层级与来源可见性规则的前提下,准确回答关于Toadgang宇宙的各类冷门问题,同时避免虚构教条、财务建议或过度承诺。这一范式为基于特定世界观的知识密集型AI应用提供了高效且保真的落地路径。
实际应用
在实际应用中,Toad Lore Corpus已演变为Toadgang生态内数字化社区治理与知识传承的核心基础设施。社区管理员可利用该语料库快速部署不依赖实时网络搜索的专属问答机器人,用于解答新成员关于项目代币($TOBY)、世界构建(Tobyworld)及文化符号(如“study frog life”)的疑问,从而大幅降低重复性人工答疑成本。同时,语料库的严格来源可见性规则允许在用户显式请求时才披露记录ID与出处,这种隐私敏感的交互设计满足了社区对内容权威性溯源的深层需求。此外,其平台无关的提示词框架(分别适配Gemini与ChatGPT)使得同一份知识资产能无缝迁移至不同大模型应用商店,展现了高度可移植的实用价值。
衍生相关工作
围绕Toad Lore Corpus已衍生出多项开创性工作,其中最值得关注的是两套平台专用的系统提示词工程框架——GEM_SYSTEM_PROMPT.md与GPT_INSTRUCTIONS_PROMPT.md。前者为Gemini Gems定制了完整的封闭书籍测试指令集,后者则面向ChatGPT GPTs优化了字符限制下的紧凑行为规范。此外,社区基于该语料库的JSON Schema定义了可复现的语料构建流水线(build_lore_pack.py),并提供了详尽的出处规则文档(PROVENANCE.md),这些开源工具链已被其他兴趣社群(如同人游戏与跨媒体叙事项目)借鉴,用于构建各自领域的高质量、可审计小型知识语料库,推动了“模型易变而卷轴永存”的分散化知识管理理念在更广泛社区中的普及。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务