遇见数据集

danbooru-rag-G-v3

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

该数据集是isek-ai/danbooru-wiki-2024(训练集分割)数据集的深度清洗和结构化版本,旨在解决原始Danbooru Wiki中的噪声问题,如原始URL、复杂的Textile标记、Wiki语法以及冗余或格式错误的别名,这些噪声会降低嵌入模型性能并混淆大语言模型。通过过滤低信息量标签,并专门设计了两个文本字段:embed_text(用于嵌入模型,以自然语言格式连接标签名称、别名和描述体,优化文本嵌入生成)和display_text(用于LLM提示上下文,以结构化键值格式便于RAG检索后注入)。数据集包含33807个训练样本,核心字段包括id、updated_at、other_names(别名列表)、category(标签类别,主要为general)、tag(原始Danbooru标签标识符)、embed_text、display_text以及validity。处理步骤包括使用正则表达式移除Wiki删除线、Textile链接、URL、HTML标题和表格语法,将项目列表转换为单行逗号分隔格式,并进行数据过滤(保留描述体长度超过30字符的条目,清理other_names字段,丢弃过长、纯数字或仅由标点组成的别名)。数据集适用于文本检索任务,特别针对动漫内容、检索增强生成(RAG)和提示工程。为保持轻量级,默认移除了character类别;完整数据集可在patvessel/danbooru-rag-v3中找到。提供多种格式:Hugging Face数据集格式、JSONL格式和Markdown格式(采用“块证明语义锚定”策略)。遵循CC BY-SA 4.0许可证,基于源数据集isek-ai/danbooru-wiki-2024,用于研究和创意AI应用。

This dataset is a deeply cleaned and structured version of the isek-ai/danbooru-wiki-2024 (training split) dataset. The original Danbooru Wiki contains significant noise, such as raw URLs, complex Textile markup, Wiki syntax, and redundant/malformed aliases, which degrade the performance of embedding models and confuse large language models. To address this, the dataset filters low-information tags and designs two text fields specifically for retrieval-augmented generation (RAG) and anime-domain semantic search: embed_text and display_text. It includes 33,807 training samples, with core fields: id, updated_at, other_names (list of aliases), category (tag category, mainly general), tag (original Danbooru tag identifier), embed_text (for embedding models, concatenating tag names, aliases, and description body in natural language format to optimize high-quality text embeddings), display_text (for LLM prompt context, in a structured key-value format with clear separators for seamless injection into LLM prompts after RAG retrieval), and validity. Key processing steps include using regex to precisely remove Wiki strikethrough [s], Textile links, raw URLs, HTML headings, and table syntax; automatically converting item lists into single-line comma-separated format to maintain semantic continuity; and data filtering (retaining entries with description body length over 30 characters, cleaning the other_names field, discarding aliases exceeding 100 characters, purely numeric, or consisting only of punctuation and spaces). The dataset is suitable for text retrieval tasks, particularly for anime content, RAG, and prompt engineering. For versatility and lightweight design, the character category is removed by default; the full dataset is available at patvessel/danbooru-rag-v3. It offers multiple formats: Hugging Face dataset format (default, for efficient loading with the datasets library), JSONL format (for use with pandas or custom scripts), and Markdown format (designed for no-code RAG services, employing a chunk-proof semantic anchoring strategy to ensure each vectorized chunk carries its tag identifier). The dataset follows the CC BY-SA 4.0 license, based on the source dataset isek-ai/danbooru-wiki-2024, and is intended for research and creative AI applications.

创建时间:
2026-05-29
原始信息汇总

数据集概述

数据集名称: patvessel/danbooru-rag-G-v3
数据集地址: https://huggingface.co/datasets/patvessel/danbooru-rag-G-v3

数据集描述

本数据集是 isek-ai/danbooru-wiki-2024(训练集)的深度清洗和结构化版本,专为检索增强生成(RAG)和动漫领域语义搜索优化。原始 Danbooru Wiki 包含大量噪声(如原始 URL、复杂的 Textile 标记、Wiki 语法及冗余/错误别名),影响嵌入模型效果并混淆大语言模型(LLMs)。为解决此问题,数据集过滤了低信息标签,并设计了两个专用文本字段:embed_text(用于嵌入模型)和 display_text(用于 LLM 提示上下文)。

核心改进:

  • 语法噪声去除: 使用正则表达式精确移除 Wiki 删除线 [s]、Textile 链接、原始 URL、HTML 标题 (h1.) 及表格语法。
  • 嵌入友好结构: 将项目符号列表(* list)自动转换为单行逗号分隔格式,保持向量化时的语义连续性。
  • 数据过滤:
    • 通用标签:仅保留描述正文长度大于 30 字符的条目。
  • 别名文本清理: 舍弃长度超过 100 字符、纯数字或仅包含标点空格等无效别名。

数据集结构

数据集包含以下核心字段:

字段名 类型 说明
id int64 标识符
updated_at string 更新时间
other_names list(string) 其他别名列表
category string 标签类别(主要为 general)
tag string 原始 Danbooru 标签标识符
embed_text string 为嵌入模型优化的自然语言格式文本,将标签名、别名和描述连接为流畅段落。
display_text string 为 LLM 提示上下文优化的结构化键-值格式文本,字段清晰分隔,便于 RAG 检索后注入提示上下文。
validity float32 有效性指标

数据集规模与划分

  • 训练集(train)
    • 样本数:33,807
    • 字节数:20,490,308
  • 总下载大小: 56,054,698 字节

数据样例

json { "tag": "tasting plate", "category": "general", "embed_text": "Danbooru tag tasting plate (also known as 味見皿). Ajimisara. A small plate like mamezara but for tasting soups.", "display_text": "tag: tasting plate category: general display: tasting plate also known as: 味見皿 description: Ajimisara. A small plate like mamezara but for tasting soups." }

任务类别与语言

  • 任务类别: 文本检索 (text-retrieval)
  • 语言: 英语 (en)
  • 标签: anime, danbooru, rag, prompt-engineering

许可协议

  • 许可: CC-BY-SA-4.0

文件格式与使用方式

数据集以多种格式提供:

  1. Hugging Face Dataset(默认): 使用 datasets 库加载。 python from datasets import load_dataset dataset = load_dataset("patvessel/anbooru-rag-G-v3") print(dataset["train"][0])

  2. JSONL 格式: 行分隔的 JSON 文件(anbooru-rag-G-v3.jsonl),适用于 pandas 或自定义脚本。 python import pandas as pd df = pd.read_json("anbooru-rag-G-v3.jsonl", lines=True)

  3. Markdown(.md)格式: 专为无代码 RAG 服务(如 AnythingLLM、Open WebUI、Dify)设计。采用“块内语义锚定”策略,每行描述和别名前明确标注标签标识符,确保无论分块策略如何,每个向量块都携带标签身份信息。

注意事项

  • 本数据集默认移除了“角色”类别,如需包含“角色”类别的完整大小数据集,请访问 patvessel/danbooru-rag-v3 数据集。
  • 关于数据集的更多信息,请参考该数据集的卡片。
搜集汇总
数据集介绍
danbooru-rag-G-v3 数据集图片
构建方式
本数据集源于isek-ai/danbooru-wiki-2024的训练子集,经过深度清洗与结构化重塑,以应对原始Danbooru Wiki中充斥的原始URL、复杂Textile标记、Wiki语法及冗余别名等噪声问题。构建过程中,通过正则表达式精准剔除Wiki删除线、Textile链接、HTML标题及表格语法,并自动将项目符号列表转换为逗号分隔的单行格式,以维持语义连续性。此外,仅保留描述正文超过30字符的通用标签条目,并清理别名字段,丢弃超过100字符、纯数字或仅含标点与空格的别名,最终生成一个紧凑且高质量的RAG专用数据集。
特点
本数据集的核心特色在于其双文本字段设计:'embed_text'字段采用自然语言格式,将标签名、别名及描述流畅串联,专为生成高质量文本嵌入而优化;'display_text'字段则采用清晰的结构化键值格式,便于RAG检索后无缝注入大语言模型的提示上下文中。同时,数据集移除了角色类别以保持轻量通用性,并提供多种文件格式(Hugging Face默认格式、JSONL及Markdown),其中Markdown文件通过“分块语义锚定”策略,确保在任意朴素分块策略下,每个向量化片段均保留标签身份,从而支持即开即用的无代码RAG服务。
使用方法
用户可通过Hugging Face的datasets库轻松加载本数据集,例如执行'load_dataset('patvessel/danbooru-rag-G-v3')'即可直接访问训练分片。对于偏好pandas的用户,仓库中提供JSONL格式文件,可使用'pd.read_json('danbooru-rag-G-v3.jsonl', lines=True)'进行读取。此外,Markdown格式专为AnythingLLM、Open WebUI或Dify等无代码RAG平台设计,直接导入即可利用内置分块策略实现高效检索。若需包含角色类别的完整版数据集,请参阅patvessel/danbooru-rag-v3数据集。
背景与挑战
背景概述
Danbooru-rag-G-v3数据集创建于2024年,由研究者patvessel基于isek-ai/danbooru-wiki-2024数据集进行深度清洗与结构化处理而构建。该数据集聚焦于动漫领域标签与描述的语义增强,核心研究问题在于如何从包含大量噪声的Danbooru Wiki中提取高质量信息,以服务于检索增强生成和动漫领域语义搜索。通过去除语法噪声、优化嵌入表示并过滤低质量条目,该数据集显著提升了嵌入模型与大语言模型在动漫多模态内容理解上的性能,为相关学术研究与创意AI应用提供了标准化、低噪声的文本基准资源。
当前挑战
本数据集致力于解决的领域挑战在于,原始Danbooru Wiki中混杂大量原始URL、复杂Textile标记、Wiki语法及冗余别名,这些语言噪声严重干扰嵌入模型的向量化质量并导致大语言模型理解偏差。构建过程中面临的核心难题包括:通过正则表达式精确剥离多种语法噪声的同时保留语义完整性;将项目列表自动转换为逗号分隔的单行格式以维持向量化时的语义连贯性;过滤描述长度小于30字符的低信息条目;清洗别名字段,剔除超长、全数字或纯标点空白等无效内容。此外,还需针对无自定义分割逻辑的平台,设计“分块抗性语义锚定”策略,确保切分后每个分块仍携带标签标识,从而保障跨场景下的检索与生成稳定性。
常用场景
经典使用场景
该数据集专为动漫领域的检索增强生成(RAG)与语义搜索场景而设计。其核心用途在于构建高性能的文本嵌入模型与语言模型提示工程管道。通过精心设计的 embed_text 与 display_text 两个字段,数据集分别优化了向量化表征质量与大型语言模型的上下文注入效果,成为连接动漫标签知识与生成式AI推理的桥梁。
衍生相关工作
该数据集源于对 isek-ai/danbooru-wiki-2024 训练集分区的深度清洗与结构化改造。其衍生工作包括针对完整角色类别数据的扩展版本(patvessel/danbooru-rag-v3),以及后续可能涌现的基于该数据集的嵌入模型微调工作、RAG管道优化研究,或是利用其 clean 标签数据训练更鲁棒的动漫领域语义解析系统,形成从数据治理到模型应用的研究链条。
数据集最近研究
最新研究方向
在二次元图像生成与多模态理解的前沿探索中,数据质量与语义对齐的瓶颈日益凸显。danbooru-rag-G-v3数据集针对Danbooru Wiki中混杂的原始URL、纺织标记及冗余别名等噪声问题,通过精确的规则过滤与字段重构,打造出专为检索增强生成(RAG)架构优化的embed_text与display_text双模态语义字段。这一设计不仅提升了嵌入模型在动漫领域向量化过程中的语义连续性,更通过“防块式语义锚定”策略确保大语言模型在读取时保持标签身份的清晰映射,从而在角色识别、标签联想与创意提示工程等下游任务中实现更精准的知识注入。该数据集的发布标志着动漫社区在缓解语言模型幻觉、提升领域检索效率方面迈出了结构化清理与格式标准化的重要一步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务