遇见数据集

SearchGen-20K

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

SearchGen-20K 是一个用于训练、分析和审计搜索增强图像生成行为的数据集,与题为《Search Beyond What Can Be Taught》的研究论文(arXiv:2607.05382)相关联。该研究旨在推动代理视觉生成中的知识边界,其核心机制是在图像生成前进行信息检索,以弥补生成模型的知识盲区。数据集包含 20,188 个训练提示的元数据,以及与之配套的完整生成过程追踪记录、生成的图像和统一的评估侧文件。具体规模包括:96,848 条追踪记录、283,493 张已发布的生成图像和同等数量(283,493)的评估侧文件。数据内容主要分为几个部分:1) 训练提示元数据(`train_metadata.jsonl`);2) 详细的生成过程追踪输出(`trace_artifacts.jsonl`);3) 生成的图像清单(`generation_artifacts.jsonl`,图像数据以 TAR 分片形式存储);4) 评估者输出的侧文件清单(`judge_artifacts.jsonl`);5) 用于连接生成图像与评估文件的索引清单(`generated_image_eval_inventory.tsv`)。训练提示元数据通过 `reference_slots` 等字段链接到独立的十亿级搜索语料库数据集(SearchGen-Corpus-1M),体现了“先检索后生成”的流程。内部各文件通过 `row_id`、`trace_id`、`generation_id` 等字段相互关联。该数据集主要用于搜索增强图像生成模型的训练、行为分析和算法审计。评估基准数据集(SearchGen-Bench)是独立的。

SearchGen-20K is a dataset for training, analyzing, and auditing search-augmented image generation behavior, associated with the research paper titled Search Beyond What Can Be Taught (arXiv:2607.05382). This research aims to advance the knowledge boundaries in agent-based visual generation, with a core mechanism of information retrieval before image generation to address the knowledge gaps in generative models. The dataset includes metadata for 20,188 training prompts, along with complete generation process trace records, generated images, and unified evaluation side files. The specific scale comprises: 96,848 trace records, 283,493 published generated images, and an equal number (283,493) of evaluation side files. The data content is mainly divided into several parts: 1) training prompt metadata (`train_metadata.jsonl`); 2) detailed generation process trace outputs (`trace_artifacts.jsonl`); 3) generated image inventory (`generation_artifacts.jsonl`, with image data stored in TAR shards); 4) evaluator output side file inventory (`judge_artifacts.jsonl`); 5) index inventory for linking generated images with evaluation files (`generated_image_eval_inventory.tsv`). The training prompt metadata is linked to an independent billion-scale search corpus dataset (SearchGen-Corpus-1M) through fields like `reference_slots`, reflecting the retrieve-then-generate workflow. Internal files are interconnected via fields such as `row_id`, `trace_id`, and `generation_id`. This dataset is primarily used for training search-augmented image generation models, behavior analysis, and algorithm auditing. The evaluation benchmark dataset (SearchGen-Bench) is independent.

创建时间:
2026-07-12
原始信息汇总

SearchGen-20K 数据集详情

基本信息

  • 任务类别: 文本到图像(Text-to-Image)
  • 许可证: Apache-2.0
  • 项目名称: Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
  • 相关链接:
    • arXiv: https://arxiv.org/abs/2607.05382
    • 项目页面: https://haozheh3.github.io/SearchGen/
    • GitHub: https://github.com/HaozheH3/SearchGen
    • 关联数据集: SearchGen-Corpus-1M (https://huggingface.co/datasets/JasperHaozhe/SearchGen-Corpus-1M) 和 SearchGen-Bench (https://huggingface.co/datasets/JasperHaozhe/SearchGen-Bench)

数据集统计

统计项 数量
训练提示词(Prompts) 20,188
追踪记录(Traces) 96,848
已发布的生成图像 283,493
已发布的评估侧车文件 283,493

数据集用途

用于训练、分析或审计搜索增强的图像生成行为。提供提示词元数据、指向搜索语料库的参考槽链接、追踪级流水线输出、生成图像记录以及评估侧车记录。

主要文件

文件路径 说明
metadata/train_metadata.jsonl 每行对应一个训练提示词
metadata/train_metadata_manifest.json 训练元数据的来源和行数清单
metadata/id_summary.json 公开ID摘要
metadata/trace_index.jsonl 紧凑型追踪可用性索引
traces/trace_artifacts.jsonl 每条追踪的阶段输出
traces/generation_artifacts.jsonl 生成图像清单(本次不含图像载荷)
traces/judge_artifacts.jsonl 评估侧车记录清单
traces/generated_image_eval_inventory.tsv TSV格式,关联生成图像与评估文件

交叉引用关系

  • 训练行与 SearchGen-Corpus-1M 的关联字段:

    • reference_slots[].query_id
    • reference_slots[].entry_id
    • reference_slots[].asset_id
    • reference_slots[].asset_portable_path
    • search_query_ids
  • 追踪和生成文件内部关联字段:

    • row_id
    • trace_id
    • lane_id
    • reasoner_id
    • row_source_path
    • lane_source_path
    • generation_id
    • judge_id
  • 基准测试: 独立于本训练集,详见 SearchGen-Bench 数据集。

路径根目录说明

  • row_source_pathlane_source_path:相对于原始生成工件根目录。
  • image_path:相对于最终发布的 data_release/searchgen-20k/generated_artifacts/
  • 评估侧车定位字段:相对于 data_release/searchgen-20k/generated_artifacts/
  • composition_source_file_paths:使用相同根目录 data_release/searchgen-20k/generated_artifacts/
  • reference_slots[].asset_portable_path:相对于 ../searchgen-corpus-1m/

数据发布说明

包含283,493张生成图像以及每张图像对应的经过清洗的统一评估协议侧车文件。在Hugging Face上以确定性纯TAR分片形式存储于 data/generated/ 目录下,成员路径与发布的 generated_images/ 布局一致。分片信息见 data/generated/shards.jsonl,包含规范路径、TAR成员、大小和SHA256校验值。

权利与下架

权利问题和下架请求请联系:jasper.whz@outlook.com

引用

bibtex @article{wang2026searchgen, title = {Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation}, author = {Wang, Haozhe and Feng, Weijia and Yu, Jinpeng and Liu, Che and Nie, Ping and Lin, Fangzhen and Liu, Jiaming and Huang, Ruihua and Lin, Jimmy and Chen, Wenhu and Wei, Cong}, journal = {arXiv preprint arXiv:2607.05382}, year = {2026}, url = {https://arxiv.org/abs/2607.05382} }

搜集汇总
数据集介绍
SearchGen-20K 数据集图片
构建方式
SearchGen-20K数据集是为探索搜索增强型图像生成行为而构建的高质量训练数据集,包含20,188条训练提示词及其对应的元数据、轨迹记录、生成图像与评判侧边记录。其构建流程始于对提示词进行多阶段追踪,每条提示词通过搜索语料库链接至参考槽位,经由轨迹记录(96,848条)捕获管道中各阶段的输出状态,最终生成283,493张图像并配备统一的评判协议侧边文件。数据以JSONL格式存储元数据与轨迹,采用确定性平TAR分片组织图像文件,确保数据可复现性与完整性。
特点
该数据集的核心特色在于其系统性记录搜索增强型视觉生成行为的能力。通过轨迹文件详细追踪从提示词输入到图像生成的完整管道,涵盖reasoner、lane等中间组件输出。训练提示元数据通过reference_slots字段与SearchGen-Corpus-1M搜索语料库建立多维度跨引用,支持对搜索查询、条目与资产的细粒度关联分析。同时提供283,493个标准化评判侧边文件,便于自动化评估生成图像质量,并预留图像负载以适配不同存储场景。
使用方法
使用者可通过HuggingFace上的数据集卡片直接加载训练元数据(train_metadata.jsonl),结合轨迹文件(trace_artifacts.jsonl)与生成清单(generation_artifacts.jsonl)复现管道行为。图像文件以确定性TAR分片形式存放于data/generated目录,通过shards.jsonl索引文件可解析规范路径、分片成员、文件大小与SHA256校验值。如需评估,可依据generated_image_eval_inventory.tsv文件关联生成图像及其评判侧边文件,集成评估协议。此外,训练提示与SearchGen-Corpus-1M语料库的跨引用设计便于研究者分析搜索对生成质量的影响。
背景与挑战
背景概述
SearchGen-20K数据集由香港科技大学、滑铁卢大学、通义千问应用团队及帝国理工学院等机构的研究人员于2026年联合创建,旨在解决文本到图像生成模型在知识边界外的幻觉问题。传统生成模型面对未见知识时倾向于捏造细节,而SearchGen-20K通过引入搜索增强机制,使模型能够主动检索外部知识库并判断何时不宜生成图像。该数据集包含超过2万条训练提示语、约9.7万条追踪记录及28.3万张生成图像与评估文件,为验证搜索驱动的视觉生成范式提供了标准化训练与审计平台。其研究对推动生成式AI从“记忆驱动”向“知识驱动”转型具有里程碑意义,尤其在减少事实性错误、提升领域外场景生成可靠性方面影响深远。
当前挑战
当前核心挑战包括两层面。领域问题层面:文本到图像生成面临知识边界的刚性约束,模型常对训练分布外的概念(如稀有实体、最新事件)产生视觉幻觉,严重阻碍其在科学研究、新闻报道等高风险场景的部署。构建过程中:数据集需要解决搜索-生成的动态协同问题,包括如何高效索引百万级语料库、设计延迟敏感的查询-引用链路(平均每提示产生约4.8条引用记录),以及构建无偏评估协议——超28万张生成图像均需配对标准化审判侧车文件,确保自动与人工评价的一致性。此外,图像与搜索语料间的版权追溯机制也是构建中的关键法律与工程挑战。
常用场景
经典使用场景
SearchGen-20K 数据集专为训练和评估基于搜索增强的智能体视觉生成模型而设计。在图像生成任务中,模型常因缺乏外部知识而编造不存在的细节。该数据集通过对每一训练提示提供详细的元数据、搜索引用痕迹、生成图像及裁判评估记录,使得研究人员能够构建和优化一个具备检索能力的生成管道。其经典使用方式是将提示文本与搜索语料库中的参考条目关联,让模型在生成图像前先从大规模知识库中检索相关信息,从而提升生成内容的真实性和准确性。
解决学术问题
该数据集核心解决了视觉生成模型在处理超出其训练数据分布的知识边界时表现出的‘幻觉’问题。传统文本到图像模型在面对小众、专业或动态更新的概念时,往往生成不合理或错误的内容。SearchGen-20K 通过引入可追溯的搜索引用机制,让模型能够‘先查询,后生成’,并配备完整的裁判评估侧车文件以衡量生成质量,从而为学术界提供了一种系统化的方法,来研究如何将外部知识检索与条件生成深度耦合,拓展模型的知识覆盖范围并提升可信度。
衍生相关工作
基于 SearchGen-20K 的发布,后续研究可沿多个方向展开:一是开发更高效的搜索-生成管道,例如探索端到端的可微检索机制;二是利用其痕迹记录进行模型可解释性研究,分析检索到的信息如何影响生成图像中的具体像素区域;三是构建对抗性基准,测试模型在面对语料库中不完美或矛盾信息时的鲁棒性;四是将其裁判评估侧车作为标准参照,设计新的图像质量与事实一致性度量指标,推动生成式视觉智能的评估体系向更精细、更可靠的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务