遇见数据集

SEARCHGEN-20K, SEARCHGEN-BENCH, SEARCHGEN-CORPUS-1M

收藏
arXiv2026-07-07 更新2026-07-08 收录
数据链接:
官方服务:

资源简介:

SEARCHGEN-20K是由香港科技大学、滑铁卢大学等机构联合构建的大规模、双语多模态数据集,旨在系统研究视觉生成中的世界知识瓶颈问题。该数据集包含20,839条涵盖12种失败类别和22个领域的文本到图像提示,平均每条提示包含5.2个知识缺口,并标注了34,694个视觉参考槽和16,345个文本知识槽,数据来源于真实用户请求和种子实体库的合成生成。其构建过程采用基于模板的人工构思与LLM辅助重写策略,并预先执行了145,642次搜索会话以形成可复现的SEARCHGEN-CORPUS-1M语料库。该数据集主要应用于代理增强视觉生成、搜索策略优化和知识边界发现等领域,致力于解决生成模型在开放世界知识场景下的幻觉与评估盲区问题。

SEARCHGEN-20K is a large-scale bilingual multimodal dataset jointly constructed by The Hong Kong University of Science and Technology, the University of Waterloo and other institutions, aiming to systematically investigate the world knowledge bottleneck problem in visual generation. This dataset contains 20,839 text-to-image prompts covering 12 failure categories and 22 domains, with an average of 5.2 knowledge gaps per prompt. It is annotated with 34,694 visual reference slots and 16,345 text knowledge slots, and its data originates from real user requests and synthetic content generated from seed entity libraries. Its construction adopts a template-based manual conceptualization and LLM-assisted rewriting strategy, and pre-conducted 145,642 search sessions to form a reproducible SEARCHGEN-CORPUS-1M corpus. This dataset is primarily applied in fields such as agent-augmented visual generation, search strategy optimization, and knowledge boundary discovery, and aims to address the hallucination and evaluation blind spot problems of generative models in open-world knowledge scenarios.

创建时间:
2026-07-07
搜集汇总
数据集介绍
SEARCHGEN-20K, SEARCHGEN-BENCH, SEARCHGEN-CORPUS-1M 数据集图片
构建方式
SEARCHGEN系列数据集基于对超过两万条来自真实生产环境AIGC平台的用户提示词的分析而构建,识别出十二种知识匮乏失败模式及二十二个领域。构建过程首先从用户请求中提取包含三万多个实体的种子数据库,标注其频率与视觉参考;随后利用人类头脑风暴的模板与大型语言模型辅助改写,采用“答案优先”策略合成提示词,确保每条提示词内嵌知识缺口、严重性标签与评估清单。数据集包含20,839条提示词,分为训练集(20,188条)、验证集(128条)及测试集(751条),并配有预执行的多模态搜索语料库SEARCHGEN-CORPUS-1M支持离线可复现研究。
特点
SEARCHGEN系列数据集的核心特点在于其针对视觉生成模型的世界知识瓶颈,专注于测试模型对未见、长尾、动态演变实体与概念的生成能力。数据集覆盖十二种失败模式与二十二个领域,中英双语构成(58%英文、42%中文),每条提示词平均存在5.2个多模态知识缺口,90.5%的提示词携带三个以上缺口。数据集特有长尾分布——93.1%的实体仅出现于单条提示词中——逼迫模型依赖外部搜索而非参数记忆。该数据集揭示了前沿开源生成模型在搜索密集任务上得分仅21-28分(满分100),与商业系统存在高达40分的差距,此差距被现有基准完全忽视。
使用方法
SEARCHGEN数据集可被研究者用作评估视觉生成模型知识边界的标准测试平台。具体使用时,用户可基于提供的提示词运行目标生成模型,利用数据集内置的自动化评估协议(包含检查清单验证、维度加权评分、提示忠实度及视觉参考保真度等九个评价组件)进行打分。SEARCHGEN-CORPUS-1M提供14万条以上冻结的搜索会话及37万以上缓存的下载内容,使研究者无需实时付费API即可离线复现搜索增强生成的完整流程。数据集还包含从多个推理器与生成器收集的9万余条推理轨迹及28万以上生成图像,支持偏好学习、奖励建模与搜索策略设计等下游研究。
背景与挑战
背景概述
SEARCHGEN系列数据集由香港科技大学、滑铁卢大学、通义千问应用团队及帝国理工学院的研究人员于2026年联合创建,旨在解决视觉生成模型在面对开放世界中不断演化的用户请求时存在的世界知识瓶颈问题。该数据集包含SEARCHGEN-20K(20,839条提示,涵盖十二种失败类别与二十二个领域)、SEARCHGEN-BENCH(评估基准)以及SEARCHGEN-CORPUS-1M(含145,642次预执行搜索会话的大规模检索语料库)。其核心研究问题在于:视觉生成模型受限于固定的训练语料,而用户需求具有无界性、动态性与深度长尾性,模型在渲染未知实体、新兴文化符号或近期事件时常常出现不可靠的捏造现象。该数据集通过标注细粒度视觉检查清单与多模态知识缺口,为代理式视觉生成研究提供了可复现的离线基础设施,显著推动了知识增强型文本到图像生成领域的进展。
当前挑战
SEARCHGEN系列数据集所面临的首要挑战在于解决视觉生成模型的世界知识瓶颈,即模型在训练语料中未曾见过的概念(如新兴角色、区域文化符号、截断后事件等)上无法忠实渲染,而现有基准未能捕捉此类动态失败模式。其次,在构建过程中,研究团队需处理极端长尾的实体分布(93.1%的实体仅出现在单条提示中)、双语提示的异质性(英文提示平均266字符,中文仅89字符),以及多模态知识缺口的高密度性(90.5%的提示包含三个以上缺口)。此外,朴素搜索策略会引入噪声,导致概念损坏与复制效应,使得模型在处理已具备内部知识的提示时反而退化,这要求设计生成器特定的、可演化的知识边界以及噪声抑制的代理式搜索协议。
常用场景
经典使用场景
SEARCHGEN系列数据集在视觉生成领域开辟了一片崭新的研究疆域,其核心使命在于精准刻画并系统应对视觉生成模型在面临开放世界知识时的结构性瓶颈。经典使用场景聚焦于评估和驱动文本到图像生成模型对超出其训练分布的知识的掌握能力,涵盖十二种典型失败类别,如近期事件、游戏IP角色、精确文化符号、历史场景、抽象概念及复杂图表等。研究者利用该数据集提供的海量世界知识驱动的提示词与精细化视觉检查清单,可自动化地探测模型在渲染这些长尾、动态演化知识时的知识缺失与幻觉现象,从而科学地度量生成模型的真实世界知识边界。
实际应用
在实际应用层面,SEARCHGEN系列数据集为构建具备世界知识感知能力的智能视觉生成系统提供了不可或缺的测试床与训练引擎。其应用场景广泛渗透于需要精准视觉产出的领域,如文化创意产业中忠实再现地方庆典服饰与民族纹样、游戏与影视行业中对版权角色与历史场景的准确渲染、新闻传媒领域内对时效性事件与数据可视化的实时呈现,以及教育科研中生成精确的学术图表与科学流程图。通过提供预执行的百万级多模态搜索语料库,该框架使开发者能够在离线、可复现的环境中打磨搜索策略与生成模型,极大降低了依赖昂贵实时搜索API的研究门槛,推动了世界知识密集型视觉生成技术从实验室走向真实产业应用。
衍生相关工作
SEARCHGEN数据集的诞生直接催生了一系列开创性的相关研究工作,形成了围绕世界知识边界探索的活跃研究脉络。最经典的代表性工作包括基于噪声抑制代理式推理器的门控-过滤-整合三阶段搜索协议,该工作系统性地解决了朴素搜索带来的概念污染与复制效应;在线迭代DPO与拒绝采样微调相结合的协同训练框架,以最小四步的简洁配方实现了生成器知识边界向外扩张与搜索策略向内校准的单调提升;以及基于知识边界概念的生成器特异化搜索策略,验证了最优搜索策略是生成器-推理器联合属性而非提示分布的固定特性。这些衍生产出共同构建了一个从问题定义、方法论创新到评估体系的完整知识闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务