遇见数据集

SearchGen-Bench

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

SearchGen-Bench 是一个用于评估图像生成系统的基准数据集。它包含独立的 SearchGen 基准提示和相关的参考元数据,旨在评估那些包含显式视觉参考、文本知识槽、验证清单和评估标准的图像生成提示。数据集规模包括 751 个基准提示和 1,099 张视觉参考图像。主要数据文件为 `eval_metadata.jsonl`,其中每条记录包含以下字段:`bench_id`(基准ID)、`user_prompt`(用户提示)、`language`(语言)、`generation_task_type`(生成任务类型)、`failure_modes`(失败模式)、`domains`(领域)、`verification_checklist`(验证清单)、`evaluation_rubric`(评估标准)、`text_knowledge_slots`(文本知识槽)和 `visual_reference_slots`(视觉参考槽)。视觉参考图像通过 `visual_reference_slots[].relative_path` 字段指向本地路径。此外,数据集还提供了 `eval_query_coverage.jsonl` 文件,用于将基准参考槽与 SearchGen-Corpus-1M 数据集中的查询进行关联。该数据集与训练数据集 SearchGen-20K 分离,专门用于评估目的。

SearchGen-Bench is a benchmark dataset for evaluating image generation systems. It contains independent SearchGen benchmark prompts and related reference metadata. The dataset is designed to evaluate image generation prompts that include explicit visual references, text knowledge slots, verification checklists, and evaluation criteria. The dataset scale includes 751 benchmark prompts and 1,099 visual reference images. The main data file is `eval_metadata.jsonl`, where each record contains the following fields: `bench_id` (benchmark ID), `user_prompt` (user prompt), `language` (language), `generation_task_type` (generation task type), `failure_modes` (failure modes), `domains` (domains), `verification_checklist` (verification checklist), `evaluation_rubric` (evaluation rubric), `text_knowledge_slots` (text knowledge slots), and `visual_reference_slots` (visual reference slots). Visual reference images are pointed to local paths via the `visual_reference_slots[].relative_path` field. Additionally, the dataset provides an `eval_query_coverage.jsonl` file to associate benchmark reference slots with queries in the SearchGen-Corpus-1M dataset. This dataset is separated from the training dataset SearchGen-20K and is specifically for evaluation purposes.

创建时间:
2026-07-12
原始信息汇总

数据集名称:SearchGen-Bench

概述

SearchGen-Bench 是一个独立的基准测试提示集,用于评估图像生成系统在需要显式视觉参考和文本知识槽场景下的表现。该数据集专为评估设计,与训练数据集分开。

数据集统计

项目 数量
基准测试提示 751
视觉参考图像 1,099

主要文件

  • eval_metadata.jsonl:基准测试提示元数据。
  • benchmark_manifest.json:基准测试计数、模式字段和参考图像策略。
  • eval_query_coverage.jsonl:从基准测试参考槽到 searchgen-corpus-1m 查询的覆盖映射。

数据模式

eval_metadata.jsonl 中每行包含以下字段:

  • bench_id
  • user_prompt
  • language
  • generation_task_type
  • failure_modes
  • domains
  • verification_checklist
  • evaluation_rubric
  • text_knowledge_slots
  • visual_reference_slots

其中 visual_reference_slots[].relative_path 指向基准测试本地的参考图像路径,路径相对于 data_release/searchgen-bench/。所有 1,099 张基准测试参考图像的预期最终文件布局为:

data_release/searchgen-bench/reference_images/{bench_id}/ref_00.jpg

交叉引用

  • eval_query_coverage.jsonl 通过 query_id 将基准测试参考槽链接到 ../searchgen-corpus-1m/database/search.sqlite(当存在匹配的搜索语料库查询时)。
  • 训练数据集是独立的,记录在 ../searchgen-20k/README.md 中。

许可证

Apache-2.0

任务类别

文本到图像生成(text-to-image)

引用

如果您觉得该数据集有用,请引用:

@article{wang2026searchgen, title = {Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation}, author = {Wang, Haozhe and Feng, Weijia and Yu, Jinpeng and Liu, Che and Nie, Ping and Lin, Fangzhen and Liu, Jiaming and Huang, Ruihua and Lin, Jimmy and Chen, Wenhu and Wei, Cong}, journal = {arXiv preprint arXiv:2607.05382}, year = {2026}, url = {https://arxiv.org/abs/2607.05382} }

联系方式

权利问题和删除请求请联系:jasper.whz@outlook.com

搜集汇总
数据集介绍
SearchGen-Bench 数据集图片
构建方式
SearchGen-Bench 是专为评估生成式视觉系统设计的独立基准数据集,其构建过程严格遵循科学规范。数据集的 751 条提示语及其对应的 1099 张视觉参考图像,源自模型对代理视觉生成任务中知识边界的探索需求。每条样本均包含基准标识符、用户提示语、语言类型、生成任务类别、失败模式、领域标签、验证检查清单、评估准则、文本知识槽与视觉参考槽等结构化元数据。视觉参考图像路径以相对路径形式存储于基准数据集目录中,并通过校验确保所有 1099 张图像均已正确部署。此外,基准参考槽与大规模检索语料库 SearchGen-Corpus-1M 的查询关联关系被记录在覆盖率映射文件中,为系统性评估提供可靠基础。
特点
该数据集的显著特点在于其多维度的评估框架与知识边界探索能力。与常规文本到图像基准仅关注提示语转换不同,SearchGen-Bench 引入显式视觉参考、文本知识槽、验证检查清单与评估准则四大核心组件,使模型生成结果可被量化校验。数据集覆盖多种生成任务类型与领域,预定义了潜在失败模式,能够全面考核模型在知识缺失场景下的表现。尤其值得一提的是,该基准能够识别模型何时应当拒绝生成——这正是传统生成模型普遍缺失的元认知能力。751 条提示语均经过精心设计,旨在测试模型对超出其内化知识范围信息的检索与利用能力。
使用方法
使用 SearchGen-Bench 进行评估时,研究者应加载 eval_metadata.jsonl 文件,并依据其包含的结构化元数据逐个执行评估。每个提示语对应的视觉参考图像可从 reference_images 目录下按 bench_id 组织子文件夹中获取。评估流程需结合验证检查清单与评估准则,对模型输出进行系统化评分。建议配合 SearchGen-Corpus-1M 检索语料库使用,以验证模型在外部知识检索场景下的表现。基础的加载验证可通过 Python 脚本实现:逐行读取 jsonl 文件并检查样本总数及首个样本标识符。所有评估结果应基于该基准的标准化格式进行记录与比较。
背景与挑战
背景概述
SearchGen-Bench是由香港科技大学、滑铁卢大学、Qwen应用团队及帝国理工学院等机构的研究人员于2026年提出的评估基准,旨在解决文本到图像生成模型在面对超出训练分布的知识边界时的局限性。核心研究问题聚焦于图像生成系统能否通过外部知识检索与视觉参考来突破其内置的知识范围,从而生成更准确、更具事实依据的视觉内容。该基准包含751条精心设计的提示词及1099张视觉参考图像,为评估生成模型在复杂知识场景下的表现提供了标准化测试框架,对推动智能体视觉生成领域的发展具有重要意义。
当前挑战
当前挑战包括三个方面:首先,领域问题层面,现有文本到图像生成模型在遇到训练数据中未包含的实体或概念时,常出现‘幻觉’现象——即生成看似合理但事实错误的内容,SearchGen-Bench通过引入视觉参考和文本知识槽来测试模型的事实性与知识拓展能力;其次,构建过程中,需要为每条提示词设计多维评估维度,包括验证检查清单(verification_checklist)与评分标准(evaluation_rubric),并确保1099张参考图像与751条提示词之间的精确映射,同时维护跨基准的一致性以支持可复现评估;最后,参考图像路径修复与缺失图像校验工作也增加了数据管理的复杂性。
常用场景
经典使用场景
在视觉生成模型蓬勃发展的当下,模型常因知识边界有限而捏造未知内容。SearchGen-Bench专为评估具备检索增强能力的文本到图像生成系统设计,构成本领域首个标准化评测基准。其751条提示词涵盖视觉参考、文本知识槽、验证清单与评分细则四维评价体系,配合1099张参考图像,可系统性检验模型在知识边界之外进行外部信息检索与融合生成的能力。研究者在测试新提出的检索增强生成框架时,可利用此基准精确量化模型对未习得知识的利用效率与生成忠实度。
衍生相关工作
围绕SearchGen-Bench衍生出一系列推进知识边界探索的开创性工作。其配套的SearchGen-20K训练集与SearchGen-Corpus-1M外部语料库为构建检索增强生成模型提供了完整数据生态。基于该基准,研究者发展出多种知识边界感知的检索策略,包括多模态查询重写、自适应参考图像调度与动态验证环路等方法。同时催生了面向生成模型的失败模式自动诊断技术,以及基于评分细则的反向推理纠错机制,共同构成检索增强视觉生成领域的完整方法体系。
数据集最近研究
最新研究方向
当前,文本到图像生成领域正从单纯依赖参数化记忆的知识内化范式,向具备实时外部分支检索能力的智能体视觉生成方向演进。SearchGen-Bench作为这一前沿转型的标志性评测基准,聚焦于模型在明确视觉参考、文本知识槽及逐项验证清单下的生成保真度与可靠性评估。该基准与SearchGen-20K训练集及SearchGen-Corpus-1M语料库构成完整闭环,旨在推动生成式智能体突破纯参数化知识的边界,解决了传统扩散模型在罕见实体与动态知识场景中“一无所知却强不知以为知”的幻觉难题。其评测设计直接响应了大模型时代对可验证、可追溯生成能力的热切需求,对构建更诚实、可控的视觉生成系统具有深远的引领意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务