遇见数据集

ExpertVerse-100K

收藏
arXiv2026-07-22 更新2026-07-23 收录
数据链接:
官方服务:

资源简介:

ExpertVerse-100K是由阿里巴巴集团与清华大学联合构建的、面向知识密集型视觉合成任务的大规模基准数据集。该数据集包含约10万条高质量样本,每条数据均配备逐步推理链(CoT)和知识锚定的原理注释,其数据来源融合了人工精心设计的种子提示与专有视觉语言模型(VLM)的大规模合成扩展。数据集通过分层扩展策略构建,覆盖了8个专家领域和9种认知能力划分出的58个子类别,确保了知识密度与任务多样性。该数据集的核心应用在于推动下一代生成式模型在跨学科、多跳知识推理方面的能力评估与训练,旨在解决现有模型在专业领域知识深度理解与复杂视觉逻辑生成方面的瓶颈问题。

ExpertVerse-100K is a large-scale benchmark dataset jointly constructed by Alibaba Group and Tsinghua University, targeting knowledge-intensive visual synthesis tasks. This dataset contains approximately 100,000 high-quality samples, each equipped with step-by-step Chain-of-Thought (CoT) reasoning chains and knowledge-anchored principle annotations. Its data sources combine manually curated seed prompts and large-scale synthetic expansion from proprietary Vision-Language Models (VLM). The dataset is constructed via a hierarchical expansion strategy, covering 58 subcategories derived from 8 expert domains and 9 cognitive capabilities, ensuring knowledge density and task diversity. The core application of this dataset lies in promoting the capability evaluation and training of next-generation generative models in cross-disciplinary, multi-hop knowledge reasoning, aiming to address the bottleneck issues faced by existing models in deep understanding of professional domain knowledge and complex visual logic generation.

创建时间:
2026-07-22
原始信息汇总

数据集概述:ExpertVerse

  • 数据集名称:ExpertVerse
  • 核心定位:一个面向专家级推理的通用基准测试,专注于知识密集型视觉合成场景。
  • 构建目的:评估当前多模态生成模型在知识密集型生成任务上的推理能力,因为现有方法多局限于显式常识推理、浅层因果理解和直接知识召回。
  • 数据规模:包含 1,611 个专家标注的实例。
  • 任务类型:覆盖三种视觉生成任务:
    • 单图像编辑
    • 多图像合成
    • 文本到图像生成
  • 分类体系:基于正交的分类学结构,涵盖:
    • 9 种认知能力
    • 8 个专家学科
    • 细分为 58 个子学科
  • 衍生数据集:基于 ExpertVerse,通过自动化流程构建了大规模的 ExpertVerse-100K 数据集,包含推理轨迹和知识锚定的理由注释。
  • 关联模型:基于 ExpertVerse 数据集训练了名为 KnowThinker 的视觉语言模型推理引擎,该引擎采用强化学习微调,能够联合生成思考过程和精细化指令,并使用了定制的 Bootstrapped Pareto Policy Optimization (BPPO) 优化方法。
搜集汇总
数据集介绍
ExpertVerse-100K 数据集图片
构建方式
ExpertVerse-100K的构建以分层扩展策略为核心,首先由领域专家手工撰写种子参考提示,涵盖图像描述、用户指令及领域特定原理,随后利用专有视觉语言模型进行规模化扩展。为最大化数据多样性,研究团队在58个正交子类别中进一步划分出3至6个原子生成任务,确保样本均匀分布。最终,通过自动化视觉语言模型过滤器消除事实幻觉与冗余指令,再经三位博士专家进行人工核验,保障知识正确性与推理深度。该流程生成了包含逐步思维链轨迹与知识锚定原理注释的大规模训练语料。
使用方法
ExpertVerse-100K主要用于训练知识密集型图像生成中的推理引擎,遵循“思考-执行”范式。具体而言,研究者利用数据集中的用户提示、思维轨迹与精细化指令三元组,对视觉语言模型进行监督微调,以激活其知识推理能力。随后,采用基于规则的强化学习框架进一步优化,其中难度感知的数据蒸馏策略构建高质量训练集,而自举帕累托策略优化算法则通过跨模态奖励校准与冲突感知优势融合,解决多目标优化中的梯度冲突问题。训练后的推理模块可冻结视觉编辑器,独立将高层用户意图分解为可执行的可视化计划。
背景与挑战
背景概述
ExpertVerse-100K数据集由阿里巴巴集团与清华大学联合团队于2026年提出,旨在填补知识密集型视觉生成领域缺乏系统性评估基准的空白。随着多模态生成模型的迅猛发展,图像合成已从简单的语义操控演进至复杂的视觉推理,然而现有基准(如RISEBench、KRISBench)多聚焦于显式常识与浅层因果理解,在需要跨学科专业知识的多跳推理场景中表现乏力。该数据集以能力导向为核心,构建了涵盖9种认知能力与8个专家领域的正交分类体系,细分为58个子任务,共包含1,611个专家标注实例及10万条大规模训练数据。ExpertVerse-100K的出现为评估生成模型在科学、历史、设计等专业领域的知识推理能力提供了权威标尺,推动视觉合成从像素级操控迈向知识驱动的高级认知阶段。
当前挑战
ExpertVerse-100K所解决的领域核心挑战在于,现有生成模型在面对知识密集型任务时,无法将隐性的专业领域知识转化为具有物理合理性与逻辑一致性的视觉输出。具体而言,当前模型在营养分析、历史人物社交、科学图表推理等高知识密度场景中,普遍表现出概念混淆与事实幻觉,暴露出跨学科推理能力的严重缺失。在数据构建层面,团队面临如何系统性地涵盖58个正交子领域的多样性难题,为此设计了层次化扩展策略与基于结构化HTML渲染的自动化管道,以获取高信息密度的图表类训练样本。此外,多模态奖励优化中存在的跨模态信用分配错位与多目标梯度冲突,使得推理过程与视觉执行难以协同,亟需创新的强化学习范式(如BPPO)来校准认知规划与生成质量之间的平衡。
常用场景
经典使用场景
ExpertVerse-100K作为面向知识密集型视觉合成的通用基准数据集,其最经典的使用场景在于系统评估和提升多模态生成模型在专业领域中的推理与生成能力。研究者可借助该数据集,对模型在单图编辑、多图合成以及文生图三种典型任务上的表现进行全方位测评,尤其聚焦于知识应用、逻辑推理、时间叙事与跨域迁移等九种高阶认知能力的刻画。通过58个细分子领域的精细划分,该数据集为验证模型在诸如科学教育、历史文化、产品设计等专业语境下的视觉推理深度与知识忠诚度提供了不可替代的标准化测试平台。
解决学术问题
ExpertVerse-100K针对性地解决了当前视觉生成领域在知识密集型推理方面存在的关键学术瓶颈。现有基准多集中于显式常识与浅层因果理解,难以胜任需要跨学科多跳推理的复杂场景。该数据集系统性地填补了这一空白,通过构建正交的知识与能力分类体系,使得模型在专业概念具象化、隐式约束遵循以及知识依赖型视觉元素生成等方面的不足得以暴露。其引入的知识推理与理由对齐评估维度,为衡量生成结果在专业层面上的准确性与逻辑一致性提供了方法论支撑,从而推动了从语义编辑向知识驱动视觉推理的范式进化。
实际应用
在工业界与学术界的实际落地中,ExpertVerse-100K展现了广泛而深远的应用价值。它可直接服务于虚拟试穿、虚拟人创建等需要精细视觉规划的商业场景,通过训练模型将抽象用户意图转化为可执行的视觉方案。此外,在教育内容生成、广告创意设计、产品说明图自动制作等领域,该数据集赋能生成系统具备专家级的规划能力,能够根据营养成分分析、历史人物社交背景等深度知识,自动产出兼具美学质量与知识准确性的图表与配图。这种知识锚定的推理机制有效降低了视觉事实幻觉的发生率,提升了生成结果的实用性与可信度。
数据集最近研究
最新研究方向
当前,知识密集型视觉合成领域的前沿研究方向聚焦于构建能够进行专家级跨学科推理的生成模型。ExpertVerse-100K数据集的提出,正是为了应对现有基准在常识性推理上的局限,其创新性地从9种认知能力与8个专家学科构成的交叉分类法出发,覆盖58个细分子领域,系统评估模型在深层次知识推理、逻辑规划和领域锚定合理性上的表现。该数据集不仅包含1,611个专家标注实例,还通过自动化流程扩展至十万级规模,进而催生了基于强化学习的KnowThinker推理引擎,利用自举式帕累托策略优化(BPPO)解决跨模态信用分配不均与多目标梯度冲突等关键挑战。这一工作深刻揭示了当前模型在知识密集型任务中的瓶颈,为迈向具备真正世界知识的下一代视觉生成系统奠定了范式基础,具有重要的学术推动与应用启示意义。
相关研究论文
  • 1
    ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis阿里巴巴集团; 清华大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务