遇见数据集

IndustryBench-MIPU

收藏
github2026-06-15 更新2026-06-16 收录
官方服务:

资源简介:

IndustryBench-MIPU是一个多图像工业产品理解基准,用于评估多模态大语言模型从真实世界工业产品图像中提取结构化属性的能力。该数据集包含4,559个产品,涵盖18个工业类别,拥有超过182,000个图像级标注和103,703个产品级标注,支持单图像和多图像(跨图像推理)两种评估粒度。它通过文本识别、视觉推理、领域知识和跨图像证据集成四个挑战来测试模型性能。

IndustryBench-MIPU is a multi-image industrial product understanding benchmark designed to evaluate the capability of multimodal large language models to extract structured attributes from real-world industrial product images. This dataset contains 4,559 products covering 18 industrial categories, with over 182,000 image-level annotations and 103,703 product-level annotations. It supports two evaluation granularities: single-image and multi-image (cross-image reasoning). It tests model performance via four challenging dimensions: text recognition, visual reasoning, domain knowledge, and cross-image evidence integration.

创建时间:
2026-06-12
原始信息汇总

数据集概述

IndustryBench-MIPU(Multi-Image Industrial Product Understanding Benchmark)是一个用于评估多模态大语言模型(MLLMs)在多图像工业产品属性提取任务中表现的基准数据集。

核心任务

模型需要根据给定的工业产品图像(规格表、铭牌、技术图纸等多张异构图像)和产品特定的属性模式,提取结构化的属性-值对。

数据集规模

  • 产品数量:4,559 个,覆盖 18 个工业类别
  • 有效图像:27,652 张
  • 属性名称:3,564 个
  • 图像级标注:182,527 条
  • 产品级标注:103,703 条

评估设置

数据集提供两种评估粒度:

  • 单图像评估(image-level):从单张图像中提取可见属性
  • 多图像评估(product-level):从产品完整的图像集合中提取所有属性

主要挑战

基准测试涵盖四个核心挑战:文本识别视觉推理领域知识跨图像证据整合

评测结果

顶级模型在召回率上表现较低,仅能恢复约一半的产品级属性。总体呈现高精度(86-94%)但低召回率的模式,失败集中在密集规格表、多值属性和领域特定术语上。

数据格式

  • 多图像级别:每条记录包含商品ID、标题、类别、属性模式、多张图像路径及标准属性-值标注结果
  • 单图像级别:每条记录包含图像路径、属性模式及该图像对应的属性-值标注结果

评测流程

  1. 提取:向 MLLM 发送产品图像与元数据,获取 {属性名称, 属性值}
  2. 评估:级联匹配——先进行基于规则的归一化(单位转换、同义词映射),对模糊案例使用 LLM 语义判断
  3. 聚合:计算精确率、召回率和 F1 分数

数据构建流程

  1. 跨 18 个工业类别的分层抽样
  2. 使用 5 个前沿 MLLM 进行多模型独立标注(实体识别 → 图像过滤 → 逐图像提取)
  3. 跨模型的联合与去重(语义合并)
  4. 三层质量审核:前沿模型审计(过滤 23.9%)、金标准交叉检查、人工验证(通过率 96.7%)

支持模型接口

  • OpenAI 兼容接口:支持 qwen-plusgemini-2.5-progpt-4o
  • Anthropic 接口:支持 claude-sonnet-4-20250514,并支持扩展推理模式

许可证

该项目采用 MIT 许可证。

引用

bibtex @article{industrybench-mipu, title={IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products}, author={Multimodal and Industrial AI Team, Alibaba}, journal={arXiv preprint arXiv:2606.14383}, year={2026}, url={https://arxiv.org/abs/2606.14383} }

搜集汇总
数据集介绍
IndustryBench-MIPU 数据集图片
构建方式
IndustryBench-MIPU数据集以工业产品多模态属性提取为研究背景,旨在评估多模态大语言模型在异构图像中结构化属性抽取的泛化能力。其构建过程依托半自动化流水线:首先对18个工业品类进行分层抽样,收集4,559件产品的27,652张图像;随后利用5个前沿多模态大语言模型独立完成实体识别、图像筛选及逐图属性提取,通过语义合并实现去重与联合,形成初步候选标注;最后经三层质量审核——前沿模型初审、黄金标准交叉校验及人工验证,以96.7%通过率确保数据质量。
特点
该数据集核心特色在于双重评估粒度和级联评判机制。单图像层级聚焦于可见范围内容属性提取,多图像层级则要求模型跨图像整合证据以还原整体产品属性,精准刻画多源异构图像的协同理解挑战。此外,数据集囊括3,564种属性名和18万条图像级标注,覆盖密集规格表、多值属性及领域术语等复杂场景,揭示模型高精度(86–94%)但低召回率(最优模型仅恢复半数属性)的系统性短板。
使用方法
使用方法遵循标准化三方流水线。通过OpenAI兼容或Anthropic API配置模型凭证,输入产品图像与特定属性模式,调用提取脚本获得属性-值对;继而利用基于规则的归一化(如单位转换、同义映射)与LLM语义判别的级联评估模块完成匹配;最终聚合脚本自动计算精确率、召回率与F1分数,支持按品类或属性名进行细致度结果分解。项目提供即用代码与提示模板,确保跨模型评估的可复现性。
背景与挑战
背景概述
随着工业数字化转型的加速,多模态大语言模型在工业产品属性提取中的应用日益受到关注。然而,工业产品规格信息往往散落在规格表、铭牌、技术图纸等多张异构图像中,现有基准测试难以全面评估模型在这种复杂场景下的综合能力。IndustryBench-MIPU由阿里巴巴多模态工业AI团队于2026年创建,旨在系统性地评估多模态大语言模型在多图像工业产品理解任务中的表现。该数据集覆盖18个工业类别、4,559种产品,包含超过18万条图像级标注和10万条产品级标注,为领域研究提供了标准化的评估框架。通过提出文本识别、视觉推理、领域知识应用和跨图像证据整合四大核心挑战,IndustryBench-MIPU填补了现有基准在工业多图理解方面的空白,对推动智能制造、自动化质检等领域的发展具有重要意义。
当前挑战
IndustryBench-MIPU主要解决的是多模态大语言模型在工业产品多图像场景下结构化属性提取的评估难题。当前模型普遍呈现高精度(86-94%)但低召回率(最优模型仅恢复约50%产品级属性)的模式,失败案例集中体现在三个方面:一是密集规格表场景中模型在枚举4-5个值后停止,难以提取完整属性;二是涉及多值属性时模型无法聚合跨图像信息;三是面对领域特定术语时识别能力不足。在构建过程中,团队面临多模型标注系统对齐的挑战,需通过语义合并将5个前沿模型的独立标注去重融合,并经过三阶段质量控制——包括23.9%标注被过滤、黄金标准交叉验证及96.7%人工审核通过率——在保证标注质量的同时解决异构图像间属性一致性问题。
常用场景
经典使用场景
在工业产品属性提取领域,制造商往往将产品规格分散于铭牌、技术图纸、参数表格等多张异构图像中,给自动化信息抽取带来极大挑战。IndustryBench-MIPU正是为评估多模态大语言模型(MLLMs)在此类多图像场景下的结构化属性提取能力而设计的标杆性数据集。其经典使用场景涵盖两大粒度:单图像层面,要求模型从单张图像中识别可见属性;多图像层面,则需综合同一产品的全部图像证据,完成跨图像属性推理与整合。研究者在评估时,将产品图像与预定义的属性模式(如颜色、型号、含量)作为输入,促使模型输出结构化的属性-值对,进而通过精确率、召回率与F1值衡量其性能,从而深度揭示MLLMs在工业视觉理解中的优势与短板。
衍生相关工作
IndustryBench-MIPU的发布催生了多个方向的相关研究工作。在模型层面,研究者基于该数据集揭示的“高精确率、低召回率”典型困境,推动了针对密集表格和多值属性场景的专项改进方法,例如引入视觉指针网络以提升表格中属性值的完整枚举能力,以及设计多轮交互式提取策略以增强跨图像证据融合。在评估方法论上,其级联判断器——结合规则归一化与LLM语义匹配——启发了诸多后续工作将硬匹配与软评判相结合的混合评估范式。此外,该数据集严谨的半自动构建流程(多模型共识标注、三阶段质量控制)成为构建高质量工业领域基准的典范,被后续多个工业视觉理解数据集引用与效仿,促进了该领域评价体系的标准化与透明化。
数据集最近研究
最新研究方向
当前,IndustryBench-MIPU数据集聚焦于评估多模态大语言模型在工业产品多图像理解中的属性提取能力,特别是其在文本识别、视觉推理、领域知识与跨图像证据整合方面的表现。研究表明,尽管前沿模型在精度上表现优异(86–94%),但在召回率上存在显著瓶颈,最优模型仅能恢复约一半的产品级属性。这一发现在工业自动化与智能仓储领域具有深远影响,因为精确且完整的属性提取是提升供应链管理效率与产品质量追溯能力的关键。随着大型语言模型在视觉-语言任务中的广泛应用,该数据集为评估模型在真实工业场景下的鲁棒性与泛化能力提供了严谨的基准,推动了面向复杂产品规格理解的前沿研究突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务