遇见数据集

MechVQA benchmark

收藏
github2026-06-27 更新2026-07-04 收录
官方服务:

资源简介:

MechVQA基准是第一个全面的机械图纸理解数据集,通过半自动构建和质量控制流程构建:包含3.3K高密度图纸和21K问答对,覆盖10个细粒度任务,跨越三个能力级别——识别、推理和判断。

The MechVQA benchmark is the first comprehensive dataset for mechanical drawing understanding. It was constructed via a semi-automated construction and quality control pipeline, comprising 3.3K high-density mechanical drawings and 21K question-answer pairs, covering 10 fine-grained tasks across three capability levels: recognition, reasoning, and judgment.

创建时间:
2026-06-25
原始信息汇总

数据集概述:MechVQA

MechVQA 是一个面向机械工程图纸理解的多模态大语言模型(MLLM)基准与增强数据集,相关论文已被 ICML 2026 接收。

  • 数据集规模:包含 3,300 张高密度机械图纸,配套 21,000 个问答对
  • 任务类型:覆盖 10 个细粒度任务,分为三个能力层级:
    • 识别(Recognition)
    • 推理(Reasoning)
    • 判断(Judging)
  • 核心贡献
    • MechVQA 基准:首个全面的机械图纸理解数据集,通过半自动化构建与质量控制流程生成。
    • MechVL 模型:一个领域专用基线模型,采用多阶段训练范式(SFT → 两阶段自博弈强化学习),在 MechVQA 上取得 总分 84.85,超越最强闭源 MLLM(GLM-4.6V,78.91)。
  • 模型性能亮点
    • MechVL-4B-RL 在 困难子集 上达到 75%,比最佳闭源模型 Qwen3-VL-Plus(66%)高出 +9 个百分点
    • 消融实验证实 DAPO 优于 GRPO 和 GSPO,且两阶段自博弈 RL 的必要性。
  • 发布状态:推理脚本、RL 训练框架、示例样本及模型权重(MechVL-4B-SFT / -RL)已发布;完整基准数据、SFT 配方及评估脚本即将开源。
  • 模型与数据获取
  • 许可证:项目采用 Apache 2.0 许可证
搜集汇总
数据集介绍
MechVQA benchmark 数据集图片
构建方式
机械工程图纸以紧凑而标准化的图形语言——正交多视图投影、密集尺寸标注、剖视图、符号注释及结构化文本——传递丰富语义。现有通用多模态大语言模型在面对高标注密度、薄弱领域先验及严格投影规则下的空间关系推理时,往往难以捕捉关键线索。为弥合这一鸿沟,MechVQA数据集应运而生,其构建采用半自动化流水线与质量控制机制,涵盖3300张高密度工程图纸及21000个问答对,横跨识别、推理与评判三大能力层级下的10项细粒度任务。
使用方法
MechVQA数据集的使用方式灵活且结构化。研究者可通过配备vLLM推理引擎的批量推理脚本(scripts/batch_infer.py)在两种模式下运行模型:指令微调模式输出自由形式答案,强化学习模式则生成包含思考过程与最终答案的结构化回应。该脚本内置10个样本用于自包含测试,并支持断点续跑与错误容错。同时,基于EasyR1框架的强化学习训练代码已开放,提供多种算法(如DAPO、GRPO)的示例脚本与奖励函数,便于用户复现或定制训练流程。完整评估脚本与全量数据即将发布。
背景与挑战
背景概述
机械工程图纸作为工业领域的核心视觉语言,通过正交多视图投影、密集尺寸标注、剖面视图及符号化标注等标准化图形语义,承载了精密的结构信息与设计意图。然而,通用多模态大语言模型在面对此类高密度、强领域先验的视觉文档时,往往因空间关系推理能力的薄弱与领域知识的缺失而表现脆弱。为弥合这一鸿沟,由北京人工智能研究院、中国科学院信息工程研究所及北京工业大学的研究团队于2026年构建了MechVQA基准数据集,该工作发表于ICML 2026,聚焦于机械图纸的全面视觉理解。数据集包含3300张高密度工程图纸与21000个问答对,覆盖识别、推理与判断三大能力层次的十项细粒度任务,为评估和提升多模态模型在专业工程领域的视觉语义联合理解能力提供了首个系统化基准。
当前挑战
数据集构建与研究所面临的挑战可归纳为三个层面。其一,机械图纸固有的语义复杂性构成了核心领域困局:高密度的标注信息、交叉的投影规则以及符号化表达,使得模型难以在精准解读局部细节的同时兼顾全局几何一致性,导致空间关系推理的可靠性低下。其二,构建过程遭遇数据生产瓶颈:高质量机械图纸需依赖专业工程师的标注与审核,大规模人工标注成本高昂且易引入歧义,因此采用半自动化流水线并辅以多重质量控制机制以保障数据纯净。其三,模型训练面临多阶段优化难题:需要设计从有监督微调至两阶段自博弈强化学习的递进范式,并引入语义等价性评判、格式合规性及逻辑专业性等多维奖励项,方能将模型在困难子集上的性能从66%提升至75%。
常用场景
经典使用场景
在机械工程与计算机视觉交叉领域,机械图纸作为一种高度符号化、信息密集的专业文档,对多模态大模型的视觉理解和推理能力构成了严峻挑战。MechVQA基准数据集因此应运而生,其经典使用场景在于系统性地评估和提升多模态大模型在复杂机械图纸理解任务上的表现。该数据集包含3300幅高密度图纸与21000个问答对,覆盖识别、推理和判断三大能力层次的十个细粒度任务,为模型提供了从基本要素标注到空间关系推理再到专业合规性判断的全面测试平台。
解决学术问题
MechVQA有效解决了现有基准在机械图纸领域存在的评估空白问题,此前通用多模态大模型在这一高度标准化、符号密集的图形语言上表现脆弱,难以准确捕捉高密度标注中的空间约束与投影规则。该数据集通过半自动化构建与质量控制流程,为学术研究提供了首个系统性的机械制图理解评估框架,促使研究者关注并改进模型在严格投影规则下的空间关系推理能力。其实验结果揭示了顶级闭源模型在此领域亦存在明显短板,推动了针对专业领域视觉语言理解的算法革新。
实际应用
在工业实践中,MechVQA基准及其训练的MechVL模型可广泛应用于计算机辅助设计与制造自动化的多个环节,如自动解析工程图纸中的尺寸标注、符号说明与技术要求,辅助工程师进行设计合规性审查与错误检测。在智能制造生产线中,该技术能够实现图纸信息到加工指令的自动转换,减少人工解读误差,显著提升设计到制造的流转效率。此外,在职业教育与培训领域,MechVQA可用于开发交互式机械制图教学系统,为学员提供即时、准确的图纸理解反馈。
数据集最近研究
最新研究方向
当前,随着多模态大语言模型在通用视觉任务中取得突破性进展,如何将其迁移至高度专业化、符号密集的工程技术图纸理解领域成为前沿焦点。MechVQA基准数据集应运而生,它通过半自动化管道构建了3300余张高密度机械图纸及两万余组问答对,系统评估模型在识别、推理与判断三个能力层级上的表现。该研究揭示了通用模型在正交投影、密集标注与空间关系推理中的脆弱性,并基于多阶段强化学习策略训练出专精模型MechVL-4B-RL,其总得分高达84.85,显著超越最先进闭源模型。这一工作不仅为工业级图纸自动化解读树立了评价标尺,更推动了多模态AI在精密制造与工程审图领域的可信落地,对智能制造和数字孪生等热点场景具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务