FORGE
收藏资源简介:
FORGE是一个用于工业制造场景中视觉语言模型评估的细粒度多模态数据集,涵盖了三个核心任务以及基础消融研究。
FORGE is a fine-grained multimodal dataset dedicated to evaluating vision-language models in industrial manufacturing scenarios, encompassing three core tasks and basic ablation studies.
FORGE 数据集概述
数据集基本信息
- 数据集名称: FORGE (Fine-grained Multimodal Evaluation for Manufacturing Scenarios)
- 主要用途: 评估视觉-语言模型在工业制造异常检测任务上的性能
- 托管地址: https://huggingface.co/datasets/AI4Manufacturing/forge
- 相关链接:
- 项目网站: https://ai4manufacturing.github.io/forge-web/
- 论文: 未提供链接
- 数据集: https://huggingface.co/datasets/AI4Manufacturing/forge
核心评估任务
FORGE 包含三个核心任务以及空间定位消融研究。
任务1:错误模型检测
- 任务1 图像: 使用装配照片进行多项选择题形式的错误模型检测。支持零样本、少样本和上下文学习设置。
- 任务1 三视图: 使用渲染的三视图图像进行字母选择形式的错误模型检测。支持零样本、少样本和上下文学习设置。
任务2:异常分类
- 任务2 三视图: 使用渲染的三视图图像进行异常分类(判断是否正常及缺陷类型)。支持零样本、少样本和上下文学习设置。
任务3:多余/错误零件检测与缺失零件识别
- 任务3 图像: 使用装配照片进行多项选择题形式的多余/错误零件检测。支持零样本、少样本和上下文学习设置。
- 任务3 三视图: 使用渲染的三视图图像进行字母选择形式的多余/错误零件检测。支持零样本、少样本和上下文学习设置。
- 任务3 缺失零件图像: 使用装配照片进行多项选择题形式的缺失零件识别。支持零样本、少样本和上下文学习设置。
- 任务3 缺失零件三视图: 使用渲染的三视图图像进行多项选择题形式的缺失零件识别。支持零样本、少样本和上下文学习设置。
空间定位消融研究
- 空间定位任务: 评估坐标到字母或字母到坐标的映射能力。支持零样本、图像内上下文学习和跨图像上下文学习设置。
- 跨图像定位任务: 评估跨图像的零件匹配能力,包括字母到字母匹配和坐标到坐标匹配。
数据集配置详情
数据集在 HuggingFace 上提供多个配置,具体如下:
| 配置名称 | 案例数量 | 描述 |
|---|---|---|
task1_image |
451 | 任务1装配照片,带定位点 |
task1_three_view |
496 | 任务1三视图渲染图像 |
task2_three_view |
830 | 任务2缺陷分类 |
task3_image |
857 | 任务3多余零件装配照片 |
task3_three_view |
309 | 任务3多余零件三视图 |
task3_missing_part_image |
240 | 缺失零件装配照片 |
task3_missing_part_three_view |
137 | 缺失零件三视图 |
grounding_task_a_zero_shot |
500 | 坐标到字母(零样本) |
grounding_task_a_icl_within |
500 | 坐标到字母(图像内上下文学习) |
grounding_task_a_icl_outside |
500 | 坐标到字母(跨图像上下文学习) |
grounding_task_b_zero_shot |
500 | 字母到坐标(零样本) |
grounding_task_b_icl_within |
500 | 字母到坐标(图像内上下文学习) |
grounding_task_b_icl_outside |
500 | 字母到坐标(跨图像上下文学习) |
grounding_cross_letter_to_letter |
513 | 跨图像字母匹配 |
grounding_cross_coord_to_coord |
513 | 跨图像坐标匹配 |
数据加载方式
可通过 datasets 库从 HuggingFace 加载数据。
python
from datasets import load_dataset
ds = load_dataset("AI4Manufacturing/forge", "task1_three_view", split="train")
评估框架支持
支持的后端模型
- OpenRouter: 支持所有模型(GPT, Claude, Gemini 等),默认后端。
- OpenAI: 支持 GPT-4o, o3 等模型。
- Anthropic: 支持 Claude 系列模型。
- Google: 支持 Gemini 系列模型。
- vLLM: 支持本地部署的模型。
评估配置
通过 YAML 配置文件控制评估参数,包括模型名称、评估设置(零样本、少样本、上下文学习)、案例路径、温度、最大令牌数、参考图像数量、是否启用思维链推理等。
输出结果
每次评估会保存以下文件:
results.json: 精简结果(预测、准确率)。results_full.pkl: 完整结果,包含原始 API 消息。config_used.yaml: 使用的配置文件副本,用于复现。logs/: 详细的执行日志目录。
引用
如需引用,请使用以下 BibTeX 条目: bibtex @article{jianforge2026, title={FORGE: A Benchmark for Manufacturing Anomaly Detection with VLMs}, author={Jian, Xiangru and Xu, Hao and Pang, Wei and Zhao, Xinjian and Tao, Chengyu and Zhang, Qixin and Zhang, Xikun and Zhang, Chao and Deng, Guanzhi and Xue, Alex and Du, Juan and Yu, Tianshu and Tarr, Garth and Sun, Qiuzhuang and Tao, Dacheng}, year={2026} }





