DomainBed-Reasoning
收藏资源简介:
DomainBed-Reasoning是一个基于标准DomainBed基准构建的推理增强数据集,为每个图像-标签样本提供结构化推理链,用于在领域偏移下微调多模态大语言模型。数据集扩展了多个常用领域泛化数据集,并添加了类别相关推理注释,每个响应分为摘要、描述、推理、反思和结论五个部分,旨在通过更稳定的推理线索帮助模型泛化到未见领域。
DomainBed-Reasoning is a reasoning-enhanced dataset built on the standard DomainBed benchmark. It provides structured reasoning chains for each image-label sample, and is tailored for fine-tuning multimodal large language models under domain shift. The dataset expands multiple widely-used domain generalization datasets and adds category-related reasoning annotations. Each annotated response is divided into five sections: summary, description, reasoning, reflection, and conclusion, aiming to help models generalize to unseen domains via more stable reasoning cues.
DomainBed-Reasoning 数据集概述
DomainBed-Reasoning 是一个用于多模态大语言模型(MLLM)在域泛化场景下微调的数据集,相关论文已被 ICLR 2026 接收。该数据集在标准 DomainBed 基准测试的基础上,为每个图像-标签样本提供了结构化的推理链(Reasoning Chain),以增强模型在域迁移下的泛化能力。
核心特性
- 结构化推理响应:每个样本包含一个组织为五个部分的推理链:
<SUMMARY> ... </SUMMARY>:概述解决问题的方法与步骤。<CAPTION> ... </CAPTION>:详细描述图像中与问题相关的视觉内容。<REASONING> ... </REASONING>:提供逐步的链式逻辑推理过程。<REFLECTION> ... </REFLECTION>:反思与评估推理过程,考虑不确定性与边界情况。<CONCLUSION> ... </CONCLUSION>:给出最终答案,必须与真实类别标签完全一致。
- 设计动机:视觉外观在不同域间可能显著变化,而与类别相关的推理线索通常更稳定。该数据集旨在研究推理监督如何帮助多模态模型泛化到未见过的域。
- 数据格式:采用 ShareGPT 风格的多模态格式,每条记录包含用户与助手的对话,图像路径以相对路径形式给出。
支持的子数据集
| 数据集 | 域数量 | 类别数 | 样本数 |
|---|---|---|---|
| PACS | 4 | 7 | 9,991 |
| VLCS | 4 | 5 | 10,729 |
| OfficeHome | 4 | 65 | 15,588 |
| TerraIncognita | 4 | 10 | 24,788 |
数据文件结构
数据集根目录名为 DomainBed-Reasoning,主要包含以下内容:
data/DomainBed-Reasoning/annotations/:存放 JSON 格式的标注文件,每个子数据集按域划分,每域提供两种文件:*_classification.json:直接分类格式,模型仅需输出类别标签。*_distill.json:推理蒸馏格式,包含完整的五段式推理链。
data/DomainBed-Reasoning/images/:存放原始图像文件,按子数据集名称(如office_home/、PACS/等)组织。用户需自行下载原始 DomainBed 图像并放置或软链接至此目录。examples/train_domainbed_reasoning.yaml:基于 LLaMA-Factory 的训练配置文件示例。
应用场景与工具
- 主要适配框架:LLaMA-Factory。数据集注册时需在 LLaMA-Factory 的
data/dataset_info.json中添加对应 JSON 文件的配置项。 - 训练示例:支持使用 LoRA 微调,代码中提供具体的训练命令和配置文件(包含数据集选择、模板、超参数等)。
- 两种任务路径:
- 推理路径:使用
*_distill.json,模型生成结构化推理响应。 - 分类路径:使用
*_classification.json,模型直接输出类别标签。
- 推理路径:使用
引用与许可
-
引用论文: bibtex @inproceedings{xu2026reasoning, title = {Reasoning-Driven Multimodal LLM for Domain Generalization}, author = {Xu, Zhipeng and Wang, Zilong and Jiang, Xinyang and Li, Dongsheng and Cheng, De and Wang, Nannan}, booktitle = {The Fourteenth International Conference on Learning Representations}, year = {2026}, url = {https://openreview.net/forum?id=psJiUopUt7} }
-
许可协议:
- 数据集本身的推理标注、示例、脚本和文档采用 MIT 许可。
- 原始图像属于各自数据集(PACS、VLCS、OfficeHome、TerraIncognita)的拥有者,需遵循原始数据集的许可与条款。





