biomed-visual-instructions
收藏资源简介:
该数据集用于多模态大语言模型(MLLMs)的领域适应性后训练,特别是在生物医学和食品领域。数据集包括图像描述对和合成的视觉任务,这些数据是通过视觉指令合成器生成的。数据集的目的是通过单一阶段的后训练过程来增强MLLMs在特定领域的性能。数据集包括三个主要部分:image_caption_pairs.json(包含500K图像描述对),synthetic_visual_tasks.json(包含144K合成指令-响应对),以及image_caption_and_synthetic_task.json(用于重现单一阶段领域特定后训练,包含500K示例)。
This dataset is intended for domain-adaptive post-training of multimodal large language models (MLLMs), specifically targeting the biomedical and food domains. It includes image-caption pairs and synthetic visual tasks, which are generated via a visual instruction synthesizer. The goal of this dataset is to enhance the domain-specific performance of MLLMs through a single-stage post-training process. The dataset consists of three main components: 1. `image_caption_pairs.json`: containing 500K image-caption pairs; 2. `synthetic_visual_tasks.json`: containing 144K synthetic instruction-response pairs; 3. `image_caption_and_synthetic_task.json`: used for reproducing single-stage domain-specific post-training, including 500K instances.
数据集概述
基本信息
- 许可证: Apache 2.0
- 任务类别:
- 视觉问答
- 图像到文本
- 语言: 英语
- 标签:
- 视觉
- 医学
- 生物学
- 数据集大小: 1M < n < 10M
配置信息
- 配置名称: image_caption_and_synthetic_task
- 数据文件: image_caption_and_synthetic_task.json
- 配置名称: image_caption_pairs
- 数据文件: image_caption_pairs.json
- 配置名称: synthetic_visual_tasks
- 数据文件: synthetic_visual_tasks.json
数据集描述
该数据集用于多模态大语言模型(MLLMs)的领域适应性后训练,特别是针对生物医学领域的视觉指令。数据集包含以下内容:
- image_caption_pairs.json: 从PubMedVision数据集中提取的50万张图像-标题对。
- synthetic_visual_tasks.json: 基于上述图像-标题对生成的14.4万条合成指令-响应对。
- image_caption_and_synthetic_task.json: 包含图像标题任务和合成视觉指令任务,总计50万条数据,用于单阶段领域特定后训练。
数据生成
使用视觉指令合成器生成基于图像-标题对的视觉指令任务,结合原始的图像标题任务,用于训练多模态大语言模型。
数据下载
-
设置依赖项: bash pip install "huggingface_hub[cli]"
-
下载文本数据: bash REPO="AdaptLLM/biomed-visual-instructions" LOCAL_DIR="./biomed-visual-instructions" FILE="image_caption_and_synthetic_task.json" huggingface-cli download --resume-download ${REPO} ${FILE} --local-dir ${LOCAL_DIR} --repo-type dataset
-
下载图像数据: bash REPO="FreedomIntelligence/PubMedVision" huggingface-cli download --resume-download ${REPO} --local-dir ${LOCAL_DIR} --repo-type dataset --include "images_*.zip"
-
解压下载的图像: bash cd ${LOCAL_DIR} for ((i=0; i<20; i++)) do unzip -j images_$i.zip -d images/ & done




