遇见数据集

CHOI0126/llava-c3-stage2

收藏
Hugging Face2026-05-20 更新2026-05-31 收录
官方服务:

资源简介:

llava-c3-stage2是一个为C3架构因果性QK-norm注入实验设计的第二阶段数据集,用于完整指令微调。它基于上游的LLaVA-1.5 Mix-665K JSON,并整合了五个图像来源:COCO 2017训练集、GQA、Visual Genome、OCR-VQA和TextVQA。数据集以压缩和parquet格式存储,下载体积约为70 GB,通过提供的setup.sh脚本在接收节点上进行解压和解析,以匹配C3实验第二阶段数据清单的布局。该数据集旨在支持多模态语言模型的研究,特别是视觉问答和图像到文本任务,并仅限于研究使用。

--- 许可证:其他 许可证名称:复合源研究专用 语言:英语 任务类别: - 视觉问答 - 图像到文本 样本量范围:10万 < 样本量 < 100万 标签: - LLaVA - 视觉语言 - 指令微调(Instruction Tuning) - 多模态大模型融合(MLLM-Merging) --- # llava-c3-stage2 — 专为C3(QK归一化(QK-norm))实验重新打包的LLaVA-1.5 Mix-665K数据集 本数据集为C3架构因果QK归一化注入实验的第二阶段(全指令微调)数据,相关实验代码开源于[minsik-choi126/mllm-model-merging](https://github.com/minsik-choi126/mllm-model-merging)。 本打包文件包含上游LLaVA-1.5 Mix-665K的JSON数据集,以及符合`training/configs/data/stage2_llava_mix665k.json`目录结构要求的全部5类图像数据源(COCO 2017训练集、GQA、Visual Genome、OCR-VQA、TextVQA),同时附带一个`setup.sh`脚本,可一键完成所有解压与Parquet格式解码操作。 所有数据源在Hugging Face Hub上均以压缩/Parquet格式存储,因此下载体积约为70GB,而非100GB;`setup.sh`会在目标节点上完成解压与解码流程。 ## 文件列表 | 资源 | 数据源来源 | Hub上的目录结构 | 执行setup.sh后的解码目录结构 | |---|---|---|---| | Mix-665K JSON 数据集 | liuhaotian/LLaVA-Instruct-150K | `llava_v1_5_mix665k.json{,l}` | 与原目录结构一致 | | COCO 2017 训练集 | BarryFutureman/COCO2017_for_llava_chunks | `images/coco/chunk_*.zip`(约19 GB) | `images/coco/train2017/*.jpg` | | GQA 图像数据集 | Feeky929/GQA-images | `images/gqa/images.zip`(约21 GB) | `images/gqa/images/*.jpg` | | Visual Genome 数据集 | BoyangZ/VisualGenome_VG_100K_1_and_2 | `images/vg/{images,images2}.zip`(约17 GB) | `images/vg/VG_100K{,_2}/*.jpg` | | OCR-VQA 数据集 | howard-hou/OCR-VQA | `images/ocr_vqa/data/*.parquet`(约8 GB) | `images/ocr_vqa/images/<ASIN>.jpg` | | TextVQA 训练集+验证集 | dl.fbaipublicfiles.com(textvqa) | `images/textvqa/train_val_images.zip`(约8 GB) | `images/textvqa/train_images/*.jpg` | | 配置辅助脚本 | 无 | `setup.sh` | 无 | ## OCR-VQA 注意事项 OCR-VQA数据集的上游Hugging Face镜像提供了16个训练分片、2个测试分片与2个验证分片,每个分片均重复包含约1万个唯一`image_id`(ASIN)键,但配套的问答对各不相同;`setup.sh`会在解码过程中完成去重,因此输出目录中每个ASIN仅对应一张`.jpg`图像。 ## 新节点快速上手指南 bash huggingface-cli login # 粘贴你的Hugging Face令牌 # 1. 下载数据集(约70 GB) hf download --repo-type dataset CHOI0126/llava-c3-stage2 --local-dir /your/data/LLaVA-Stage2 # 2. 解压解码(解压并转换OCR-VQA的Parquet格式文件) cd /your/data/LLaVA-Stage2 && bash setup.sh 执行完`setup.sh`后,`images/{coco,gqa,vg,ocr_vqa,textvqa}/...`的目录结构将完全匹配C3第二阶段数据集清单的要求。 可搭配[`CHOI0126/llava-c3-stage1`](https://huggingface.co/datasets/CHOI0126/llava-c3-stage1)使用,以获取第一阶段的投影器对齐数据。 ## 依赖要求 `setup.sh`需要系统PATH中包含`python`、`unzip`、`pyarrow`与`pillow`(使用任意最新版PyTorch虚拟环境即可满足所有依赖)。 ## 许可证与署名说明 各图像数据源保留其上游原始许可证,重新分发前请查阅相关许可条款:COCO(CC-BY-4.0)、Visual Genome(CC-BY-4.0)、GQA(CC-BY-4.0)、TextVQA(CC-BY-4.0)、OCR-VQA(研究专用)。本仓库仅对上游文件进行重新打包,以保障特定实验的可复现性,仅用于研究用途。

提供机构:
CHOI0126
二维码
社区交流群
二维码
科研交流群
商业服务