FreedomIntelligence/ALLaVA-4V-Chinese
收藏资源简介:
--- license: apache-2.0 task_categories: - question-answering - text-generation language: - zh tags: - GPT-4V - LVLM - Vision - Language size_categories: - 1M<n<10M configs: - config_name: allava_laion data_files: - split: caption path: "allava_laion/ALLaVA-Caption-LAION-4V_Chinese.json" - split: instruct path: "allava_laion/ALLaVA-Instruct-LAION-4V_Chinese.json" - config_name: allava_vflan data_files: - split: caption path: "allava_vflan/ALLaVA-Caption-VFLAN-4V_Chinese.json" - split: instruct path: "allava_vflan/ALLaVA-Instruct-VFLAN-4V_Chinese.json" # - config_name: allava_laion_instruction # data_files: "allava_laion/ALLaVA-Instruct-LAION-4V.json" # configs: # - config_name: default # data_files: # - split: allava_laion_caption # path: "allava_laion/ALLaVA-Caption-LAION-4V.json" # - split: allava_laion_instruction # path: "allava_laion/ALLaVA-Instruction-LAION-4V.json" # configs: # - config_name: default # - data_files: # - split: allava_laion_caption # - path: # - "allava_laion/ALLaVA-Caption-LAION-4V.json" # - split: allava_laion_instruction # - path: # - "allava_laion/ALLaVA-Instruction-LAION-4V.json" --- ## ALLaVA-4V for Chinese This is the Chinese version of the ALLaVA-4V data. We have translated the ALLaVA-4V data into Chinese through ChatGPT and instructed ChatGPT not to translate content related to OCR. The original dataset can be found [here](https://huggingface.co/datasets/FreedomIntelligence/ALLaVA-4V), and the image data can be downloaded from [ALLaVA-4V](https://huggingface.co/datasets/FreedomIntelligence/ALLaVA-4V). #### Citation If you find our data useful, please consider citing our work! We are FreedomIntelligence from Shenzhen Research Institute of Big Data and The Chinese University of Hong Kong, Shenzhen. ``` @misc{chen2024allava, title={ALLaVA: Harnessing GPT4V-synthesized Data for A Lite Vision-Language Model}, author={Guiming Hardy Chen and Shunian Chen and Ruifei Zhang and Junying Chen and Xiangbo Wu and Zhiyi Zhang and Zhihong Chen and Jianquan Li and Xiang Wan and Benyou Wang}, year={2024}, eprint={2402.11684}, archivePrefix={arXiv}, primaryClass={cs.CL} } ```
许可证:Apache-2.0 任务类别: - 问答(question-answering) - 文本生成(text-generation) 语言: - 中文(zh) 标签: - GPT-4V - 大视觉语言模型(LVLM) - 视觉(Vision) - 语言(Language) 样本量区间:100万 < 样本量 < 1000万 配置项: - 配置名称:allava_laion 数据文件: - 拆分:图像描述(caption) 路径:"allava_laion/ALLaVA-Caption-LAION-4V_Chinese.json" - 拆分:指令微调(instruct) 路径:"allava_laion/ALLaVA-Instruct-LAION-4V_Chinese.json" - 配置名称:allava_vflan 数据文件: - 拆分:图像描述(caption) 路径:"allava_vflan/ALLaVA-Caption-VFLAN-4V_Chinese.json" - 拆分:指令微调(instruct) 路径:"allava_vflan/ALLaVA-Instruct-VFLAN-4V_Chinese.json" # - 配置名称:allava_laion_instruction # 数据文件:"allava_laion/ALLaVA-Instruct-LAION-4V.json" # 配置项: # - 配置名称:默认(default) # 数据文件: # - 拆分:allava_laion_caption # 路径:"allava_laion/ALLaVA-Caption-LAION-4V.json" # - 拆分:allava_laion_instruction # 路径:"allava_laion/ALLaVA-Instruction-LAION-4V.json" # 配置项: # - 配置名称:默认(default) # - 数据文件: # - 拆分:allava_laion_caption # - 路径: # - "allava_laion/ALLaVA-Caption-LAION-4V.json" # - 拆分:allava_laion_instruction # - 路径: # - "allava_laion/ALLaVA-Instruction-LAION-4V.json" ## 面向中文的 ALLaVA-4V 数据集 本数据集为 ALLaVA-4V 的中文版本。我们通过 ChatGPT 将原始 ALLaVA-4V 数据集翻译为中文,并要求 ChatGPT 不对与光学字符识别(OCR,Optical Character Recognition)相关的内容进行翻译。 原始数据集可于[此处](https://huggingface.co/datasets/FreedomIntelligence/ALLaVA-4V)获取,图像数据亦可从[ALLaVA-4V](https://huggingface.co/datasets/FreedomIntelligence/ALLaVA-4V)下载。 #### 引用声明 若您的研究中使用了本数据集,请引用我们的相关工作!我们是来自深圳大数据研究院与香港中文大学(深圳)的 FreedomIntelligence 团队。 @misc{chen2024allava, title={ALLaVA: Harnessing GPT4V-synthesized Data for A Lite Vision-Language Model}, author={Guiming Hardy Chen and Shunian Chen and Ruifei Zhang and Junying Chen and Xiangbo Wu and Zhiyi Zhang and Zhihong Chen and Jianquan Li and Xiang Wan and Benyou Wang}, year={2024}, eprint={2402.11684}, archivePrefix={arXiv}, primaryClass={cs.CL} }
数据集概述
基本信息
- 许可证:Apache-2.0
- 任务类别:
- 问答
- 文本生成
- 语言:中文
- 标签:
- GPT-4V
- LVLM
- Vision
- Language
- 数据集大小:1M<n<10M
配置信息
- 配置名称:allava_laion
- 数据文件:
- 分割:caption
- 路径:"allava_laion/ALLaVA-Caption-LAION-4V_Chinese.json"
- 分割:instruct
- 路径:"allava_laion/ALLaVA-Instruct-LAION-4V_Chinese.json"
- 分割:caption
- 数据文件:
- 配置名称:allava_vflan
- 数据文件:
- 分割:caption
- 路径:"allava_vflan/ALLaVA-Caption-VFLAN-4V_Chinese.json"
- 分割:instruct
- 路径:"allava_vflan/ALLaVA-Instruct-VFLAN-4V_Chinese.json"
- 分割:caption
- 数据文件:
数据集描述
- 版本:中文版
- 翻译说明:通过ChatGPT将ALLaVA-4V数据翻译成中文,并指示ChatGPT不翻译与OCR相关的内容。
引用信息
- 作者:Guiming Hardy Chen, Shunian Chen, Ruifei Zhang, Junying Chen, Xiangbo Wu, Zhiyi Zhang, Zhihong Chen, Jianquan Li, Xiang Wan, Benyou Wang
- 标题:ALLaVA: Harnessing GPT4V-synthesized Data for A Lite Vision-Language Model
- 年份:2024
- arXiv:2402.11684
- 主要类别:cs.CL




