five

windata-vision-synthetics-zh-300k|多模态数据数据集|自然语言处理数据集

收藏
魔搭社区2025-08-15 更新2024-12-21 收录
多模态数据
自然语言处理
下载链接:
https://modelscope.cn/datasets/wair/windata-vision-synthetics-zh-300k
下载链接
链接失效反馈
资源简介:
**介绍** 我们整理生成了一个中文多模态图文指令数据集,包含了大约30万条数据以及约20万张图片,涉及文档doc、图表、数学、OCR等多种场景。 针对开源数据中中文图文指令集少且指令集描述普遍过于简短等问题,我们设计了一种基于开源模型的合成数据生成方法,利用 Qwen2-vl-72B-Instruct 生成较为详细的中文caption指令集,然后在同一场景中随机挑选1-4张图片和相应的中文caption,将caption数据给到我们的大语言模型 [WiNGPT-2.6](https://wingpt.winning.com.cn/) 通过设计系统指令使其每轮进行提问,将问题和图片给到 Qwen2-vl-72B-Instruct 使其进行回答;最后设定循环次数,得到多轮多图的对话数据。 对于生成后的数据,根据答案的长度、语句的重复性等进行了规则过滤;数学类题目,根据原始数据的答案进行了过滤。在制作最后的caption指令集时,我们针对每一个场景都设计了上百个问题,保证了caption数据集的多样性;在对话数据集上,我们在不同场景下来让WiNGPT-2.6 生成问题,得到了多样性的问题。最终我们通过合成数据的方式得到了一批多样性、答案较为详实且具有一定质量的中文多模态图文指令集。 **数据介绍** | 数据集来源 | 任务说明 | 数量 | 来源 | License | | ---------- | ------------------------------------- | ----- | ------------------------------------------------------- | -------------------------------------------------------- | | Docmatix | doc文档的caption、ocr以及多轮对话数据 | 61817 | https://huggingface.co/datasets/HuggingFaceM4/Docmatix | MIT license | | TallyQA | 通用文档的caption以及多轮对话数据 | 81950 | https://github.com/manoja328/TallyQA_dataset | Apache-2.0 license | | PlotQA | 图表数据的caption以及多轮对话数据 | 38437 | https://huggingface.co/datasets/nimapourjafar/mm_plotqa | MIT license | | Geo170KQA | 数学类数据 | 75000 | https://huggingface.co/datasets/Luckyjhg/Geo170K | Apache-2.0 license | | EST-VQA | 包含ocr类的通用场景图片数据 | 26505 | https://github.com/xinke-wang/EST-VQA | [wang2020general](https://github.com/xinke-wang/EST-VQA) | | ArXivQA | 论文截图数据 | 25540 | https://huggingface.co/datasets/taesiri/arxiv_qa | cc-by-4.0 | **单条数据示例** ```json { "image_file": "arxivqa", "image": [ "2006.11319_0.jpg" ], "conversations": [ { "from": "human", "value": "\n以下关于图中\\(z_4\\)和\\(z_6\\)之间关系的陈述中,哪一个是正确的?\nA. 随着\\(z_6\\)的增加,\\(z_4\\)单调增加。\nB. 随着\\(z_6\\)的增加,\\(z_4\\)单调减少。\nC. 当\\(\\zeta = 1\\)时,\\(z_4\\)在\\(z_6 = 1\\)处有最大值。\nD. \\(z_4\\)和\\(z_6\\)彼此成正比。" }, { "from": "gpt", "value": "图中显示,随着\\(z_6\\)的增加,\\(z_4\\)呈现为一个带有极大值的曲线,而不是单调增加或减少。在\\(\\zeta = 1\\)的曲线上,\\(z_4\\)在\\(z_6 = 1\\)处达到最大值。因此,正确答案是C。因此,正确答案是C。" } ] } ``` **解释:** - **"image_file"**: 表示图片所在的文件夹名称 - **"image"**: 列表中存放图片名称 - **"conversations"**: 对话内容,里面包含多轮和单轮的对话内容,其中 human 为人类问题,gpt 为模型回答 **参考文献** 1. Dai W, Lee N, Wang B, et al. Nvlm: Open frontier-class multimodal llms[J]. arXiv preprint arXiv:2409.11402, 2024.
提供机构:
maas
创建时间:
2024-12-20
用户留言
有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?
点击留言
数据主题
具身智能
数据集  4099个
机构  8个
大模型
数据集  439个
机构  10个
无人机
数据集  37个
机构  6个
指令微调
数据集  36个
机构  6个
蛋白质结构
数据集  50个
机构  8个
空间智能
数据集  21个
机构  5个
5,000+
优质数据集
54 个
任务类型
进入经典数据集
热门数据集

China Health and Nutrition Survey (CHNS)

China Health and Nutrition Survey(CHNS)是一项由美国北卡罗来纳大学人口中心与中国疾病预防控制中心营养与健康所合作开展的长期开放性队列研究项目,旨在评估国家和地方政府的健康、营养与家庭计划政策对人群健康和营养状况的影响,以及社会经济转型对居民健康行为和健康结果的作用。该调查覆盖中国15个省份和直辖市的约7200户家庭、超过30000名个体,采用多阶段随机抽样方法,收集了家庭、个体以及社区层面的详细数据,包括饮食、健康、经济和社会因素等信息。自2011年起,CHNS不断扩展,新增多个城市和省份,并持续完善纵向数据链接,为研究中国社会经济变化与健康营养的动态关系提供了重要的数据支持。

www.cpc.unc.edu 收录

中国区域交通网络数据集

该数据集包含中国各区域的交通网络信息,包括道路、铁路、航空和水路等多种交通方式的网络结构和连接关系。数据集详细记录了各交通节点的位置、交通线路的类型、长度、容量以及相关的交通流量信息。

data.stats.gov.cn 收录

FAOSTAT Agricultural Data

FAOSTAT Agricultural Data 是由联合国粮食及农业组织(FAO)提供的全球农业数据集。该数据集涵盖了农业生产、贸易、价格、土地利用、水资源、气候变化、人口统计等多个方面的详细信息。数据包括了全球各个国家和地区的农业统计数据,旨在为政策制定者、研究人员和公众提供全面的农业信息。

www.fao.org 收录

中国逐日格点降水数据集V2(1960–2024,0.1°)

CHM_PRE V2数据集是一套高精度的中国大陆逐日格点降水数据集。该数据集基于1960年至今共3476个观测站的长期日降水观测数据,并纳入11个降水相关变量,用于表征降水的相关性。数据集采用改进的反距离加权方法,并结合基于机器学习的LGBM算法构建。CHM_PRE V2与现有的格点降水数据集(包括CHM_PRE V1、GSMaP、IMERG、PERSIANN-CDR和GLDAS)表现出良好的时空一致性。数据集基于63,397个高密度自动雨量站2015–2019年的观测数据进行验证,发现该数据集显著提高了降水测量精度,降低了降水事件的高估,为水文建模和气候评估提供了可靠的基础。CHM_PRE V2 数据集提供分辨率为0.1°的逐日降水数据,覆盖整个中国大陆(18°N–54°N,72°E–136°E)。该数据集涵盖1960–2024年,并将每年持续更新。日值数据以NetCDF格式提供,为了方便用户,我们还提供NetCDF和GeoTIFF格式的年度和月度总降水数据。

国家青藏高原科学数据中心 收录

UIEB, U45, LSUI

本仓库提供了水下图像增强方法和数据集的实现,包括UIEB、U45和LSUI等数据集,用于支持水下图像增强的研究和开发。

github 收录