相关数据集
OpenDCAI/dataflow-mm-context_vqa
DataFlow-MM-ContextVQA是一个大规模合成的多模态数据集,包含超过200,000个视觉问答(VQA)实例。每个实例都包含一个图像、一个自然语言问题和一个相关的上下文文档,该文档包含回答问题所需的信息。数据集的设计目的是强调上下文感知的多模态推理,要求模型同时利用视觉内容和外部文本上下文来准确回答问题。所有样本都是在DataFlow框架内自动生成的,确保了一致性和可扩展性。
Hugging Face2026-01-30 更新210
OpenDCAI/dataflow-demo-Text
该数据集包含三个独立的子数据集,展示了DataFlow项目的不同处理流程。第一个数据集是预训练过滤流程演示,展示了从Common Crawl网页数据中过滤无效页面、广告、色情和无关内容,并提取有意义信息生成结构化问答对的过程。第二个数据集是多轮对话合成数据集,包含15,240个样本,使用GPT-4o API通过ConsistentChatGenerator操作符合成的6轮多轮对话数据。第三个数据集
Hugging Face2025-12-29 更新130
OpenDCAI/dataflow-mm-region_caption
该数据集是通过预处理源数据集生成的,适用于图像文本对话生成、多模态大模型微调和视觉问答(VQA)等任务。数据集包含预处理后的图像文件和JSONL格式的注释文件,注释文件中每条记录与一张图像相关联,包含用户和助手之间的对话内容,描述了图像中特定区域的内容。数据集的源数据集是ReferItGame数据集,提供了高质量的自然场景图像和对象参考任务的基础材料。
Hugging Face2026-02-05 更新120
OpenDCAI/dataflow-demo-code
该数据集是DataFlow项目中代码数据处理管道的演示,提供了经过处理和验证的代码SFT监督对。数据集的目的是通过多阶段处理管道将原始指令数据转换为高质量的监督微调(SFT)代码数据。处理步骤包括指令增强、代码生成、质量过滤和沙盒过滤。最终输出是一个经过筛选的指令-代码对数据集,适用于训练代码生成模型。数据集包含三种不同规模的子集:DataFlow-Code-1K、DataFlow-Code-5K
Hugging Face2025-12-24 更新170
OpenDCAI/FlipVQA
--- license: apache-2.0 configs: - config_name: Multimodal data_files: - split: train path: Multimodal/train-* - split: test path: Multimodal/test-* - config_name: Text_base data_files
Hugging Face2026-04-04 更新130



