Multimodal C4 (mmc4)是由University of California, Santa Barbara等机构开发的开放式十亿规模图像与文本交错数据集。该数据集通过线性分配算法,利用CLIP特征将图像嵌入到c4文本数据集中,覆盖烹饪、旅行、技术等多个日常主题。经过过滤不适当内容后,数据集包含1.012亿文档,其中交错嵌入了5.71亿图像和430亿英语词汇。mmc4旨在支持复杂的视
The IMed-361M dataset is the largest publicly available multimodal interactive medical image segmentation dataset, featuring 6.4 million images, 273.4 million masks (56 masks per image), 14 imaging mo