Multimodal C4 (mmc4)是由University of California, Santa Barbara等机构开发的开放式十亿规模图像与文本交错数据集。该数据集通过线性分配算法,利用CLIP特征将图像嵌入到c4文本数据集中,覆盖烹饪、旅行、技术等多个日常主题。经过过滤不适当内容后,数据集包含1.012亿文档,其中交错嵌入了5.71亿图像和430亿英语词汇。mmc4旨在支持复杂的视
GRATH数据集用于论文《GRATH: Gradual Self-Truthifying for Large Language Models》中的成对真实性训练数据。数据集包含由Llama2-7B、Llama2-13B和Zephyr-7B生成的三个子集,每个子集包含pretrained_gen和selftruth_gen两个分割。pretrained_gen分割包含由预训练基础模型生成的数据,用于