相关数据集
Obscure-Entropy/GBC10M_HU
该数据集是对现有图像字幕数据集的扩展,特别针对基于图表的字幕生成(GBC)进行了增强,并增加了匈牙利语翻译。数据集包含约1000万条字幕,分为10个parquet文件,便于部分或全部下载。数据字段包括图像的URL、图像本身、英文描述和匈牙利语描述。数据集主要用于图像到文本的任务,特别是GBC和跨语言应用。
Hugging Face2024-08-14 更新160
Obscure-Entropy/GBC10M_filtered
该数据集包含两个特征:url(字符串类型)和caption(字符串类型)。数据集仅包含一个训练集,训练集有10128574个样本,总大小为7801648013字节。数据集的下载大小为4156555872字节。数据集的配置名为default,训练数据文件路径为data/train-*。
Hugging Face2024-07-19 更新120
Obscure-Entropy/CLIP_Image_Embeddings_AppleFlair_Llava_Deepl_1k
该数据集包含图像和图像嵌入两个主要特征。图像嵌入以float64类型的序列表示。数据集分为一个训练集,包含1000个样本,总大小为101399384.0字节。下载大小为101477804字节,数据集总大小为101399384.0字节。数据文件路径为data/train-*。
Hugging Face2024-07-20 更新80
Obscure-Entropy/CLIP_Embeddings_AppleFlair_Llava_Deepl_1k
该数据集包含两个主要特征:text_EN和embeddings。text_EN是字符串类型,表示英文文本;embeddings是浮点数序列,可能表示文本的嵌入向量。数据集仅包含一个训练集,共有1000个样本,总大小为4182331字节。数据集的下载大小为3461919字节,配置名为default,数据文件路径为data/train-*。
Hugging Face2024-07-20 更新130
Obscure-Entropy/GBC_mini
--- dataset_info: features: - name: img dtype: image - name: hu_cap dtype: string splits: - name: train num_bytes: 370668209.7816 num_examples: 8056 download_size: 42156003
Hugging Face2024-08-12 更新100



