ButterChicken98/soyabean_ymv_plus_healthy_rag_short_ablation
收藏资源简介:
该数据集是一个多模态数据集,包含1400个训练样本,每个样本由图像和文本组成。特征包括:图像(image)、单个标题(caption)、多个标题(captions)、标签(label)、随机提示(prompt_random)及其ID、基于检索的提示(prompt_retrieval_k1)及其ID和分数、RAG(检索增强生成)提示(prompt_rag_k2_slm)及其ID列表和分数列表,以及相关元数据如rag_short_class_key和rag_short_source_corpus。数据集设计用于支持图像描述生成、提示工程和检索增强生成任务,可能用于评估或训练NLP和计算机视觉模型。
This is a multimodal dataset containing 1400 training samples, where each sample consists of an image and paired text. Its features include: image, single caption, multiple captions, label, random prompt (prompt_random) along with its ID, retrieval-based prompt (prompt_retrieval_k1) along with its ID and score, RAG (Retrieval-Augmented Generation) prompt (prompt_rag_k2_slm) along with its ID list and score list, as well as relevant metadata such as rag_short_class_key and rag_short_source_corpus. This dataset is designed to support tasks including image caption generation, prompt engineering and retrieval-augmented generation, and can be utilized for evaluating or training natural language processing (NLP) and computer vision models.



