遇见数据集

Multimodal-Fatima/OxfordFlowers_test_facebook_opt_1.3b_Attributes_Caption_ns_6149

收藏
Hugging Face2023-02-01 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: int64 - name: image dtype: image - name: prompt dtype: string - name: true_label dtype: string - name: prediction dtype: string - name: scores sequence: float64 splits: - name: fewshot_0_bs_16 num_bytes: 267305744.375 num_examples: 6149 - name: fewshot_1_bs_16 num_bytes: 269129531.375 num_examples: 6149 - name: fewshot_3_bs_16 num_bytes: 272760442.375 num_examples: 6149 download_size: 796855399 dataset_size: 809195718.125 --- # Dataset Card for "OxfordFlowers_test_facebook_opt_1.3b_Attributes_Caption_ns_6149" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征: - 名称:id,数据类型:64位整数(int64) - 名称:image,数据类型:图像 - 名称:prompt,数据类型:提示文本 - 名称:true_label,数据类型:真实标签 - 名称:prediction,数据类型:预测结果 - 名称:scores,数据类型:64位浮点数序列 数据集划分: - 名称:零样本、批次大小16(fewshot_0_bs_16),字节占用大小:267305744.375,样本总数:6149 - 名称:少样本1、批次大小16(fewshot_1_bs_16),字节占用大小:269129531.375,样本总数:6149 - 名称:少样本3、批次大小16(fewshot_3_bs_16),字节占用大小:272760442.375,样本总数:6149 下载总大小:796855399 数据集总大小:809195718.125 --- # 「OxfordFlowers_test_facebook_opt_1.3b_Attributes_Caption_ns_6149」数据集卡片 [需要更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
Multimodal-Fatima
原始信息汇总

数据集概述

数据集名称

"OxfordFlowers_test_facebook_opt_1.3b_Attributes_Caption_ns_6149"

数据集特征

  • id: 整数类型 (int64)
  • image: 图像类型
  • prompt: 字符串类型 (string)
  • true_label: 字符串类型 (string)
  • prediction: 字符串类型 (string)
  • scores: 序列类型,浮点数 (float64)

数据集分割

  • fewshot_0_bs_16:
    • 示例数量: 6149
    • 数据大小: 267305744.375 字节
  • fewshot_1_bs_16:
    • 示例数量: 6149
    • 数据大小: 269129531.375 字节
  • fewshot_3_bs_16:
    • 示例数量: 6149
    • 数据大小: 272760442.375 字节

数据集大小

  • 下载大小: 796855399 字节
  • 数据集总大小: 809195718.125 字节
搜集汇总
数据集介绍
Multimodal-Fatima/OxfordFlowers_test_facebook_opt_1.3b_Attributes_Caption_ns_6149 数据集图片
构建方式
该数据集基于OxfordFlowers测试集构建,通过引入预训练语言模型facebook/opt-1.3b对花卉图像生成属性描述与标题,并利用负采样策略(ns_6149)筛选出6149个样本。每个样本包含图像、提示词、真实标签、模型预测结果及预测得分,形成多模态评估数据。数据集分为三个子集(fewshot_0_bs_16、fewshot_1_bs_16、fewshot_3_bs_16),分别对应不同少样本学习设置,以支持模型性能的细粒度分析。
使用方法
该数据集主要用于评估图像分类或视觉语言模型在花卉识别任务中的表现。使用者可加载图像与提示词作为输入,通过比对真实标签与预测结果计算准确率、F1分数等指标。得分序列可用于校准模型置信度或进行错误分析。子集划分支持不同少样本学习策略的对比实验,例如在0-shot、1-shot和3-shot设置下检验模型泛化能力。推荐使用HuggingFace Datasets库直接加载,并配合PyTorch或TensorFlow进行模型推理。
背景与挑战
背景概述
在视觉与语言多模态研究领域,图像描述生成与细粒度分类的交叉问题日益受到关注。Multimodal-Fatima/OxfordFlowers_test_facebook_opt_1.3b_Attributes_Caption_ns_6149数据集由多模态研究团队于近期构建,依托牛津花卉数据集(Oxford Flowers)这一经典基准,旨在评估大规模语言模型(如Facebook OPT-1.3B)在零样本或少样本条件下对花卉图像的属性理解与描述生成能力。该数据集通过引入属性注释和多样化提示,探索了模型在细粒度视觉识别与自然语言生成之间的协同表现,其核心研究问题聚焦于模型能否准确捕捉花卉的视觉特征并转化为语义一致的描述,对推动多模态模型的泛化性与可解释性具有重要价值。
当前挑战
当前数据集面临多重挑战。首先,在领域问题层面,细粒度花卉分类与描述生成要求模型区分高度相似的品种(如不同玫瑰种类),而现有模型常混淆细微视觉差异,导致语义描述失准;同时,少样本设置加剧了数据稀疏性,模型难以从有限示例中泛化至新类别。其次,在构建过程中,属性标注的客观性与一致性难以保证,不同标注者对花卉颜色、形状等特征的解读存在主观偏差;此外,提示(prompt)设计需平衡多样性与有效性,以避免误导模型或引入噪声,而OPT-1.3B等模型在长尾分布下的预测偏差进一步增加了评估难度。
常用场景
经典使用场景
该数据集以牛津花卉数据集为图像基础,结合了Facebook OPT-1.3B模型生成的属性描述与标题,构建了一个多模态评估基准。其经典使用场景在于评估大规模语言模型在视觉语言任务中的零样本或小样本推理能力,尤其是在图像分类与属性识别领域,通过对比真实标签与模型预测,量化模型对视觉语义的理解精度。
解决学术问题
该数据集解决了多模态学习中模型鲁棒性与泛化性评估的难题,尤其是在小样本场景下,传统数据集缺乏细粒度属性标注与模型预测的对比分析。它提供了结构化预测分数与样本划分,使研究者能够深入探究语言模型在视觉任务中的偏差、错误模式及知识迁移效率,推动了视觉语言模型可解释性与可靠性研究的进展。
实际应用
在实际应用中,该数据集可服务于智能农业中的花卉品种自动识别系统,辅助植物学家进行物种分类与属性标注。同时,它可用于优化电商平台的图像搜索与推荐算法,通过多模态理解提升用户对细粒度商品属性的查询匹配精度,并支持教育领域中的植物学教学工具开发,实现视觉与文本知识的联动。
数据集最近研究
最新研究方向
该数据集聚焦于多模态学习与视觉语言模型在细粒度图像分类中的前沿探索,特别是基于OxfordFlowers数据集的零样本和少样本场景下,结合大规模语言模型(如OPT-1.3B)生成的属性描述与图像特征,对模型预测行为进行深入分析。当前研究热点包括利用属性增强的视觉语言对齐技术提升模型对花卉品种的判别能力,以及通过对比模型预测与真实标签的差异,揭示语言模型在视觉任务中的偏差与鲁棒性。该数据集为评估多模态模型在细粒度分类中的泛化性能提供了标准化测试基准,并与近期关于视觉语言模型在开放世界识别和分布外检测的研究紧密关联,推动了可解释人工智能与多模态推理的交叉发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务