遇见数据集

CVasNLPExperiments/FGVC_Aircraft_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_3333

收藏
Hugging Face2023-05-06 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: int64 - name: prompt dtype: string - name: true_label dtype: string - name: prediction dtype: string splits: - name: fewshot_0_clip_tags_ViT_L_14_with_openai_classes_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 1486108 num_examples: 3333 - name: fewshot_1_clip_tags_ViT_L_14_with_openai_classes_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 2879731 num_examples: 3333 - name: fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 1492678 num_examples: 3333 - name: fewshot_1_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 2892999 num_examples: 3333 - name: fewshot_3_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 5701653 num_examples: 3333 - name: fewshot_0__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices num_bytes: 1428942 num_examples: 3333 - name: fewshot_1__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices num_bytes: 2771870 num_examples: 3333 - name: fewshot_3__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices num_bytes: 5457391 num_examples: 3333 download_size: 3463840 dataset_size: 24111372 --- # Dataset Card for "FGVC_Aircraft_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_3333" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 字段名:id,数据类型:64位整型 - 字段名:prompt(提示词),数据类型:字符串型 - 字段名:true_label(真实标签),数据类型:字符串型 - 字段名:prediction(模型预测结果),数据类型:字符串型 数据集拆分: - 拆分名称:少样本0_CLIP标签_ViT_L_14_带OpenAI类别_ViT_L_14属性_OpenAI Davinci 003文本模型_完整CLIP标签_ViT_L_14_简单特定水稻类,数据字节数:1486108,样本数量:3333 - 拆分名称:少样本1_CLIP标签_ViT_L_14_带OpenAI类别_ViT_L_14属性_OpenAI Davinci 003文本模型_完整CLIP标签_ViT_L_14_简单特定水稻类,数据字节数:2879731,样本数量:3333 - 拆分名称:少样本0_CLIP标签_ViT_L_14_ViT_L_14属性_OpenAI Davinci 003文本模型_完整CLIP标签_ViT_L_14_简单特定水稻类,数据字节数:1492678,样本数量:3333 - 拆分名称:少样本1_CLIP标签_ViT_L_14_ViT_L_14属性_OpenAI Davinci 003文本模型_完整CLIP标签_ViT_L_14_简单特定水稻类,数据字节数:2892999,样本数量:3333 - 拆分名称:少样本3_CLIP标签_ViT_L_14_ViT_L_14属性_OpenAI Davinci 003文本模型_完整CLIP标签_ViT_L_14_简单特定水稻类,数据字节数:5701653,样本数量:3333 - 拆分名称:少样本0_LAION_ViT_H_14_2B属性描述符_OpenAI Davinci 003文本模型_完整CLIP标签_LAION_ViT_H_14_2B简单特定水稻类,数据字节数:1428942,样本数量:3333 - 拆分名称:少样本1_LAION_ViT_H_14_2B属性描述符_OpenAI Davinci 003文本模型_完整CLIP标签_LAION_ViT_H_14_2B简单特定水稻类,数据字节数:2771870,样本数量:3333 - 拆分名称:少样本3_LAION_ViT_H_14_2B属性描述符_OpenAI Davinci 003文本模型_完整CLIP标签_LAION_ViT_H_14_2B简单特定水稻类,数据字节数:5457391,样本数量:3333 下载总大小:3463840 字节 数据集总大小:24111372 字节 # 数据集卡片:"FGVC_Aircraft_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_3333" [需要补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
CVasNLPExperiments
原始信息汇总

数据集概述

数据集特征

  • id: 整数类型 (int64)
  • prompt: 字符串类型 (string)
  • true_label: 字符串类型 (string)
  • prediction: 字符串类型 (string)

数据集分割

  • fewshot_0_clip_tags_ViT_L_14_with_openai_classes_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices
    • 大小: 1486108 字节
    • 示例数: 3333
  • fewshot_1_clip_tags_ViT_L_14_with_openai_classes_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices
    • 大小: 2879731 字节
    • 示例数: 3333
  • fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices
    • 大小: 1492678 字节
    • 示例数: 3333
  • fewshot_1_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices
    • 大小: 2892999 字节
    • 示例数: 3333
  • fewshot_3_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices
    • 大小: 5701653 字节
    • 示例数: 3333
  • fewshot_0__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices
    • 大小: 1428942 字节
    • 示例数: 3333
  • fewshot_1__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices
    • 大小: 2771870 字节
    • 示例数: 3333
  • fewshot_3__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices
    • 大小: 5457391 字节
    • 示例数: 3333

数据集大小

  • 下载大小: 3463840 字节
  • 数据集总大小: 24111372 字节
搜集汇总
数据集介绍
CVasNLPExperiments/FGVC_Aircraft_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_3333 数据集图片
构建方式
该数据集基于FGVC-Aircraft测试集构建,旨在评估大型语言模型在细粒度视觉分类任务中的零样本与少样本推理能力。构建过程中,采用了多种视觉语言模型(如CLIP ViT-L/14与LAION ViT-H/14)提取图像标签与属性描述,并借助text-davinci-003模型生成特定于飞机型号的提示词(prompt)。数据集的每个样本包含唯一标识符、提示词、真实标签及模型预测结果,以支持对模型预测一致性的深入分析。通过设置不同的少样本示例数量(0、1、3),形成了多个子集,从而系统性地探究示例数量对分类性能的影响。
使用方法
研究者可直接通过HuggingFace Datasets库加载该数据集,利用其提供的多个子集进行实验。使用时,可首先选择特定少样本配置(如fewshot_0或fewshot_3)的子集,提取其中的prompt字段作为模型输入,并将true_label字段作为评估基准。通过比较prediction与true_label,可计算准确率、F1分数等指标。此外,该数据集支持跨模型对比实验,例如分别使用基于CLIP ViT-L/14与LAION ViT-H/14生成的标签子集,以探究不同视觉编码器对语言模型推理的影响。数据集的标准化格式便于集成到现有的评估流水线中。
背景与挑战
背景概述
FGVC_Aircraft_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_3333数据集诞生于计算机视觉与自然语言处理交叉领域迅猛发展的时代,由相关研究团队基于细粒度视觉分类(FGVC)任务构建。该数据集聚焦于飞机型号的精准识别,核心研究问题在于如何利用多模态信息(如CLIP视觉特征与大语言模型生成的文本描述)提升模型在少样本场景下的分类性能。数据集创建时间约在2023年,依托HuggingFace平台发布,对推动多模态学习、提示工程以及零样本/少样本学习在细粒度分类中的应用具有重要影响,为评估语言模型辅助视觉理解的能力提供了标准化测试基准。
当前挑战
该数据集面临的核心挑战首先在于细粒度视觉分类本身的领域难题:飞机型号间差异微小,需模型捕捉细微的机翼、引擎等结构特征,对视觉表征的判别性要求极高。构建过程中,挑战则体现在多模态标签的生成与对齐上——如何从CLIP视觉编码器中提取有效属性描述,并利用大型语言模型(如Flan-T5)生成精准的提示,同时确保不同少样本设置下数据分布的均衡性与泛化能力。此外,数据集包含多种分割(如基于CLIP标签与LAION描述符的变体),其复杂组合增加了实验复现与跨方法比较的难度,对评估协议的标准化提出了更高要求。
常用场景
经典使用场景
FGVC_Aircraft_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_3333数据集在细粒度视觉分类(FGVC)领域中扮演着关键角色,尤其适用于评估和提升模型对飞机型号的精确识别能力。该数据集通过引入多模态提示(prompt)与真实标签(true_label)的配对结构,为研究者提供了在零样本或少样本条件下测试视觉-语言模型(如FLAN-T5)性能的标准化平台。其经典使用场景包括:基于CLIP视觉编码器提取的标签属性与文本描述符,结合大语言模型进行飞机细粒度分类的推理任务,从而验证模型在高度相似类别间的判别鲁棒性。
解决学术问题
该数据集着力攻克细粒度视觉分类中标注数据稀缺与类别间差异微小两大核心学术难题。通过设计多组少样本(few-shot)分割(如0-shot、1-shot、3-shot)并融合不同视觉编码器(ViT-L/14、ViT-H/14)的标签属性,研究者得以系统探究提示工程(prompt engineering)与多模态对齐策略对分类精度的影响。其意义在于推动从依赖大规模标注数据向高效利用预训练知识的方向转型,为理解视觉-语言模型在领域特定任务中的泛化边界提供了关键基准。
实际应用
在实际应用中,该数据集所代表的细粒度飞机识别技术可赋能航空安全监控、航班调度自动化及军事目标识别系统。例如,通过少样本推理快速识别机场监控画面中的异常机型,或辅助无人机在复杂场景中精准区分民用与军用飞行器。此外,基于该数据集训练的模型可集成至智能地勤系统,实现飞机维护记录与型号信息的自动关联,显著提升航空运营的数字化效率。
数据集最近研究
最新研究方向
当前,细粒度视觉分类(FGVC)领域正经历从单一视觉特征提取向多模态语义融合的范式转变。FGVC_Aircraft_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_3333数据集的出现,标志着研究者开始系统性地探索大语言模型(如Flan-T5)与视觉编码器(如ViT-L/14)的协同作用,以解决飞机型号识别中类间差异微小、背景干扰显著等核心难题。该数据集通过设计多层次的少样本学习分裂,整合了CLIP标签、属性描述与文本生成模型的输出,为评估模型在零样本与少样本场景下的视觉-语言对齐能力提供了标准化基准。其研究意义在于,它推动了将语义知识注入视觉表征的前沿尝试,使得模型不仅依赖像素级特征,更能利用语言先验进行判别,这一方向与当前多模态大模型在航空遥感、工业检测等领域的应用热点紧密相连,为构建更具鲁棒性与可解释性的细粒度分类系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务