遇见数据集

CVasNLPExperiments/DTD_parition1_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_1880

收藏
Hugging Face2023-05-05 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: int64 - name: prompt dtype: string - name: true_label dtype: string - name: prediction dtype: string splits: - name: fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 830705 num_examples: 1880 - name: fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 834516 num_examples: 1880 - name: fewshot_1_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 1624134 num_examples: 1880 - name: fewshot_3_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices num_bytes: 3204157 num_examples: 1880 - name: fewshot_0__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices num_bytes: 811447 num_examples: 1880 - name: fewshot_1__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices num_bytes: 1578034 num_examples: 1880 - name: fewshot_3__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices num_bytes: 3113327 num_examples: 1880 download_size: 2393167 dataset_size: 11996320 --- # Dataset Card for "DTD_parition1_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_1880" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征: - 名称: id 数据类型: int64 - 名称: prompt 数据类型: string - 名称: true_label 数据类型: string - 名称: prediction 数据类型: string 拆分: - 名称: fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_clip_tags_ViT_L_14_simple_specific_rices 字节数: 830705 样本数: 1880 - 名称: fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices 字节数: 834516 样本数: 1880 - 名称: fewshot_1_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices 字节数: 1624134 样本数: 1880 - 名称: fewshot_3_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices 字节数: 3204157 样本数: 1880 - 名称: fewshot_0__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices 字节数: 811447 样本数: 1880 - 名称: fewshot_1__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices 字节数: 1578034 样本数: 1880 - 名称: fewshot_3__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices 字节数: 3113327 样本数: 1880 下载大小: 2393167 数据集大小: 11996320 # "DTD_parition1_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_1880"的数据集卡片 [需要更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
CVasNLPExperiments
原始信息汇总

数据集概述

数据集特征

  • id: 整数类型 (int64)
  • prompt: 字符串类型 (string)
  • true_label: 字符串类型 (string)
  • prediction: 字符串类型 (string)

数据集分割

  • fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_clip_tags_ViT_L_14_simple_specific_rices

    • 大小: 830705 字节
    • 示例数量: 1880
  • fewshot_0_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices

    • 大小: 834516 字节
    • 示例数量: 1880
  • fewshot_1_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices

    • 大小: 1624134 字节
    • 示例数量: 1880
  • fewshot_3_clip_tags_ViT_L_14_Attributes_ViT_L_14_text_davinci_003_full_clip_tags_ViT_L_14_simple_specific_rices

    • 大小: 3204157 字节
    • 示例数量: 1880
  • fewshot_0__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices

    • 大小: 811447 字节
    • 示例数量: 1880
  • fewshot_1__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices

    • 大小: 1578034 字节
    • 示例数量: 1880
  • fewshot_3__Attributes_LAION_ViT_H_14_2B_descriptors_text_davinci_003_full_clip_tags_LAION_ViT_H_14_2B_simple_specific_rices

    • 大小: 3113327 字节
    • 示例数量: 1880

数据集大小

  • 下载大小: 2393167 字节
  • 数据集总大小: 11996320 字节
搜集汇总
数据集介绍
CVasNLPExperiments/DTD_parition1_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_1880 数据集图片
构建方式
该数据集是基于DTD(Describable Textures Dataset)纹理图像分类任务构建的测试子集,命名为DTD_parition1_test_google_flan_t5_xl_mode_T_SPECIFIC_A_ns_1880。构建过程中,利用大规模语言模型Google Flan-T5 XL,在特定模式(T_SPECIFIC_A)下对纹理图像生成属性描述,并融合多种视觉语言模型的标签生成策略。数据集的1880个样本均包含唯一标识符(id)、提示文本(prompt)、真实标签(true_label)及模型预测结果(prediction),通过不同少样本设置(fewshot_0、fewshot_1、fewshot_3)以及两种不同的CLIP视觉编码器(ViT-L-14与ViT-H-14)的标签组合,系统性地评估模型在纹理属性理解上的表现。
特点
该数据集的核心特点在于其多维度、多视角的评估框架。首先,它整合了来自不同CLIP模型变体(ViT-L-14与ViT-H-14)生成的属性标签,以及text-davinci-003模型生成的描述性标签,形成丰富的标签体系。其次,通过设置0-shot、1-shot与3-shot三种少样本学习场景,全面衡量模型在不同数据稀缺条件下的泛化能力。此外,数据集的提示文本(prompt)设计精巧,能够引导模型聚焦于纹理的特定属性,从而实现对模型细粒度视觉理解能力的精准测试。每个样本均包含模型预测结果,便于直接进行性能对比与误差分析。
使用方法
该数据集主要面向多模态大语言模型在纹理图像理解任务中的评估与基准测试。使用者可直接加载JSON格式的数据,通过id字段索引样本,利用prompt字段作为模型输入,以true_label作为标准答案,对比模型生成的prediction字段来计算准确率、F1分数等分类指标。数据集提供的多个split子集允许研究者分别测试不同少样本设置下的模型表现,也可通过合并子集进行综合分析。建议在使用前对prompt进行标准化预处理,并针对CLIP标签与文本描述标签的差异设计专门的评估策略,以全面揭示模型在纹理属性识别上的能力边界。
背景与挑战
背景概述
该数据集由CVasNLPExperiments团队创建,聚焦于纹理识别领域中的细粒度分类任务。纹理分类作为计算机视觉的核心问题之一,长期受困于类间相似度高、光照与尺度变化剧烈等挑战。该数据集基于DTD(Describable Textures Dataset)的partition1测试集构建,通过引入Google Flan-T5-xl语言模型与CLIP视觉编码器的协同推理机制,探索视觉-语言模型在零样本与少样本场景下的纹理属性理解能力。数据集包含1880个样本,每个样本均配有提示词、真实标签与模型预测结果,旨在评估多模态模型对纹理特异性描述的生成与对齐效果。其研究不仅推动了视觉属性识别从封闭集向开放集的演进,也为工业质检、遥感图像分析等实际应用提供了可量化的基准。
当前挑战
当前数据集面临的核心挑战包括:其一,纹理分类的领域特异性问题,如不同材质(如粗糙、光滑)间的视觉差异细微,传统卷积网络难以捕获高阶纹理结构,而语言模型对纹理属性的语义映射仍存在歧义性,尤其在跨域泛化时表现不稳定。其二,构建过程中需平衡少样本学习的效率与标注精度,数据集中不同few-shot配置(0-shot至3-shot)下模型预测的方差显著,反映出语言引导与视觉特征融合的脆弱性。此外,多模态模型在生成纹理描述时易受提示词模板影响,导致对特定属性(如“波纹状”、“颗粒感”)的识别偏向,限制了其在真实场景中的鲁棒性。
常用场景
经典使用场景
该数据集是面向细粒度纹理分类任务构建的评测基准,其核心场景在于评估大语言模型在视觉-语言联合推理中的表现。具体而言,它整合了来自DTD(Describable Textures Dataset)的纹理图像描述,并通过多种提示模板(如特定属性描述与通用标签)与不同规模的视觉语言模型(如CLIP ViT-L/14与LAION ViT-H/14)生成的预测结果进行对比。数据集包含1880个测试样本,覆盖零样本、小样本(1-shot与3-shot)等多种学习范式,为研究者提供了系统评估模型在纹理属性理解、跨模态对齐以及泛化能力上的标准化平台。
实际应用
在实际应用中,该数据集所涉及的纹理分类与描述能力可广泛赋能工业质检、材料科学、文物修复与医疗影像分析等领域。例如,在纺织品瑕疵检测中,模型需区分细微纹理差异;在皮肤病变诊断中,纹理特征往往是良恶性判别的关键指标。该数据集通过模拟真实场景中的小样本与零样本条件,验证了模型在数据稀缺环境下的泛化潜力,从而为低资源行业部署高精度视觉语言系统提供了实证依据,推动了从实验室研究到产业落地的技术转化。
衍生相关工作
该数据集衍生了一系列关于视觉语言模型可解释性与属性理解的代表性工作。研究者在DTD数据集的基础上,进一步探索了基于属性分解的提示学习(attribute-aware prompting)与对比学习框架,如通过引入CLIP的纹理属性描述符来增强模型对细粒度特征的编码能力。此外,该数据集催生了针对多模态模型鲁棒性的消融研究,分析了不同视觉编码器(如ViT-L/14与ViT-H/14)与文本生成策略(如简单标签 vs. 特定属性描述)对最终分类性能的交互影响,为后续开发更忠实于视觉内容的生成式模型奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务