遇见数据集

imageomics/fine-grained-challenges

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Fine-Grained Challenges数据集收集了视觉相似的动物图像组,用于测试生物图像分类器。它在一个Lance数据集中结合了图像、分类学、来源和来自三个BioCLIP家族模型的冻结嵌入。数据集包含三个挑战组:Peromyscus(鹿鼠及其近缘种,共1,737行,其中1,332行有物种标签,405行只有属或更高分类标签,涵盖37个物种)、Ixodidae(硬蜱,共4,499行,其中4,423行有物种标签,76行只有属或更高分类标签,涵盖173个物种)和zebra(马属中的斑马物种,共397行,全部有物种标签,涵盖4个物种)。总计6,633行数据,其中6,152行有物种标签,481行只有属或更高分类标签,涵盖214个物种。数据集还包括305个仅解析到属的相机陷阱图像,这些图像未包含在BioCLIP模型的训练数据中,可用作开放式、类似野外的检查集。数据集支持细粒度图像分类、零样本分类、基于冻结嵌入的小样本分类等任务。数据来源包括TreeOfLife-200M和LILA BC等集合,图像以WebP格式存储,最大边长为720像素,并附有预计算的嵌入向量。数据集发布在CC0-1.0许可下,但每个图像保留其原始许可。

Fine-Grained Challenges collects focused groups of visually similar animals for testing biological image classifiers. It combines images, taxonomy, provenance, and frozen embeddings from three BioCLIP-family models in one Lance dataset. The dataset includes three challenge groups: Peromyscus (deermice and close relatives, with 1,737 rows, of which 1,332 are species-labeled, 405 are genus or higher, covering 37 species), Ixodidae (hard ticks, with 4,499 rows, of which 4,423 are species-labeled, 76 are genus or higher, covering 173 species), and zebra (zebra species in genus Equus, with 397 rows, all species-labeled, covering 4 species). In total, there are 6,633 rows, with 6,152 species-labeled rows, 481 genus or higher rows, covering 214 species. The dataset also includes 305 genus-only camera-trap images that were not included in the training data of the BioCLIP models and can be used as an open-ended, field-like inspection set. It supports tasks such as fine-grained image classification, zero-shot classification, few-shot classification using frozen embeddings, and more. Data sources include TreeOfLife-200M and LILA BC collections, with images stored in WebP format (maximum edge of 720 pixels) and precomputed embeddings. The dataset is released under CC0-1.0, but each image retains its original license.

提供机构:
imageomics
搜集汇总
数据集介绍
imageomics/fine-grained-challenges 数据集图片
构建方式
该数据集精选了视觉上高度相似且具有生物学意义的动物图像,旨在构建细粒度分类挑战。其图像数据主要源自TreeOfLife-200M数据集,并通过固定随机种子对每个物种进行至多100张图像的采样。此外,还整合了来自LILA BC数据库的相机捕捉图像,这些图像经MegaDetector筛选以确保包含动物目标。所有图像均经过Lanczos重采样至最大边长为720像素,并编码为无损WebP格式。与此同时,数据集还附带了通过BioCLIP系列模型(BioCLIP、BioCLIP 2、BioCLIP 2.5)生成的冻结图像嵌入向量,并采用Lance数据格式进行存储,以便高效检索与分析。
特点
该数据集的核心特点在于其专注于三个极具挑战性的细粒度分类组:鹿鼠(Peromyscus)、硬蜱科(Ixodidae)以及斑马属(Equus)。这些组内物种间形态高度相似,为生物图像分类器提供了严格的测试场景。数据集共包含6,633条记录,其中6,152条具有明确的物种标签,并附有完整的分类学等级、来源出处及许可信息。值得强调的是,数据集存储了来自三代BioCLIP模型(维度分别为512、768、1024)的原始未归一化嵌入,便于直接进行零样本与少样本分类方法的比较,同时避免了重复的图像编码计算开销。
使用方法
用户可以通过HuggingFace远程加载Lance数据集,利用列投影与过滤下推技术高效检索元数据,无需读取完整的图像数据。对于可重复性分析,推荐下载标记版本并在本地打开。图像可从存储的WebP字节中解码为PIL Image对象。数据集未预设训练-测试划分,用户需根据观察层级(如物种、来源)自行构造合理的分割策略,以防止近重复样本泄露。在进行基于余弦相似度的分类或模型比较前,务必对存储的嵌入进行L2归一化处理。评估结果应针对每个挑战组分别报告,以体现模型的细粒度区分能力。
背景与挑战
背景概述
细粒度图像分类是计算机视觉与生物多样性交叉领域的研究热点,旨在区分外观高度相似的物种,这对于生态监测、物种保护和生物信息学具有深远意义。然而,广泛使用的通用图像分类基准往往掩盖了近缘物种间的识别困难。基于此,Imageomics研究所的Matthew J. Thompson等人于近期构建了Fine-Grained Challenges数据集,聚焦鹿鼠、蜱虫和斑马等三组视觉上极易混淆的物种,收集了6,633张包含完整分类学信息、来源属性及BioCLIP系列模型嵌入特征的高质量图像。该数据集不仅为测试生物图像分类器在特定挑战组上的细粒度区分能力提供了标准化检验场,还推动了零样本和少样本学习方法的公平比较,在生物视觉领域已呈现出日益增长的影响力。
当前挑战
该数据集所解决的领域核心挑战在于:通用图像分类模型常在高层次类别上表现优异,却难以在细粒度物种层面实现可靠区分,特别是对于视觉特征高度相似的近缘物种分类,这直接制约了自动化生物监测与识别系统的实用性。构建过程中面临多重严峻挑战:首先,需从海量生物图像数据库中精准筛选目标物种图像,同时严格遵循图像许可协议,排除了所有版权不明或禁止衍生作品的数据;其次,需应对数据来源的异质性,融合来自GBIF、EOL、LILA BC等不同平台的数据,统一分类学命名并使用TaxonoPy工具进行解析,确保物种标注的一致性;此外,对于来源于相机陷阱的未定种级别图像,无法获取物种标签,只能依赖自动化检测工具进行动物存在性筛查,无法进一步精化至物种层面,这为监督学习带来了天然的标签缺失局限。
常用场景
经典使用场景
在细粒度图像分类领域,生物物种间的视觉相似性常使通用分类器捉襟见肘。Fine-Grained Challenges数据集恰好填补了这一空白,它精心挑选了鹿鼠、硬蜱和斑马等视觉上高度混淆的物种群,为研究者提供了聚焦于生物学意义上难以区分的近缘物种的测试基准。该数据集不仅包含原始图像与标准化的分类学元数据,还预计算并存储了BioCLIP系列三代模型的图像嵌入向量,这使得研究者能够直接在嵌入空间中进行零样本分类、少样本学习以及检索与近邻分析等经典实验。这种设计免去了重复编码图像的计算成本,使得快速迭代和公平比较不同方法成为可能,尤其适合评估视觉-语言模型在极度相似物种判别上的真实表现。
衍生相关工作
围绕Fine-Grained Challenges数据集,目前已衍生出若干具有影响的研究方向与工具链。该数据集深度嵌入了Imageomics研究所开发的BioCLIP模型家族,包括BioCLIP、BioCLIP 2及BioCLIP 2.5,为对比不同代际视觉-语言模型在细粒度生物分类上的表征能力提供了标准化平台。在方法层面,研究者基于该数据集推动了基于嵌入空间的零样本分类框架的发展,并衍生出针对相机陷阱数据的过滤与筛选流程,如结合MegaDetector进行动物检测预处理。此外,该数据集的Lance格式存储结构启发了对大规模生物图像数据高效检索的研究,特别是利用余弦IVF-FLAT索引优化最近邻搜索。未来,该基准有望催生更多关于模型决策边界可视化、领域自适应以及少样本分类算法在生物多样性场景中的系统评估工作。
数据集最近研究
最新研究方向
该数据集聚焦于细粒度生物图像分类的前沿挑战,通过构建视觉上高度相似的动物群体(如鹿鼠、硬蜱和斑马),为验证生物图像分类器在近缘物种区分上的鲁棒性提供了精密的测试基准。其核心创新在于整合了来自GBIF、EOL等生物多样性数据库的多源图像、完整分类学元数据以及三代BioCLIP家族模型的预计算嵌入表示,支持零样本、少样本分类及嵌入空间对比分析。数据集特别引入了305张仅解析到属级的相机陷阱图像作为开放式野外观测集,模拟真实场景中分类器面对非标准样本时的表现,为评估视觉-语言模型在生物图像学中的泛化能力开辟了新的实验范式,对推动生物多样性智能监测和计算分类学的发展具有重要方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务