遇见数据集

augury-vision-gallery

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

AUGURY Vision Gallery 是一个用于物种图像检索的数据集,专为 AUGURY 的 photo→species 漏斗设计。该数据集包含 111,320 张图片,涵盖 2,174 个物种,图像经过 DINOv2-base 编码后作为 FAISS kNN 检索库使用。数据集无需重新训练模型即可扩展——新物种只需添加新照片和数据库记录即可。数据集结构包括:images/目录下的图片文件和侧车文件、species_list.json、train.jsonl和val.jsonl(LLaMA-Factory sharegpt格式)、dataset_info.json。图像来源包括iNaturalist研究级图片约110k张、DeepWeeds数据集约5.2k张、GBIF补充图片数十张。整体为非商业用途,商业使用需移除NC图片或与摄影师协商。

AUGURY Vision Gallery is a dataset for species image retrieval, designed for AUGURYs photo→species funnel. It contains 111,320 images covering 2,174 species, encoded with DINOv2-base and used as a FAISS kNN retrieval library. The dataset can be extended without retraining the model—new species only require adding new photos and database records. The dataset structure includes: images/ directory with image files and sidecar files, species_list.json, train.jsonl and val.jsonl (in LLaMA-Factory sharegpt format), and dataset_info.json. Image sources include ~110k research-grade iNaturalist images, ~5.2k DeepWeeds dataset images, and dozens of GBIF supplementary images. The overall dataset is for non-commercial use; commercial use requires removing NC images or negotiating with photographers.

创建时间:
2026-08-12
原始信息汇总

AUGURY Vision Gallery 数据集详情

数据集概述

AUGURY Vision Gallery 是一个用于物种识别检索的图像数据集,包含 111,320 张图片,覆盖 2,174 个物种。数据集设计为 FAISS kNN 检索库(使用 DINOv2-base 嵌入),支持在不重新训练模型的情况下,通过新增图片和数据库记录来扩充物种库。

数据内容

  • 图像文件:存储于 images/<物种键>/<文件名>.jpg,其中来源于 iNaturalist 的图片为研究级质量。
  • 许可信息:每个物种目录下包含 sources.jsonl 文件,逐张记录图片的 photo_idfilelicensesource 等许可信息,使用前必须查阅。
  • 物种列表species_list.json 包含 2,230 个物种条目,附有 is_au 标记和指示数据。
  • 训练/验证划分
    • train.jsonl:58,121 行(LLaMA-Factory sharegpt 格式)
    • val.jsonl:6,519 行
    • 两个文件中的图像路径均为相对路径,assistant 答案由数据库生成。
  • 注册配置dataset_info.json 用于 LLaMA-Factory 的注册。

图片来源与许可

来源 数量 许可类型
iNaturalist(研究级) ~110,000 张 逐张许可:cc0 / cc-by / cc-by-sa / cc-by-nc / cc-by-nc-sa / cc-by-nc-nd(详见 sidecar 文件)
DeepWeeds(5 个澳大利亚物种) ~5,200 张 CC BY 4.0
GBIF 补缺 数十张 逐条记录许可(见 sidecar 文件)

重要提示:整个数据集整体为非商业用途,因为 iNaturalist 中的 cc-by-nc 图片不可重新许可。如需商业使用,必须移除 NC 类图片或与摄影师单独协商。使用时应按照 sidecar 文件中的要求标注摄影师信息。

构建方法

可通过 scripts/vision/build_llamafactory_dataset.py 脚本重新生成训练/验证划分,支持设置每物种数量上限、随机种子(seed 42)及相对图像路径。

搜集汇总
数据集介绍
augury-vision-gallery 数据集图片
构建方式
该数据集为AUGURY物种识别系统的视觉检索画廊,汇聚了111,320张图像,覆盖2,174个物种,以FAISS kNN库形式构建,采用DINOv2-base嵌入。图像来源以iNaturalist研究级数据为主,辅以DeepWeeds和GBIF补充,每张图像均附带逐图许可信息侧车文件,确保版权清晰。数据集通过脚本动态划分训练与验证集,基于LLaMA-Factory的sharegpt格式生成58,121和6,519条对话记录,且支持在不重新训练模型的情况下扩展新物种。
特点
该数据集的核心特色在于其灵活的增长机制与高度透明的版权管理。新物种的加入仅需新增图像与数据库记录,无需重新训练模型,实现了持续演化的检索库。许可信息详尽,每张图像均注明作者与许可类型,虽然整体呈现非商业性质,但为合规使用提供了明确依据。此外,数据集中涵盖了物种分布指示数据及澳大利亚特有物种标志,为生态学研究提供了丰富元数据。
使用方法
使用时,用户需首先读取每幅图像对应的sources.jsonl侧车文件,以确认许可条款。随后可依据species_list.json筛选目标物种,并利用提供的train.jsonl与val.jsonl进行模型微调,其格式直接兼容LLaMA-Factory框架。检索功能通过FAISS kNN实现,采用DINOv2嵌入,便于快速匹配查询图像与库内图像。构建新分割版本可运行脚本,支持按物种设置上限及固定随机种子,确保可复现性。
背景与挑战
背景概述
AUGURY Vision Gallery数据集由AUGURY团队于近期构建,旨在支持基于照片的物种识别漏斗,涉及2,174个物种的111,320张图像。该数据集作为FAISS kNN检索库,采用DINOv2-base嵌入,无需模型重训练即可动态扩展新物种,仅需添加新照片和数据库记录。其核心研究问题在于构建一个可扩展、多来源的图像检索库,以支持生态监测和生物多样性研究。数据集整合了iNaturalist研究级图像、DeepWeeds子集及GBIF补充数据,并提供了详细的许可证元数据,对计算机视觉与生态学的交叉领域具有重要影响力,为物种识别和零样本学习提供了大规模基准。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:物种识别需处理类内变异大、类间相似性高以及长尾分布等难题,同时需兼顾图像质量与标注准确性。在构建过程中,挑战则涉及多源数据的整合与许可证合规性——iNaturalist非商业许可限制了商业用途,需过滤或协商;不同来源的图像分辨率、拍摄条件差异大,需统一嵌入空间;此外,动态扩展机制要求高效更新FAISS索引而不中断现有服务,且需平衡物种覆盖度与数据平衡性,避免模型偏向常见物种。
常用场景
经典使用场景
该数据集作为视觉检索画廊,依托DINOv2-base嵌入向量构建FAISS kNN库,核心服务于图像到物种的识别流程。其经典使用场景涵盖基于内容的图像检索、零样本物种分类及跨模态检索任务的基准测试。研究者可运用该数据集评估检索模型在细粒度视觉识别上的性能,尤其适合探索大规模嵌入索引在生物多样性监测中的应用,通过查询图像快速获取最相近的物种图片及其标签,从而验证算法在开放集识别上的泛化能力。
衍生相关工作
该数据集的涌现催生了多项衍生研究,包括基于DINOv2特征的检索模型微调、针对细粒度分类的跨模态知识蒸馏,以及面向百万级画廊的高效索引压缩技术。其训练/验证划分格式兼容LLaMA-Factory,启发了将视觉检索与多模态大语言模型结合的图像描述与问答工作,例如基于物种细粒度特征的自动解说生成。同时,对许可信息的结构化存储促成了版权敏感型数据集构建的讨论,衍生出面向合规AI训练的数据治理框架研究。
数据集最近研究
最新研究方向
针对生物多样性监测与物种识别领域,augury-vision-gallery数据集的最新研究方向聚焦于构建可持续扩展的视觉检索系统,其基于DINOv2-base嵌入的FAISS kNN库设计,实现了无需模型重训的动态物种扩充能力,为生态学中的自动物种鉴定提供了高效解决方案。该数据集整合了iNaturalist研究级图片、DeepWeeds及GBIF补充数据,覆盖2174种物种,并通过精细的许可协议管理,确保了科研合规性,同时为多模态大语言模型训练提供了1.1万幅图像和6.5万条对话级指令数据,推动了视觉-语言模型在细粒度物种识别任务中的应用。其独特之处在于动态增长的图像库与DB行关联机制,使得模型能够持续适应新物种,无需重新训练,这一特性在快速变化的生态监测场景中意义重大,为实时生物多样性评估和濒危物种追踪开辟了新的可能性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务