遇见数据集

bio-lens

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

iNaturalist Silver Dataset是一个经过处理的研究级生物多样性图像数据集,源自iNaturalist平台。该数据集专门筛选了社区验证的“研究级”观察记录,并通过去重流程确保每个观察仅保留一张代表性照片。所有图像均采用AVIF格式编码,以二进制形式存储在Parquet文件中,总数据量约5.6TB,分布在超过4万个分片中。数据集包含约1.426亿张照片,对应约1.428亿个研究级观察,覆盖约6890个生物科和约505K个分类单元。每个数据样本包含11个字段:唯一照片ID、去重后的观察UUID、分类单元ID、科学名称、分类谱系路径、分类等级(如物种、属、科等)、AVIF编码的图像二进制数据、照片许可证、观察质量等级(始终为“research”)、观察纬度和经度。图像经过处理,移除了EXIF/XMP元数据,平均大小约为15-30KB。数据集主要适用于计算机视觉任务,特别是物种分类和生物多样性研究。需要注意的是,数据集中的照片遵循多种知识共享许可证,但仅限非商业研究用途。

The iNaturalist Silver Dataset is a processed research-grade biodiversity image dataset derived from the iNaturalist platform. It specifically filters community-verified research-grade observations and ensures only one representative photo per observation through a deduplication process. All images are encoded in AVIF format and stored as binary data in Parquet files, with a total data volume of approximately 5.6TB distributed across over 40,000 shards. The dataset includes about 142.6 million photos, corresponding to about 142.8 million research-grade observations, covering approximately 6,890 biological families and about 505K taxonomic units. Each data sample contains 11 fields: unique photo ID, deduplicated observation UUID, taxon ID, scientific name, taxonomic lineage path, taxonomic rank (e.g., species, genus, family), AVIF-encoded image binary data, photo license, observation quality grade (always research), observation latitude, and longitude. The images have been processed to remove EXIF/XMP metadata, with an average size of about 15-30KB. The dataset is primarily suitable for computer vision tasks, particularly species classification and biodiversity research. It is important to note that the photos in the dataset follow various Creative Commons licenses but are restricted to non-commercial research use.

创建时间:
2026-06-07
原始信息汇总

🌿 iNaturalist Silver Dataset (Research-Grade, Deduplicated)

数据集描述

该数据集包含来自 iNaturalist 的研究级观察数据,经过青铜层到银层的处理流程,包括:

  • 仅含研究级观察数据(社区验证)
  • 每个观察一张照片(按 observation_uuid 去重)
  • AVIF 编码图像,以二进制格式存储在 Parquet 文件中
  • 总大小约 ~5.6 TB,分布在超过 4 万个分片中

数据组成

指标 数量
总照片数 ~1.426亿
研究级观察数 ~1.428亿
含照片的独特科 ~6,890
独特分类单元 ~50.5万
分片数 ~41,315 个 Parquet 文件
分片大小 每个约 500MB

按照片数量排名前10的科

照片数
Asteraceae(菊科/向日葵) 1,170万
Fabaceae(豆科) 640万
Nymphalidae(蛱蝶科) 560万
Anatidae(鸭科) 480万
Rosaceae(蔷薇科) 360万
Apidae(蜜蜂科) 340万
Lamiaceae(唇形科) 300万
Poaceae(禾本科) 290万
Accipitridae(鹰科) 290万
Orchidaceae(兰科) 270万

文件结构

data/train/ ├── 0000.parquet ├── 0001.parquet ├── ... └── 41315.parquet

数据模式

列名 类型 描述
photo_id int64 唯一照片标识符
observation_uuid string 观察UUID(已去重,每个观察一条)
taxon_id int64 iNaturalist 分类单元ID
taxon_name string 科学名称
ancestry string 分类谱系路径
rank string 等级(种、属、科等)
image binary AVIF 编码图像
license string 照片许可证
obs_quality_grade string 始终为 "research"
latitude double 观察纬度
longitude double 观察经度

图像格式

  • 格式:AVIF(AV1 图像文件格式)
  • 质量:75
  • 尺寸:原始尺寸(保留)
  • 平均大小:约 15-30 KB
  • 元数据:已剥离(EXIF/XMP 已移除)

许可证

照片包含观察者选择的许可证:CC0、CC-BY、CC-BY-NC、CC-BY-SA、CC-BY-NC-SA、CC-BY-ND、CC-BY-NC-ND。

⚠️ 仅限非商业研究用途

使用示例

python import polars as pl

加载所有数据

df = pl.read_parquet("data/train/*.parquet")

按科过滤

beetles = df.filter(pl.col("family") == "Carabidae")

访问图像

row = df.first() image_bytes = row[image]

处理流程

该数据集通过以下步骤创建:

  1. 关联照片、观察数据和分类学信息
  2. 筛选出研究级观察数据
  3. 去重,每个观察保留一张照片
  4. 将图像转换为 AVIF 格式
  5. 分片为约 500MB 的 Parquet 文件

引用

@misc{bio-lens, author = {iNaturalist Contributors, HirakoSan}, title = {bio-lens}, year = {2026} }

搜集汇总
数据集介绍
bio-lens 数据集图片
构建方式
该数据集源自全球知名生物多样性观测平台iNaturalist,经过严格的青铜层至白银层处理流程构建而成。具体而言,首先整合照片、观测记录与分类学体系,筛选出社区验证的研究级观测数据;随后对每个观测唯一标识符进行去重,确保每条观测对应一张照片;继而将图像转换为高效的AVIF格式,并剥离EXIF与XMP元数据;最终将数据分片为约500MB的Parquet文件,共计超过4.1万片,总规模约5.6TB,涵盖约1.426亿张照片与约505K个独特分类群。
特点
该数据集具备多重显著特征。其一,数据源自社区严格验证的研究级观测,具有高度权威性与可靠性。其二,采用去重策略,每项观测仅保留一张代表性照片,有效降低了冗余。其三,图像采用AVIF编码,平均每张仅15至30KB,在保持原始分辨率的同时大幅压缩体积,便于高效存储与传输。其四,数据以Parquet格式组织并分片,兼容主流数据处理框架,支持列式访问与过滤操作。此外,覆盖约6,890个独特科级分类单元,其中菊科、豆科等物种照片数量领先,反映了生态分布特征。
使用方法
该数据集的使用便捷且灵活。用户可通过Polars库直接读取所有Parquet文件,例如使用‘pl.read_parquet'方法加载完整数据,或按‘family’等字段过滤特定类群。每行记录包含‘image’列,存储为二进制AVIF图像数据,可通过解码操作转换为可视格式。数据集的列式结构支持高效查询,如依据‘taxon_id’、‘latitude’等元数据进行筛选分析。需注意,用户须遵守非商业研究用途的许可协议,仅在遵循相关知识共享许可条款的前提下开展学术探索。
背景与挑战
背景概述
生物多样性监测是生态学与保护生物学的核心议题,而大规模图像数据的涌现为物种识别与分布研究提供了前所未有的机遇。在此背景下,由iNaturalist社区贡献者与HirakoSan团队于2026年联合创建的bio-lens数据集应运而生。该数据集经过严格的筛选与处理流程,仅纳入经过社区验证的研究级观测记录,并通过去重、图像格式转换等步骤,最终汇聚约1.426亿张高质量物种照片,涵盖超过5000个分类单元及6890个科。其庞大规模与精细化的数据分级策略,为计算机视觉在细粒度物种分类、生态学大数据分析等领域提供了坚实的数据基石,推动了生物信息学与人工智能的交叉融合。
当前挑战
bio-lens数据集所面临的挑战首先体现在领域问题的复杂性上:物种分类任务需应对自然场景下类间差异微小、类内形态多变的长尾分布问题,同时图像中携带的地理位置与光照背景也增加了模型泛化的难度。在构建过程中,数据来源(iNaturalist)的众包特性导致图片质量参差不齐,原始照片的分辨率、曝光条件差异显著,且包含大量重复或非研究级观测。为克服这些障碍,团队设计了从原始数据到“银级”标准品的处理流程,包括基于社区投票的研究级过滤、每观测单图去重,以及将图像统一转换为AVIF格式以平衡存储效率与视觉质量,最终形成了约5.6TB的规范数据集,这对大规模数据清洗与高效存储技术提出了极高要求。
常用场景
经典使用场景
作为自然界视觉智能研究的基石,bio-lens数据集为生物多样性领域的多层级物种分类任务提供了无可比拟的素材。该数据集汇聚了超过1.42亿张经过社区验证、达到科研等级的真实野外照片,覆盖约6,890个独特科级分类单元。研究者可基于taxonomic lineage路径,便捷地进行从粗粒度科级识别到细粒度种级判别的层次化分类实验。同时,数据集以统一的AVIF格式存储图像,并剥离了EXIF元数据,有效地规避了地理位置等信息引入的偏置,从而推动模型真正聚焦于生物形态学特征的视觉学习。
实际应用
在生态监测与保护实践中,bio-lens数据集为自动化生物调查系统提供了引擎级支撑。基于该数据集训练的模型,可以被部署于野外观测相机或无人机平台,实现特定类群(如传粉昆虫、入侵植物或候鸟)的持续、非侵入式识别与计数。在农业领域,该数据有助于构建作物与害虫的精准识别系统,辅助进行病虫害的早期预警与绿色防控。于公民科学领域,该数据集赋能移动端应用程序,使普通公众能够即时拍摄并获取野生动植物的专业鉴定结果,从而极大拓宽了生物多样性数据的收集广度与效率。
衍生相关工作
该数据集衍生了一系列具有影响力的前沿工作。在模型架构层面,研究者基于其层次化分类需求,发展出能够同时预测物种科、属、种级标签的分层注意力网络与多任务学习框架。在算法创新方面,衍生了针对长尾分布数据的高效训练策略,如类平衡采样与自适应损失函数,以应对生物分类中常见的头部科类(如菊科)与稀有类群之间的极度不均衡。此外,数据集中纳入的空间信息催生了结合地理先验与环境嵌入的地理视觉自监督学习方法,显著提升了模型在未知地点对当地物种的零样本分类能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务