bio-lens
收藏资源简介:
iNaturalist Silver Dataset是一个经过处理的研究级生物多样性图像数据集,源自iNaturalist平台。该数据集专门筛选了社区验证的“研究级”观察记录,并通过去重流程确保每个观察仅保留一张代表性照片。所有图像均采用AVIF格式编码,以二进制形式存储在Parquet文件中,总数据量约5.6TB,分布在超过4万个分片中。数据集包含约1.426亿张照片,对应约1.428亿个研究级观察,覆盖约6890个生物科和约505K个分类单元。每个数据样本包含11个字段:唯一照片ID、去重后的观察UUID、分类单元ID、科学名称、分类谱系路径、分类等级(如物种、属、科等)、AVIF编码的图像二进制数据、照片许可证、观察质量等级(始终为“research”)、观察纬度和经度。图像经过处理,移除了EXIF/XMP元数据,平均大小约为15-30KB。数据集主要适用于计算机视觉任务,特别是物种分类和生物多样性研究。需要注意的是,数据集中的照片遵循多种知识共享许可证,但仅限非商业研究用途。
The iNaturalist Silver Dataset is a processed research-grade biodiversity image dataset derived from the iNaturalist platform. It specifically filters community-verified research-grade observations and ensures only one representative photo per observation through a deduplication process. All images are encoded in AVIF format and stored as binary data in Parquet files, with a total data volume of approximately 5.6TB distributed across over 40,000 shards. The dataset includes about 142.6 million photos, corresponding to about 142.8 million research-grade observations, covering approximately 6,890 biological families and about 505K taxonomic units. Each data sample contains 11 fields: unique photo ID, deduplicated observation UUID, taxon ID, scientific name, taxonomic lineage path, taxonomic rank (e.g., species, genus, family), AVIF-encoded image binary data, photo license, observation quality grade (always research), observation latitude, and longitude. The images have been processed to remove EXIF/XMP metadata, with an average size of about 15-30KB. The dataset is primarily suitable for computer vision tasks, particularly species classification and biodiversity research. It is important to note that the photos in the dataset follow various Creative Commons licenses but are restricted to non-commercial research use.
🌿 iNaturalist Silver Dataset (Research-Grade, Deduplicated)
数据集描述
该数据集包含来自 iNaturalist 的研究级观察数据,经过青铜层到银层的处理流程,包括:
- 仅含研究级观察数据(社区验证)
- 每个观察一张照片(按 observation_uuid 去重)
- AVIF 编码图像,以二进制格式存储在 Parquet 文件中
- 总大小约 ~5.6 TB,分布在超过 4 万个分片中
数据组成
| 指标 | 数量 |
|---|---|
| 总照片数 | ~1.426亿 |
| 研究级观察数 | ~1.428亿 |
| 含照片的独特科 | ~6,890 |
| 独特分类单元 | ~50.5万 |
| 分片数 | ~41,315 个 Parquet 文件 |
| 分片大小 | 每个约 500MB |
按照片数量排名前10的科
| 科 | 照片数 |
|---|---|
| Asteraceae(菊科/向日葵) | 1,170万 |
| Fabaceae(豆科) | 640万 |
| Nymphalidae(蛱蝶科) | 560万 |
| Anatidae(鸭科) | 480万 |
| Rosaceae(蔷薇科) | 360万 |
| Apidae(蜜蜂科) | 340万 |
| Lamiaceae(唇形科) | 300万 |
| Poaceae(禾本科) | 290万 |
| Accipitridae(鹰科) | 290万 |
| Orchidaceae(兰科) | 270万 |
文件结构
data/train/ ├── 0000.parquet ├── 0001.parquet ├── ... └── 41315.parquet
数据模式
| 列名 | 类型 | 描述 |
|---|---|---|
photo_id |
int64 | 唯一照片标识符 |
observation_uuid |
string | 观察UUID(已去重,每个观察一条) |
taxon_id |
int64 | iNaturalist 分类单元ID |
taxon_name |
string | 科学名称 |
ancestry |
string | 分类谱系路径 |
rank |
string | 等级(种、属、科等) |
image |
binary | AVIF 编码图像 |
license |
string | 照片许可证 |
obs_quality_grade |
string | 始终为 "research" |
latitude |
double | 观察纬度 |
longitude |
double | 观察经度 |
图像格式
- 格式:AVIF(AV1 图像文件格式)
- 质量:75
- 尺寸:原始尺寸(保留)
- 平均大小:约 15-30 KB
- 元数据:已剥离(EXIF/XMP 已移除)
许可证
照片包含观察者选择的许可证:CC0、CC-BY、CC-BY-NC、CC-BY-SA、CC-BY-NC-SA、CC-BY-ND、CC-BY-NC-ND。
⚠️ 仅限非商业研究用途
使用示例
python import polars as pl
加载所有数据
df = pl.read_parquet("data/train/*.parquet")
按科过滤
beetles = df.filter(pl.col("family") == "Carabidae")
访问图像
row = df.first() image_bytes = row[image]
处理流程
该数据集通过以下步骤创建:
- 关联照片、观察数据和分类学信息
- 筛选出研究级观察数据
- 去重,每个观察保留一张照片
- 将图像转换为 AVIF 格式
- 分片为约 500MB 的 Parquet 文件
引用
@misc{bio-lens, author = {iNaturalist Contributors, HirakoSan}, title = {bio-lens}, year = {2026} }




