遇见数据集

imageomics/phylo-fish

收藏
Hugging Face2026-06-17 更新2026-06-21 收录
官方服务:

资源简介:

Phylo-Fish是一个机器学习就绪的数据集,包含38种硬骨鱼(Teleost fishes),每个物种平均有200张图像。这个半平衡子集来源于大湖区入侵物种网络项目(GLIN)的一个更大的鱼类图像集合。数据集中的图像来自五个鱼类学研究收藏,这些收藏参与了GLIN项目,原始数据通过Fish-AIR数据库获取。图像经过预处理,被调整大小并适当填充为256×256像素分辨率。数据集被分为训练集和验证集,比例分别为80%和20%,总共包含4,140张训练图像和1,294张测试图像。数据包括图像文件以及元数据文件(metadata.csv),其中包含图像路径、文件名、科学名称、属、科、物种、分割信息、许可证、来源等字段。该数据集旨在支持生物学中的性状发现研究,特别是通过系统发育引导的神经网络来发现进化性状。

Phylo-Fish is a machine learning-ready dataset encompassing 38 species of Teleost fishes, with an average of 200 images per species. This semi-balanced subset is derived from a larger collection of fish images from the Great Lakes Invasive Species Network (GLIN) project. The images in the dataset originate from five ichthyological research collections that participated in the GLIN project, with raw data obtained via the Fish-AIR database. All images have been preprocessed: resized and appropriately padded to a resolution of 256×256 pixels. The dataset is split into training and validation subsets at a ratio of 80% and 20%, respectively, containing a total of 4,140 training images and 1,294 test images. The dataset includes both image files and a metadata file (metadata.csv), which contains fields such as image path, filename, scientific name, genus, family, species, segmentation information, license, and data source. This dataset is designed to support trait discovery research in biology, particularly for identifying evolutionary traits via phylogeny-guided neural networks.

提供机构:
imageomics
搜集汇总
数据集介绍
imageomics/phylo-fish 数据集图片
构建方式
该数据集源自五大湖入侵物种网络项目(GLIN)的鱼类图像库,研究者从Fish-AIR数据库中筛选出38种真骨鱼类图像,每种物种平均包含200张图像。原始图像经过统一预处理,被缩放并填充至256×256像素分辨率,形成半平衡子集。数据集被划分为训练集与验证集,比例分别为80%和20%。为增强模型泛化能力,在基础VQGAN模型训练过程中采用了随机水平翻转、空间移位与旋转、亮度与对比度变化等数据增强手段。物种注释由原始数据提供方赋予,而对应的系统发育树则通过OpenTree Python包获取,并利用ETE Toolkit进行加工与操作。
特点
Phylo-Fish数据集具备鲜明的跨学科特色,融合了计算机视觉、进化生物学与系统发育学。其图像以物种名命名的子目录组织,结构清晰,便于基于视觉的表型分类与图像检索任务。随附的元数据文件(metadata.csv)详列了图像的文件路径、文件名、科学名称、属、科、物种、数据集划分、许可证、来源等丰富字段,为多层级分类与进化性状发现提供了结构化支撑。尤其值得一提的是,该数据集专为基于系统发育指导的神经网络设计,旨在从图像中探测具备遗传或系统发育信号的生物学性状,推动知识引导的机器学习在生物信息学领域的应用。
使用方法
该数据集支持多样化的机器学习任务,包括图像分类、文本到图像及图像到图像的生成任务。使用者可直接加载元数据文件(metadata.csv),按split字段区分训练与测试子集,并通过'filepath'字段访问对应图像。图像数据以JPG格式存储,按物种分组存放,便于批处理与标签映射。结合随附的系统发育树信息,研究者可训练诸如PhyloNN等系统发育指导的神经网络,探索跨物种的性状演化规律。数据集遵循CC BY-NC许可,但作为整体编译受CC0公共领域豁免保护,确保在学术和非商业研究中的广泛可复用性。
背景与挑战
背景概述
Phylo-Fish数据集由Mohannad Elhamod等来自Imageomics研究所及多所合作机构的研究人员于2023年创建,旨在推动知识引导的机器学习在生物学中的应用。该数据集聚焦于硬骨鱼类,包含38个物种、每物种约200张图像,共计超过5400张标注标本照,源自五大湖入侵网络项目(GLIN)的博物馆藏品。其核心研究问题在于探索如何利用系统发育关系从图像中自动发现具有进化意义的生物性状(traits),例如形态特征在物种间或物种内的遗传信号。该数据集通过与系统发育树关联的标签设计,为训练系统发育引导的神经网络提供了基准资源,对进化生物学、计算机视觉交叉领域产生了显著影响。
当前挑战
该数据集旨在解决生物学中性状发现(trait discovery)这一标签稀缺的难题。传统性状测量依赖人工专家主观定义,耗时费力且难以规模化,而Phylo-Fish通过系统发育引导的机器学习,试图自动化识别具有遗传或系统发育信号的进化性状。构建过程中,团队面临多重挑战:首先,原始图像源自不同研究机构的博物馆藏品,存在光照、姿态和背景差异,需通过统一裁剪至256×256分辨率并填充ImageNet均值颜色来标准化;其次,为保障图像质量,研究人员手工筛选了数千张图像,剔除了保存过程(如酒精或福尔马林处理)导致的形态伪影;最后,系统发育树的构建需整合OpenTree和ETE Toolkit等工具,确保物种分类和进化关系的准确性,这对数据注释的可靠性提出了高要求。
常用场景
经典使用场景
Phylo-Fish数据集的核心应用场景在于利用系统发育关系指导的深度学习模型,从鱼类图像中自动发现和表征关键的生物学性状。该数据集包含38种真骨鱼类的约7600幅标准化图像,每物种约200幅,且附有基于OpenTree数据库构建的物种系统发育树。研究者可将其用于开发能够同时学习图像特征与演化关系的神经网络架构,实现从视觉数据中挖掘具有系统发育信号的表型特征,为知识引导的机器学习在计算生物学中的应用提供了标准化基准。
衍生相关工作
Phylo-Fish已催生多项开创性工作,最典型的代表是与其共同发布的PhyloNN模型,该工作发表于ACM SIGKDD 2023,首次提出在神经网络训练中融入系统发育约束以实现性状的自动发现。在此基础上,衍生出若干改进框架,如结合对比学习的系统发育感知特征提取器,以及利用图神经网络表征物种演化关系的模型。这些工作共同推动了'知识引导机器学习'这一新兴方向的发展,相关成果已被应用于鸟类喙部形态和蝴蝶翅膀图案等演化性状分析任务中。
数据集最近研究
最新研究方向
Phylo-Fish数据集在生物信息学与计算机视觉的交叉领域开辟了前沿研究方向,其核心创新在于将系统发育树(phylogeny)作为先验知识嵌入深度学习模型,用以从鱼类影像中自动发现具有进化信号的生物性状(evolutionary traits)。这一方向紧密关联当前知识引导机器学习(knowledge-guided ML)的热潮,特别是在“Imageomics”这一新兴跨学科框架下,该数据集为探索生物形态特征的遗传与进化基础提供了标准化、可复现的基准。通过构建包含38个真骨鱼类物种的高质量影像库,Phylo-Fish支撑了从图像中推断物种间进化关系、识别潜在性状标记的研究范式转变,推动了自动化性状发现(trait discovery)这一长期依赖专家经验领域的突破。其深远意义在于,为大规模生物多样性监测、进化发育生物学(evo-devo)的量化分析以及基于AI的系统分类学奠定了数据与算法桥梁,有望加速人类对生命演化规律的理解与预测。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务