遇见数据集

TimS-ml/trailogy-na-plantae-sft

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

NA-Plantae SFT数据树是一个用于设备上Gemma 4 E2B“徒步伴侣”视觉语言模型的混合监督微调语料库。它结合了北美植物图像识别切片(数据来源于iNaturalist,标签文本通过GBIF进行了丰富)和通用防遗忘桶(包括LLaVA风格的图像问答以及拒绝/负面样本),旨在支持模型在植物识别和相关任务上的微调训练。

Mixed supervised-finetuning corpus for the on-device Gemma 4 E2B "hike companion" VLM. Combines a North-American Plantae image-ID slice (sourced from iNaturalist, label text enriched via GBIF) with general anti-forgetting buckets (LLaVA-style image QA + refusal/negative).

提供机构:
TimS-ml
搜集汇总
数据集介绍
TimS-ml/trailogy-na-plantae-sft 数据集图片
构建方式
本数据集名为NA-Plantae SFT,是面向设备端Gemma 4 E2B VLM模型“徒步伴侣”的混合监督微调语料库。其构建过程首先从iNaturalist平台爬取北美洲植物观测元数据,再通过GBIF数据库丰富物种标签文本,形成基础植物图像识别切片。在此基础上,融合了LLaVA风格的图像问答与拒绝/否定样本等通用防遗忘数据桶,旨在平衡领域专精与模型通用能力。数据集包含多种变体,如经GBIF丰富描述的版本及长度截断的精简版,均经过图像缩放预处理,便于下游训练管道直接消费。
特点
该数据集具有鲜明的多源异构与分层变体特点。其核心由iNaturalist植物观测数据经GBIF知识增强而来,每份物种记录附带丰富的RAG文档,使模型能够获取详细的植物特征描述。为适配不同训练需求,提供了三种注释风格:原始元数据、约814字符的丰富描述及约368字符的长度截断版本。此外,数据集纳入了通用图像问答与拒绝应答样本,防止模型在微调过程中遗忘预训练能力,同时通过脚注强调图像路径相对数据根目录的设计,展现了工程化部署的考量。
使用方法
使用本数据集时,需注意其图像路径格式采用相对于数据根目录的指定方式,例如`inaturalist_na_plantae_prepared/images_resized/train/<slug>/<id>.jpg`。微调加载器会依据环境变量`TRAILOGY_DATA_ROOT`(默认为仓库目录下的`../data`)拼接完整路径。用户在下载数据集后,应执行`export TRAILOGY_DATA_ROOT=/path/to/this/download`来设置该变量。数据集中`image`字段为null的记录代表纯文本样本,对应通用或拒绝桶内容。约40GB的原始全分辨率图像及API响应缓存未包含在内,但可通过重新运行爬取阶段再生,而`images_resized/`目录下的缩放图像才是微调管道真正消费的数据。
背景与挑战
背景概述
NA-Plantae SFT数据集的创建源于对设备端视觉语言模型(VLM)在植物识别领域应用潜力的探索。该数据集由Trailogy研究团队于近期构建,核心目标在于解决小型设备上高效、精准的植物图像识别与交互问题。数据集融合了从iNaturalist获取的北美植物图像及其观测元数据,并通过全球生物多样性信息机构(GBIF)扩充物种标签信息,形成了用于监督微调的混合语料库。鉴于Gemma 4 E2B这类轻量级模型对训练数据的特殊要求,研究者还整合了LLaVA风格的图像问答及拒绝性样本,以维持模型在通用任务上的表现。该数据集不仅推动了植物识别领域的边端智能发展,也为资源受限场景下的多模态模型训练提供了重要参考。
当前挑战
该数据集面临的核心挑战在于如何平衡领域专业性与模型通用性。一方面,植物识别需应对物种多样性、生长阶段差异及拍摄条件变化带来的细粒度分类难题,要求训练数据兼具广度和精确性,而iNaturalist这类众包平台的数据质量参差不齐,标注噪声成为首要障碍。另一方面,构建过程中需克服数据获取与处理的矛盾:原始高分辨率图像库体量达40GB,且依赖不可重复的网络爬取,研究者不得不对图像进行缩放并舍弃原始缓存,这可能导致信息损失;同时,将异构数据源(如GBIF文本、LLaVA问答对)有机融合为统一格式的训练序列,并与设备端推理效率要求兼容,也构成了工程与算法层面的双重考验。
常用场景
经典使用场景
在视觉语言模型(VLM)的微调过程中,NA-Plantae SFT数据集扮演着核心角色,特别是在移动端设备上部署的植物识别助手的开发中。该数据集巧妙融合了北美地区植物物种的图像数据与结构化的物种描述文本,为模型提供了丰富的图像-文本配对样本。其经典应用在于,通过监督式微调(SFT)范式,使VLM习得将植物视觉特征与对应的学名、形态描述及生态习性进行对齐的能力。这种对齐不仅提升了模型对北美本土植物的识别精度,还赋予了模型依据图像生成自然语言描述、回答物种相关问题的多模态对话能力,为构建轻量级、高性能的野外植物识别系统奠定了数据基础。
解决学术问题
该数据集着力解决了视觉语言模型在开放域植物识别场景中的两大核心学术难题:细粒度物种区分与领域外泛化。由于北美植物种类繁多且形态相似,传统图像分类模型易受类间方差小、类内方差大的困扰。NA-Plantae SFT通过整合iNaturalist的观测数据与GBIF的生态学背景信息,构建了高信息密度的图文对,有效抑制了模型对背景噪声的过拟合,提升了细粒度物种分类的鲁棒性。同时,其设计的‘反遗忘’通用桶(包含LLaVA式图像问答与拒识样本)巧妙缓解了微调过程中模型对原始能力的灾难性遗忘,使得最终VLM既能精准识别本土植物,又保持了通用多模态对话的流畅性与安全性,这对推动边缘计算场景下的持续学习研究具有重要学术意义。
衍生相关工作
围绕NA-Plantae SFT的数据结构,学术界涌现了一系列衍生工作。基于其分桶混合策略,研究者尝试引入知识蒸馏与模型剪枝技术,探索将教师模型的知识迁移至更小体积的学生网络,以进一步降低端侧推理延迟。另一个重要方向是跨域迁移学习,利用该数据集中丰富的GBIF富集描述文本作为查询,通过检索增强生成(RAG)范式扩展模型对罕见或边缘物种的认知覆盖。此外,其‘反遗忘桶’的设计理念启发了若干持续学习研究,将类似经验重放机制应用于农业病虫害识别或城市植被监测等动态分布漂移场景,形成了开源数据集与下游任务模型相互促进的良性生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务