遇见数据集

Synthetic datasets for colloidal particle assemblies

收藏
arXiv2026-06-23 更新2026-06-24 收录
数据链接:
官方服务:

资源简介:

该数据集由阿斯特拉罕塔季谢夫国立大学等机构创建,旨在支持胶体粒子二维组装的识别研究。数据集包含四种不同形状粒子(球形、椭球形、立方体和棒状)的合成图像,每个子集包含135至155张原始图像,通过旋转和添加噪声进行数据增强,并统一缩放至640x640像素,采用多边形标注进行实例分割。数据集通过人工生成,以解决实验显微图像稀缺的问题,专门用于训练YOLOv8模型,以自动化识别胶体组装中的孤立粒子、二聚体、链状、簇状和环状结构,应用于纳米技术、光子晶体和材料科学领域,旨在提升胶体结构形态分析的准确性和效率。

This dataset was created by Astrakhan Tatishchev State University and other institutions, aiming to support research on the recognition of two-dimensional assemblies of colloidal particles. The dataset includes synthetic images of particles with four distinct shapes: spherical, ellipsoidal, cubic, and rod-like. Each subset contains 135 to 155 raw images, which undergo data augmentation via rotation and noise addition, are uniformly resized to 640×640 pixels, and are annotated with polygons for instance segmentation. The dataset was artificially generated to address the scarcity of experimental microscopic images. It is specifically designed for training YOLOv8 models to automatically recognize isolated particles, dimers, chain-like, cluster-like, and ring-like structures in colloidal assemblies. Targeting applications in nanotechnology, photonic crystals, and materials science, this dataset aims to improve the accuracy and efficiency of morphological analysis for colloidal structures.

创建时间:
2026-06-23
搜集汇总
数据集介绍
Synthetic datasets for colloidal particle assemblies 数据集图片
构建方式
为应对不同形状胶体粒子(球体、椭球体、长方体与棒状体)二维单层组装体识别中实验图像匮乏的难题,本研究基于人工生成与手动标注方式构建了四个合成数据集。每个数据集包含135至155张原始图像,并利用Roboflow平台进行自动数据增强,通过旋转及添加噪声等方式扩展样本多样性。所有图像均缩放至640×640像素,并采用多边形实例分割标注,以精确描绘每个组装体(孤立粒子、二聚体、链、环和簇)的边界,替代传统边界框方法,从而提升对复杂形态与邻近物体的定位精度。数据集按训练、验证与测试集划分,标签文件记录了多边形类别编号及归一化坐标点。
特点
该数据集的核心特点在于其针对胶体组装体识别任务的专门化设计。首先,数据集覆盖了四种典型粒子形状,为研究几何形状对识别算法的影响提供了基础。其次,采用多边形标注而非边界框,能够精准分离紧密排列或部分重叠的组装体,尤其适用于链、环与簇等复杂构型。此外,数据集的合成性质使其能够包含理想化条件下各类组装体的充足样本,便于模型学习形态特征。然而,实验测试揭示其局限性:合成数据缺乏真实显微图像中的噪声、阴影与纹理等光学伪影,导致模型在真实场景中泛化能力显著下降,尤其对于长方体与棒状体等角形或细长物体,平均相对误差高达43.1%。
使用方法
该数据集配套的YOLOv8m-seg实例分割模型及训练脚本已开源发布,并集成至在线分析平台(https://isanm.space/)。用户可直接下载数据集与预训练模型,针对自身需求进行微调或重新训练。使用时需注意,模型对球形粒子的识别稳定性最佳(平均误差20%),而复杂形状物体可能需结合实验图像扩充数据集以提高精度。建议在真实显微图像上应用时,采用软精度与软召回率等指标评估概率重叠情况,并考虑对背景噪声与伪影进行预处理。数据集的标签格式支持多边形坐标解析,便于扩展至新的分类体系或混合粒子系统。
背景与挑战
背景概述
该数据集由俄罗斯阿斯特拉罕国立大学与里海海事与河运学院的L. T. Khusainova、S. A. Kolegova及K. S. Kolegov等研究人员于2026年创建,聚焦于胶体单层组装体的自动识别问题。在纳米科技领域,二维胶体有序阵列是构建光子晶体、等离子体器件及仿生表面的关键结构,其形态分析对材料功能化至关重要。然而,传统人工分析方式受限于主观性与低效率,尤其是对于非球形颗粒(如椭球体、长方体、棒状体)的复杂组装构型(孤立粒子、二聚体、链、环、簇),手动识别几乎难以规模化。为此,研究团队针对四种形状颗粒分别生成合成图像数据集,并采用YOLOv8模型进行实例分割与分类训练,旨在探索基于合成数据训练模型以迁移至实验显微图像的可行性,为自动化胶体分析提供新范式。
当前挑战
数据集面临的核心挑战在于解决胶体组装体识别中的领域痛点与构建困境。领域层面,颗粒形状多样性导致构型分类边界模糊(如链与簇仅差一个邻接粒子),传统检测方法易将邻近结构错误合并,且背景噪声、人工标签及光学伪影会引发过度识别与误分类,在实验图像上平均识别误差高达43.1%。构建过程中,合成数据集无法复现真实显微图像的纹理、阴影及形状偏差(如实际椭球体常呈棒状过渡态),导致模型在长方体颗粒上误差达58.5%;同时,多边形标注的复杂度随颗粒形状而异,数据增强虽提升泛化性,却仍难以覆盖罕见边框案例,最终需融合实验图像构建新数据集以弥合此差距。
常用场景
经典使用场景
在胶体自组装与纳米材料形态学研究的交织领域中,该合成数据集扮演着至关重要的角色。其最经典的使用场景在于为YOLOv8等深度学习模型提供训练与测试样本,以实现对二维胶体单层膜中不同形状颗粒(如球体、椭球体、长方体及棒状体)组装构型的自动识别。数据集精心模拟了孤立粒子、二聚体、链状、环状及簇状等五种基本组装类别,为研究者构建了一个从理想化图像出发、探索机器视觉在复杂微观结构分析中潜力的标准化平台。
实际应用
在现实应用层面,该数据集及其训练的模型为高性能纳米涂层的质量评估与制备过程监控提供了有力工具。在光子晶体、等离子体器件及仿生表面的工业化生产中,快速、准确地识别胶体颗粒的排列状态是确保产品性能的关键。该数据集使开发出的模型能够在线分析实验显微图像,实时反馈组装缺陷(如意外聚集或链条断裂)。尽管当前模型在应对真实图像噪声和光照不均时仍存在挑战,但其已整合至开源信息系统(isanm.space),为材料工程师提供了一种可部署的自动化分析模块雏形。
衍生相关工作
围绕这一合成数据集,已衍生出多个极具启发性的经典工作。首先,该研究本身便属于对之前仅针对球形颗粒方法的深化与拓展,通过引入多种粒子形状验证了通用识别框架的局限性。其次,数据集的创建过程催生了针对多边形标注在胶体实例分割中的应用分析,揭示了边界框方法在密集排列下误合并的缺陷。更重要的是,该工作直接推动了后续关于提升模型泛化能力的研究方向,明确指出必须构建基于真实实验显微图像的标注数据集,从而为弥合模拟与真实世界差距的理论探索奠定了坚实的基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务