遇见数据集

cristiano-pizzamiglio/mnist3d

收藏
Hugging Face2024-04-26 更新2024-06-12 收录
官方服务:

资源简介:

MNIST3D数据集是一个由原始MNIST数据集转换而来的3D点云数据集,包含70,000个手写数字的点云,每个点云有193个点。数据集分为训练集和测试集,保留了原始MNIST数据集的划分。数据集的创建过程包括加载MNIST数据集、分析像素强度分布、二值化图像、将图像转换为点云、添加高斯噪声等步骤。数据集由Cristiano Pizzamiglio创建,采用MIT许可证。

MNIST3D数据集是一个由原始MNIST数据集转换而来的3D点云数据集,包含70,000个手写数字的点云,每个点云有193个点。数据集分为训练集和测试集,保留了原始MNIST数据集的划分。数据集的创建过程包括加载MNIST数据集、分析像素强度分布、二值化图像、将图像转换为点云、添加高斯噪声等步骤。数据集由Cristiano Pizzamiglio创建,采用MIT许可证。

提供机构:
cristiano-pizzamiglio
原始信息汇总

MNIST3D 数据集概述

数据集描述

数据集摘要

MNIST3D 数据集包含70,000个手写数字的点云,这些点云是通过转换原始 MNIST 数据集中的图像生成的。每个点云包含193个点。

语言

  • 英语

数据集结构

数据分割

数据被分为训练集和测试集,保留了MNIST数据集的原始分割。

  • 训练集:60,000个样本
  • 测试集:10,000个样本

数据集创建

筛选理由

MNIST3D 数据集为那些对应用机器学习模型到3D点云分类任务感兴趣的人提供了一个易入门的起点,同时减少了预处理和格式化的工作量。

方法

  1. keras.datasets 模块加载MNIST数据集。
  2. 分析MNIST图像的像素强度分布,并选择128作为阈值。
  3. 图像二值化,大于阈值的强度转换为1,其余转换为0。
  4. 将图像转换为点云,非零强度的像素被视为点,强度作为z坐标,x和y坐标在0-1范围内归一化,z坐标转换为0。
  5. 设置总点数为193,这是二值化图像中非零强度分布的最大值(排除异常值)。
  6. 向三个维度添加均值为零、标准差为0.01的高斯噪声。

附加信息

许可证信息

  • MIT许可证
搜集汇总
数据集介绍
cristiano-pizzamiglio/mnist3d 数据集图片
构建方式
在三维点云分类领域,数据集的构建往往面临预处理复杂与格式不统一的挑战。MNIST3D数据集以经典MNIST手写数字图像为基底,通过系统化的图像-点云转换流程构建而成。首先,利用Keras加载原始MNIST图像,分析像素强度分布后选定阈值为128进行二值化处理。随后,将非零像素映射为三维空间中的点,其中x与y坐标归一化至0-1区间,z坐标初始化为零。为确保点云密度一致性,依据二值化图像中非零像素的分布统计,选取众数193作为固定点数量。最终,向所有维度注入均值为零、标准差为0.01的高斯噪声以增强鲁棒性,并以NumPy文件格式存储。
特点
该数据集的核心优势在于其作为三维点云研究入门桥梁的独特定位。它完整保留了原始MNIST的60,000训练样本与10,000测试样本划分,每帧点云由193个点构成,兼顾了数据规模与计算效率。标签体系沿用0至9的十类手写数字分类,与经典基准任务无缝衔接。通过将二维像素强度转换为三维坐标,数据集在保持原始视觉语义的同时,天然适配PointNet等主流点云网络架构。此外,MIT开源协议与专家标注的可靠性,使其成为验证三维分类算法的理想标准化测试平台。
使用方法
研究者可直接通过HuggingFace Datasets库加载该数据集,调用load_dataset('cristiano-pizzamiglio/mnist3d')即可获取包含point_cloud与label字段的数据结构。点云数据以float16格式存储,支持直接输入至三维深度学习模型。建议采用PyTorch或TensorFlow框架构建数据加载器,将点云张量重塑为(B, N, 3)维度,其中N=193为固定点数。标签为整数编码的类别索引,可直接用于交叉熵损失函数计算。需注意原始点云已包含归一化坐标与高斯噪声,无需额外预处理即可开展分类任务训练与评估。
背景与挑战
背景概述
在三维视觉与几何深度学习领域,点云数据因其对不规则几何结构的灵活表达能力而备受关注。然而,许多经典的3D点云基准数据集(如ModelNet40或ShapeNet)规模庞大且预处理复杂,对初学者或资源受限的研究者构成了入门障碍。在此背景下,Cristiano Pizzamiglio于近期创建了MNIST3D数据集,旨在为点云分类任务提供一个低门槛、轻量级的起点。该数据集将广为熟知的MNIST手写数字图像通过二值化与坐标映射转化为包含193个点的三维点云,并保留原始MNIST的60,000训练样本与10,000测试样本划分。MNIST3D的提出不仅降低了三维机器学习研究者的数据准备成本,更架起了二维图像理解与三维几何学习之间的桥梁,为快速验证点云处理算法(如PointNet及其变体)提供了理想平台,在教育和原型开发领域展现出独特价值。
当前挑战
MNIST3D数据集所面临的挑战主要体现在两个层面。在领域问题层面,尽管该数据集简化了点云分类的入门过程,但其基于MNIST的有限类别(0-9)与简单几何结构(手写数字轮廓)限制了模型对复杂三维形状的泛化能力,难以评估算法在真实场景(如室内物体识别或自动驾驶)中的鲁棒性。在构建过程层面,数据生成方法存在固有局限:原始图像的二值化阈值(128)及固定点云数量(193)可能丢失关键细节信息,而添加的高斯噪声(标准差0.01)虽增强了多样性,却无法模拟真实传感器(如LiDAR)产生的非均匀噪声与遮挡模式。此外,点云坐标仅依赖像素强度作为z轴,导致深度信息高度抽象化,与物理世界中的三维几何存在显著差异。
常用场景
经典使用场景
在三维点云分类的研究领域中,MNIST3D数据集扮演着入门级基准的重要角色。它将经典的手写数字识别问题从二维图像空间优雅地迁移至三维点云空间,为研究者提供了一个低门槛、高可控性的实验平台。该数据集最经典的使用场景是评估和比较不同点云分类模型的性能,尤其是针对轻量级或早期点云处理架构的验证。通过将原始的MNIST图像二值化并映射为包含193个点的三维坐标,MNIST3D保留了原始数字的几何结构,同时引入了适度的噪声与稀疏性,使得研究者能够专注于模型对三维几何特征的提取能力,而无需处理大规模或复杂场景下的数据预处理负担。
实际应用
从实际应用视角来看,MNIST3D数据集虽然源于合成数据,但其生成方法论具有显著的迁移价值。它展示了如何将二维图像数据高效转化为三维点云,这一思路可广泛应用于工业质检中的字符识别、医疗影像中的结构标记点提取以及增强现实中的手势交互场景。例如,在自动化生产线上,通过将摄像头捕获的二维数字标记转换为三维点云,可以利用MNIST3D上训练的轻量模型实现快速、鲁棒的零部件编号识别。此外,该数据集的生成流程(二值化、阈值选取、噪声注入)为构建定制化的三维数据集提供了可复现的模板,降低了实际部署中数据获取与标注的成本。
衍生相关工作
MNIST3D数据集的出现催生了一系列重要的衍生研究工作。最直接的影响是推动了PointNet等开创性点云分类模型在基础任务上的快速验证与对比。后续工作如PointNet++、DGCNN(动态图卷积神经网络)以及PointCNN等,常将MNIST3D作为与ModelNet40并行的辅助基准,用于评估模型在极低点云密度下的鲁棒性。此外,该数据集还启发了多模态学习的研究,例如将三维点云与原始二维图像特征进行融合分类。一些工作利用MNIST3D探索了点云数据增强策略(如随机旋转、抖动)对泛化性能的影响,这些成果进一步反哺了三维感知领域的理论体系构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务