遇见数据集

flwrlabs/usps

收藏
Hugging Face2024-07-15 更新2024-07-22 收录
官方服务:

资源简介:

USPS数据集是一个由美国邮政服务自动扫描的信封上的数字图像数据集,包含9,298个16×16像素的灰度样本。图像经过中心化和归一化处理,展示了多种字体风格。数据集分为训练集和测试集,分别包含7,291和2,007个样本。该数据集主要用于图像分类任务,并推荐使用Flower Dataset进行联邦学习实验。

USPS is a digit dataset automatically scanned from envelopes by the U.S. Postal Service containing a total of 9,298 16×16 pixel grayscale samples. The images are centered and normalized, showing a broad range of font styles. The dataset is split into a train set with 7,291 samples and a test set with 2,007 samples. It is used for image classification tasks and falls within the size category of 1K<n<10K. The source files and related papers are also mentioned.

提供机构:
flwrlabs
搜集汇总
数据集介绍
flwrlabs/usps 数据集图片
构建方式
USPS数据集源自美国邮政服务系统对信封上手写数字的自动扫描,共计9298张16×16像素的灰度图像。这些图像经过居中与归一化处理,涵盖多种字体风格。数据集被划分为训练集(7291张)和测试集(2007张),其原始数据来源于台湾大学林智仁教授提供的libsvm格式压缩包,并在HuggingFace上以图像格式重新封装,便于与现代深度学习框架无缝对接。
特点
该数据集的核心特点在于其图像尺寸统一、像素值归一化,且样本反映了真实邮政场景中手写数字的多样性与复杂性。标签为0至9的十类数字,类别分布均衡,适合作为图像分类任务的基准。此外,数据集规模适中(约9.3K样本),兼顾了实验效率与模型泛化能力的评估需求,尤其适用于联邦学习场景中的分布式训练与性能验证。
使用方法
推荐使用Flower Datasets库(flwr-datasets)进行数据集的下载与分区操作。用户可通过安装`flwr-datasets[vision]`包,并调用`FederatedDataset`接口结合`IidPartitioner`实现独立同分布的数据划分。例如,设置分区数为10后,即可加载指定分区的数据用于联邦学习实验。该流程简化了数据预处理步骤,支持快速集成至Flower框架中开展分布式模型训练与评估。
背景与挑战
背景概述
USPS数据集源自美国邮政服务系统,由Hull等人于1994年创建,旨在推动手写文本识别研究。该数据集包含9,298张16×16像素的灰度图像,均为从信封上自动扫描获取的数字,涵盖了多种字体风格,且图像经过居中和归一化处理。作为手写数字识别领域的经典基准数据集,USPS与MNIST齐名,广泛应用于机器学习与模式识别算法的验证与比较。其简洁的尺寸和清晰的类别划分(0-9十个数字)使其成为评估分类模型性能的理想选择,尤其在联邦学习场景中,该数据集被Flower框架用于模拟分布式训练环境,进一步拓展了其在隐私保护机器学习领域的影响力。
当前挑战
USPS数据集所解决的领域问题主要是手写数字识别,尽管图像尺寸小、类别均衡,但字体风格多样和扫描噪声的存在对模型泛化能力构成挑战。在构建过程中,原始数据从信封自动扫描获取,面临光照不均、倾斜角度变化及图像退化等问题,需要通过预处理(如归一化和居中)来缓解。此外,该数据集仅有9,298个样本,训练集与测试集比例为7,291:2,007,小样本量限制了深度学习模型的训练效果,易导致过拟合。在联邦学习场景中,数据非独立同分布(Non-IID)的模拟和客户端间通信效率也是实际应用中的关键难题。
常用场景
经典使用场景
美国邮政服务(USPS)手写数字数据集,作为图像分类领域的经典基准,常被用于验证和比较机器学习模型在低分辨率灰度图像上的识别性能。其16×16像素的简洁尺寸与包含0至9共十类数字的均衡标签结构,使其成为深度学习入门与算法原型设计的理想测试床。研究者通常将其作为MNIST数据集的轻量级替代或补充,用于评估模型在真实世界手写字体变体上的泛化能力,尤其是在联邦学习场景中,借助Flower框架进行分布式数据划分与模型聚合实验,以模拟非中心化数据环境下的模型训练与评估。
解决学术问题
该数据集的核心贡献在于为手写数字识别研究提供了一个具有真实噪声与字体多样性的标准化评估平台。它解决了传统合成数据集无法反映实际邮政系统扫描图像中存在的倾斜、笔画粗细不均及灰度分布差异等挑战,从而推动了特征提取方法与分类器鲁棒性设计的学术进步。通过对比不同算法在USPS上的准确率与收敛速度,研究者能够量化分析模型对图像归一化预处理、特征降维及小样本学习策略的依赖程度,为模式识别理论中关于数据分布偏移与模型迁移能力的研究提供了关键实证依据。
衍生相关工作
基于USPS数据集衍生出一系列经典工作,例如Hull(1994)在原始论文中建立的基准方法,奠定了手写文本数据库的构建规范。后续研究包括使用深度置信网络与稀疏编码进行无监督特征学习,以及将USPS与MNIST结合进行跨数据集迁移学习性能评估。在联邦学习领域,Flower框架以USPS作为标准示例,演示了IID与非IID数据划分下的模型聚合策略,催生了关于异构数据分布下全局模型收敛性的理论分析工作。此外,生成对抗网络(GAN)也常利用USPS进行手写数字图像生成质量评估,推动了小样本数据增强技术的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务