遇见数据集

tpremoli/CelebA-attrs-160k-artificial

收藏
Hugging Face2024-04-23 更新2024-06-12 收录
官方服务:

资源简介:

--- license: mit dataset_info: features: - name: image dtype: image - name: 5_o_Clock_Shadow dtype: int64 - name: Arched_Eyebrows dtype: int64 - name: Attractive dtype: int64 - name: Bags_Under_Eyes dtype: int64 - name: Bald dtype: int64 - name: Bangs dtype: int64 - name: Big_Lips dtype: int64 - name: Big_Nose dtype: int64 - name: Black_Hair dtype: int64 - name: Blond_Hair dtype: int64 - name: Blurry dtype: int64 - name: Brown_Hair dtype: int64 - name: Bushy_Eyebrows dtype: int64 - name: Chubby dtype: int64 - name: Double_Chin dtype: int64 - name: Eyeglasses dtype: int64 - name: Goatee dtype: int64 - name: Gray_Hair dtype: int64 - name: Heavy_Makeup dtype: int64 - name: High_Cheekbones dtype: int64 - name: Male dtype: int64 - name: Mouth_Slightly_Open dtype: int64 - name: Mustache dtype: int64 - name: Narrow_Eyes dtype: int64 - name: No_Beard dtype: int64 - name: Oval_Face dtype: int64 - name: Pale_Skin dtype: int64 - name: Pointy_Nose dtype: int64 - name: Receding_Hairline dtype: int64 - name: Rosy_Cheeks dtype: int64 - name: Sideburns dtype: int64 - name: Smiling dtype: int64 - name: Straight_Hair dtype: int64 - name: Wavy_Hair dtype: int64 - name: Wearing_Earrings dtype: int64 - name: Wearing_Hat dtype: int64 - name: Wearing_Lipstick dtype: int64 - name: Wearing_Necklace dtype: int64 - name: Wearing_Necktie dtype: int64 - name: Young dtype: int64 - name: prompt_string dtype: string splits: - name: train num_bytes: 587012114.6949999 num_examples: 160255 download_size: 513749582 dataset_size: 587012114.6949999 configs: - config_name: default data_files: - split: train path: data/train-* ---

许可证:MIT许可证 数据集信息: 特征字段: - 字段名:图像(image),数据类型:图像类型 - 字段名:5点胡茬(5_o_Clock_Shadow),数据类型:64位整型 - 字段名:拱形眉(Arched_Eyebrows),数据类型:64位整型 - 字段名:外貌出众(Attractive),数据类型:64位整型 - 字段名:眼袋(Bags_Under_Eyes),数据类型:64位整型 - 字段名:秃顶(Bald),数据类型:64位整型 - 字段名:刘海(Bangs),数据类型:64位整型 - 字段名:厚嘴唇(Big_Lips),数据类型:64位整型 - 字段名:大鼻子(Big_Nose),数据类型:64位整型 - 字段名:黑发(Black_Hair),数据类型:64位整型 - 字段名:金发(Blond_Hair),数据类型:64位整型 - 字段名:画面模糊(Blurry),数据类型:64位整型 - 字段名:棕发(Brown_Hair),数据类型:64位整型 - 字段名:浓眉(Bushy_Eyebrows),数据类型:64位整型 - 字段名:体型肥胖(Chubby),数据类型:64位整型 - 字段名:双下巴(Double_Chin),数据类型:64位整型 - 字段名:佩戴眼镜(Eyeglasses),数据类型:64位整型 - 字段名:山羊胡(Goatee),数据类型:64位整型 - 字段名:灰发(Gray_Hair),数据类型:64位整型 - 字段名:浓妆(Heavy_Makeup),数据类型:64位整型 - 字段名:高颧骨(High_Cheekbones),数据类型:64位整型 - 字段名:男性(Male),数据类型:64位整型 - 字段名:嘴巴微张(Mouth_Slightly_Open),数据类型:64位整型 - 字段名:唇髭(Mustache),数据类型:64位整型 - 字段名:细眼(Narrow_Eyes),数据类型:64位整型 - 字段名:无胡须(No_Beard),数据类型:64位整型 - 字段名:椭圆形脸(Oval_Face),数据类型:64位整型 - 字段名:肤色白皙(Pale_Skin),数据类型:64位整型 - 字段名:尖鼻子(Pointy_Nose),数据类型:64位整型 - 字段名:发际线后移(Receding_Hairline),数据类型:64位整型 - 字段名:腮红(Rosy_Cheeks),数据类型:64位整型 - 字段名:连鬓胡子(Sideburns),数据类型:64位整型 - 字段名:微笑(Smiling),数据类型:64位整型 - 字段名:直发(Straight_Hair),数据类型:64位整型 - 字段名:卷发(Wavy_Hair),数据类型:64位整型 - 字段名:佩戴耳环(Wearing_Earrings),数据类型:64位整型 - 字段名:佩戴帽子(Wearing_Hat),数据类型:64位整型 - 字段名:涂抹口红(Wearing_Lipstick),数据类型:64位整型 - 字段名:佩戴项链(Wearing_Necklace),数据类型:64位整型 - 字段名:佩戴领带(Wearing_Necktie),数据类型:64位整型 - 字段名:年轻(Young),数据类型:64位整型 - 字段名:提示字符串(prompt_string),数据类型:字符串类型 数据集划分: - 划分名称:训练集(train),占用字节数:587012114.6949999,样本数量:160255 下载大小:513749582字节 数据集总大小:587012114.6949999字节 配置项: - 配置名称:默认(default),数据文件: - 对应划分:训练集,文件路径:data/train-*

提供机构:
tpremoli
原始信息汇总

数据集概述

数据集特征

  • image:图像数据
  • 5_o_Clock_Shadow:整数类型
  • Arched_Eyebrows:整数类型
  • Attractive:整数类型
  • Bags_Under_Eyes:整数类型
  • Bald:整数类型
  • Bangs:整数类型
  • Big_Lips:整数类型
  • Big_Nose:整数类型
  • Black_Hair:整数类型
  • Blond_Hair:整数类型
  • Blurry:整数类型
  • Brown_Hair:整数类型
  • Bushy_Eyebrows:整数类型
  • Chubby:整数类型
  • Double_Chin:整数类型
  • Eyeglasses:整数类型
  • Goatee:整数类型
  • Gray_Hair:整数类型
  • Heavy_Makeup:整数类型
  • High_Cheekbones:整数类型
  • Male:整数类型
  • Mouth_Slightly_Open:整数类型
  • Mustache:整数类型
  • Narrow_Eyes:整数类型
  • No_Beard:整数类型
  • Oval_Face:整数类型
  • Pale_Skin:整数类型
  • Pointy_Nose:整数类型
  • Receding_Hairline:整数类型
  • Rosy_Cheeks:整数类型
  • Sideburns:整数类型
  • Smiling:整数类型
  • Straight_Hair:整数类型
  • Wavy_Hair:整数类型
  • Wearing_Earrings:整数类型
  • Wearing_Hat:整数类型
  • Wearing_Lipstick:整数类型
  • Wearing_Necklace:整数类型
  • Wearing_Necktie:整数类型
  • Young:整数类型
  • prompt_string:字符串类型

数据集划分

  • train:训练集
    • num_bytes:587012114.6949999字节
    • num_examples:160255个样本

数据集大小

  • download_size:513749582字节
  • dataset_size:587012114.6949999字节
搜集汇总
数据集介绍
构建方式
该数据集以CelebA经典人脸属性数据集为基底,通过引入生成式人工智能技术对原始图像进行艺术化再创作,构建了一个包含160,255张高分辨率人脸图像的庞大规模集合。每张图像均保留了CelebA原有的40项二元人脸属性标注,涵盖面部特征、发型、配饰等维度,并额外增加了'prompt_string'字段以记录生成过程中所使用的文本提示词,从而实现了属性标签与生成语义的深度关联。数据以Parquet格式高效存储,并统一划分为训练集,便于研究人员直接调用。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,使用load_dataset('tpremoli/CelebA-attrs-160k-artificial')命令即可获取完整训练数据。每张图像以PIL Image格式存储,对应的40个属性标签为整型数值(0或1),可直接用于多标签分类任务的训练与评估。研究人员还可利用'prompt_string'字段探索文本到图像生成的逆向映射关系,或构建属性条件生成模型的验证基准。数据集的标准化接口设计使其能够无缝集成到现有的人脸分析工作流中。
背景与挑战
背景概述
CelebA-attrs-160k-artificial数据集由研究者tpremoli于近年创建,旨在扩展经典CelebA数据集在合成图像领域的应用边界。该数据集包含约16万张人工生成的肖像图像,每张图像均标注了40种面部属性,如发型、眼镜、表情等,并附有对应的文本提示词(prompt_string)。其核心研究问题在于如何利用生成模型构建大规模、高多样性且属性标注完备的人工人脸数据集,以支持多任务学习、属性识别与生成模型评估等方向。该数据集的发布为计算机视觉领域提供了全新的基准资源,尤其推动了从真实数据到合成数据迁移学习的研究,在隐私保护与数据增强方面展现出潜在影响力。
当前挑战
该数据集面临的核心挑战首先在于解决合成图像与真实图像间的领域差异问题,即如何确保基于人工数据训练的模型能够有效泛化至真实场景中的人脸属性识别,这涉及光照、纹理与背景复杂度的系统性差异。其次,构建过程中需克服生成模型带来的属性分布偏差,例如某些罕见属性(如秃头、双下巴)在合成样本中的比例可能失真,导致模型偏向性学习。此外,40种属性的精细标注依赖于自动生成与人工校验的结合,如何保证标注一致性并避免噪声干扰,成为数据集质量控制的另一难题。这些挑战共同制约着数据集在公平性与鲁棒性评估中的广泛应用。
常用场景
经典使用场景
CelebA-attrs-160k-artificial数据集在计算机视觉与生成式模型领域具有广泛的应用价值,其经典使用场景集中于多属性人脸图像的精细调控与可控生成。研究者利用该数据集提供的40项二元人脸属性标注(如发型、胡须、眼镜等)以及对应的文本提示词,能够高效训练条件生成对抗网络或扩散模型,实现对生成人脸在特定属性维度上的精确操纵。例如,通过改变“Male”“Smiling”或“Eyeglasses”等标签,模型可生成具有指定属性组合的高质量人脸图像,从而推动属性编辑与风格迁移等任务的深入研究。
解决学术问题
该数据集的核心贡献在于解决了人脸属性识别与生成领域中标注数据稀疏性与属性耦合性的关键学术难题。传统CelebA数据集仅提供属性标签,缺乏与生成任务直接关联的文本描述,限制了多模态模型的发展。CelebA-attrs-160k-artificial通过引入prompt_string字段,将属性标签转化为自然语言提示,为文本到图像生成、属性可控生成及跨模态对齐研究提供了标准化基准。这一设计显著提升了模型在复杂属性组合下的泛化能力,并推动了条件生成模型在细粒度人脸编辑中的理论突破。
实际应用
在实际应用层面,该数据集赋能了多项与人脸相关的智能系统,包括个性化虚拟形象创建、美颜滤镜的智能属性调节、以及人脸识别系统的公平性评估。例如,社交媒体平台可利用该数据集训练模型,使用户通过文本描述(如“年轻且无胡须”)实时生成或编辑头像;安防领域则借助其属性多样性,测试算法在不同年龄、性别、肤色等条件下的鲁棒性。此外,该数据集还可用于辅助化妆品行业的虚拟试妆技术,通过精确控制唇色、眉型等属性提升用户体验。
数据集最近研究
最新研究方向
该数据集聚焦于利用生成式人工智能技术构建的大规模合成人脸属性数据集,其前沿研究方向在于推动计算机视觉领域中人脸属性识别与编辑模型的训练与评估。结合当前生成对抗网络与扩散模型在图像合成领域的蓬勃发展,该数据集通过模拟真实世界中人脸的多维度属性分布,为研究无偏、高泛化能力的人脸理解算法提供了关键资源。其意义在于,不仅能够缓解真实人脸数据采集中的隐私与伦理问题,还为探索属性间的内在关联与解耦表征开辟了新路径,对推动人脸识别、表情分析及个性化生成等热点应用的落地具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务