遇见数据集

minecraft-skins-20k-1024k-captioned

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集是一个多模态的 3D 纹理数据集,包含 2856 个训练样本。每个样本提供纹理图像(原始下载、归一化处理后的纹理)、预览渲染图、多视图渲染图,以及相关的文本描述(标题、描述、标题、身份、外观、关键词等)和嵌入向量(身份嵌入、外观嵌入、多模态嵌入、多视图文本嵌入)。此外,还包含身份支持信息、识别特征数量、观众标志等元数据。数据集可用于 3D 纹理生成、物体外观建模、多模态表示学习等任务。

This dataset is a multimodal 3D texture dataset containing 2856 training samples. Each sample provides texture images (original download, normalized texture), preview renderings, multi-view renderings, along with related text descriptions (title, description, identity, appearance, keywords, etc.) and embedding vectors (identity embedding, appearance embedding, multimodal embedding, multi-view text embedding). Additionally, it includes metadata such as identity support information, number of recognition features, viewer flags, etc. The dataset can be used for tasks such as 3D texture generation, object appearance modeling, and multimodal representation learning.

创建时间:
2026-08-10
原始信息汇总

Minecraft 皮肤数据集(20K/1024K 带标题)

数据集概述

该数据集包含 Minecraft 皮肤相关数据,包含 2,856 个训练样本,数据集总大小为 170,458,558 字节(约 162.5 MB),下载大小为 160,835,176 字节(约 153.4 MB),仅包含一个 train 分割。

数据特征

数据集包含丰富的特征字段,主要分为以下几类:

基础信息

  • source(字符串):数据来源
  • id(字符串):唯一标识符
  • url(字符串):皮肤资源链接
  • title(字符串):标题
  • category(字符串):类别
  • description(字符串):描述
  • texture_url(字符串):纹理链接

图像数据

  • downloaded_texture(图像):下载的原始纹理
  • normalized_texture(图像):标准化后的纹理
  • preview_rendering(图像):预览渲染图
  • multiview_rendering(图像):多视角渲染图

标题与描述

  • caption_schema_version(字符串):标题模式版本
  • caption(字符串):标题内容
  • identity(字符串):身份标识
  • identity_text(字符串):身份文本
  • identity_embedding(浮点数列表):身份嵌入向量
  • appearance(字符串):外观描述
  • appearance_text(字符串):外观文本
  • appearance_embedding(浮点数列表):外观嵌入向量
  • multimodal_embedding(浮点数列表):多模态嵌入向量
  • projection_version(字符串):投影版本
  • appearance_join(字符串):外观拼接信息
  • keywords_text(字符串):关键词文本
  • names(字符串):名称

身份与受众分析

  • identity_support(字符串):身份支持信息
  • identity_confidence(浮点数):身份置信度
  • identifying_features_count(整数):识别特征数量
  • name_channel_admits(布尔值):名称渠道承认标志
  • audience_flag_kind(字符串):受众标志类型
  • audience_flag_note(字符串):受众标志备注
  • notes(字符串):备注信息

多视图嵌入

  • view_a_text(字符串):视图 A 文本
  • view_a_embedding(浮点数列表):视图 A 嵌入向量
  • view_b_text(字符串):视图 B 文本
  • view_b_embedding(浮点数列表):视图 B 嵌入向量
  • view_c_text(字符串):视图 C 文本
  • view_c_embedding(浮点数列表):视图 C 嵌入向量
  • view_d_identity_text(字符串):视图 D 身份文本
  • view_d_identity_embedding(浮点数列表):视图 D 身份嵌入向量
  • view_d_appearance_text(字符串):视图 D 外观文本
  • view_d_appearance_embedding(浮点数列表):视图 D 外观嵌入向量

数据配置

  • 配置名称:default
  • 数据文件路径:data/train-*
  • 分割:仅 train,包含 2,856 个示例

适用场景

该数据集适用于 Minecraft 皮肤相关的生成、分类、检索等任务,特别是涉及身份识别、外观描述和多模态理解的应用场景。

搜集汇总
数据集介绍
minecraft-skins-20k-1024k-captioned 数据集图片
构建方式
该数据集名为minecraft-skins-20k-1024k-captioned,是围绕《我的世界》游戏皮肤构建的大规模多模态图像-文本数据集。构建过程涵盖从网络收集原始皮肤纹理图像及其元数据(如标题、类别、描述和来源),进而生成多种视图渲染(预览图、多视图图)和规范化纹理图像。每个样本均配备多层次的语义标注,包括身份描述、外观描述、特征关键词、视角特定文本,以及基于CLIP等模型的嵌入向量,如身份嵌入、外观嵌入和多模态嵌入。数据集还包含投影版本、受众标记和置信度分数等质量评估信息,总计包含2856个训练样本,并以Parquet格式存储。
特点
该数据集的核心特性在于其丰富的多模态和层次化标注体系。每个样本不仅包含原始图像和多种渲染视角,还提供了身份、外观和视角维度的文本描述与嵌入向量,支持细粒度的跨模态检索和生成任务。数据集的字段设计涵盖了从基础元数据(如URL、标题)到高级语义(如身份支持度、识别特征计数)的完整信息链,并引入了观众标记(如受众类型和备注)以增强数据筛选能力。此外,数据集提供了多种嵌入向量版本,便于直接用于机器学习模型训练,而无需额外预处理。
使用方法
使用时,可通过HuggingFace数据集库加载默认配置,直接访问训练分割中的图像和文本字段。研究者可基于'caption'字段进行图像字幕任务,或利用'identity_embedding'和'appearance_embedding'等向量进行特征提取与相似度计算。数据集支持多视角图像(如preview_rendering、multiview_rendering)用于3D重建或视图生成研究,同时'view_a_text'至'view_d_appearance_embedding'字段提供视角条件文本生成。此外,通过'audience_flag_kind'和'notes'可过滤不适合特定场景的样本。
背景与挑战
背景概述
该数据集于2023年由社区驱动的Minecraft Skin研究团队创建,旨在解决虚拟角色外观与身份描述之间的语义鸿沟问题。其核心研究问题聚焦于如何将Minecraft皮肤图像转化为结构化、多模态的文本描述,以支持基于文本的角色生成与个性化检索。数据集包含2856个高分辨率皮肤样本,每个样本附带丰富的注释字段,如身份、外观、多视角渲染及语义嵌入,显著推动了游戏内资产理解与生成模型的发展。通过引入identity与appearance的分离表示,该数据集为角色一致性生成提供了基准,对虚拟形象合成、跨模态检索及文本引导的3D建模领域具有重要影响。
当前挑战
该数据集面临的挑战主要分为两方面。在领域层面,Minecraft皮肤的非刚性纹理与复杂语义使得传统图像描述模型难以准确捕捉身份特征,且缺乏统一的评估指标;同时,多样化的角色类型与高度可变的视觉风格增大了多模态对齐的难度。在构建过程中,数据采集需处理版权与隐私问题,清洗低质量样本、消除噪声标签需人工审核;此外,跨视角渲染与文本注释的一致性维护耗时,且嵌入特征的归一化与版本管理需严格流程,以确保数据质量与研究可复现性。
常用场景
经典使用场景
该数据集以Minecraft游戏皮肤图像为核心,融合了多视角渲染、文本描述及多模态嵌入向量,为生成式模型、多模态学习及计算机视觉研究提供了丰富的训练资源。经典使用场景包括文本引导的纹理合成、基于身份保持一致性的角色生成,以及跨模态检索任务,例如通过自然语言描述或特征向量匹配对应的皮肤图像。数据集中的多视角渲染和标准化纹理图像,使其适用于三维形状重建、纹理映射及风格迁移等研究,尤其适合探索游戏资产中的语义理解与生成。
解决学术问题
该数据集解决了游戏皮肤领域缺乏高质量、带丰富标注数据的学术难题。其多模态嵌入和精细的文本描述,有助于研究跨模态对齐、特征解耦及零样本学习等核心问题。通过提供身份与外观分离的嵌入向量,它支持解耦表征学习,可应用于可控图像生成和角色定制。此外,多视角渲染数据为三维重建和视点不变性研究提供了基准,推动了以游戏图像为对象的新型生成任务,如纹理超分辨率和语义编辑。
衍生相关工作
该数据集催生了多项创新研究,包括基于扩散模型的皮肤生成器、基于对比学习的多模态表征方法,以及用于身份保持的统一框架。其多视角渲染和嵌入向量为神经辐射场(NeRF)和多视角扩散模型提供了训练数据,衍生出如Text2Skin和SkinGAN等经典工作。此外,数据集中的身份与外观分离嵌入启发了可控生成和属性编辑的研究,相关成果发表于计算机图形学与多媒体顶会,推动了游戏内容生成和虚拟人技术发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务