遇见数据集

xyran_train_dataset

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集是为Xyran本地内容安全模型训练而准备的,名为Xyran training dataset。数据集来源于deepghs/anime_dbrating数据集,经过类别映射:将general和sensitive类别归为安全(SFW),将questionable和explicit类别归为不适合工作场所(NSFW)。所有图像均被转换为WebP格式(质量95,无损压缩关闭,effort=2,无缩放裁剪)。数据集包含四个目录:sfw/(安全图像)、nsfw/(不适合工作场所图像)、nsfl/(可能不适合生活图像)以及_manifests/(清单文件)。数据规模:SFW图像683,275张,NSFW图像598,226张,无转换失败。该数据集适用于图像分类、内容审核等任务,特别针对动漫风格图像的NSFW检测。

This dataset is prepared for training the Xyran local content safety model, named Xyran training dataset. It originates from the deepghs/anime_dbrating dataset, with category mapping: general and sensitive are classified as safe for work (SFW), while questionable and explicit are classified as not safe for work (NSFW). All images are converted to WebP format (quality 95, lossless compression off, effort=2, no scaling or cropping). The dataset contains four directories: sfw/ (safe images), nsfw/ (not safe for work images), nsfl/ (not safe for life images), and _manifests/ (manifest files). Data scale: 683,275 SFW images and 598,226 NSFW images, with no conversion failures. This dataset is suitable for tasks such as image classification and content moderation, particularly for NSFW detection in anime-style images.

创建时间:
2026-09-05
原始信息汇总

Xyran 训练数据集概述

基础信息

  • 许可证:CC-BY-4.0
  • 任务类型:图像分类(image-classification)
  • 标签:图像(image)、WebP格式、内容审核(content-moderation)、NSFW(非适龄内容)、非全年龄段内容(not-for-all-audiences)

数据集用途

该数据集专为 Xyran 本地内容安全模型的训练而准备,用于内容审核场景下的图像分类任务。

数据目录结构

  • sfw/:安全/适龄内容图像
  • nsfw/:非安全/不适龄内容图像
  • nsfl/:不适合生活内容(极端内容)
  • _manifests/:清单/元数据目录

数据来源与迁移信息

数据源自 deepghs/anime_dbrating 数据集,进行了动漫评分数据的 WebP 格式迁移(迁移时间为 2026年9月5日 11:12:17)。

类别映射规则

  • general + sensitive(一般 + 敏感)→ SFW(安全内容)
  • questionable + explicit(可疑 + 露骨)→ NSFW(非安全内容)

WebP 图像标准化处理

  • 已有 WebP 文件:逐字节直通(不进行任何修改)
  • 非 WebP 文件:通过 libvips 工具转换为 WebP 格式
    • 质量参数:95
    • 无损压缩:否
    • 编码努力级别:2
    • 不调整尺寸、不裁剪
  • ZIP 压缩载荷方式:STORE(不压缩存储)

数据统计结果

  • SFW 图像数量:683,275 张
  • NSFW 图像数量:598,226 张
  • SFW 转换失败数量:0
  • NSFW 转换失败数量:0

数据集共计包含约 128 万张图像,且所有格式转换均成功完成,无失败样本。

搜集汇总
数据集介绍
xyran_train_dataset 数据集图片
构建方式
该数据集的构建根植于内容安全模型训练对高质量标注图像的迫切需求,通过整合动漫图像评级源数据并实施系统化迁移而生成。具体而言,构建过程将原始标签中的general与sensitive类别统一归入SFW目录,questionable与explicit类别归入NSFW目录,同时引入NSFL类别以涵盖更极端的内容类型。所有非WebP格式图像经由libvips工具转换为WebP格式,参数固定为质量95、有损压缩、努力程度2,且不执行缩放或裁剪操作,已有WebP文件则按字节原样保留。数据划分与转换结果记录于_manifests目录,最终形成SFW图像683,275张、NSFW图像598,226张,转换失败数为零,确保了数据来源的完整性与可追溯性。
使用方法
在应用层面,该数据集主要服务于本地内容安全模型的训练与评估任务。使用者可依据_manifests目录中的清单文件,按需加载SFW、NSFW或NSFL子集,构建二分类或多分类图像审核模型。数据以WebP格式存储,主流深度学习框架可通过标准图像解码接口直接读取,无需额外转换。训练时建议根据任务目标调整类别采样比例,以缓解不同类别间的样本数量差异。由于数据集包含成人内容,使用前应确保符合所在机构与地区的伦理规范及法律要求,并采取适当的数据访问控制措施。模型评估阶段可利用清单中的原始映射关系,验证模型对动漫图像中敏感内容的识别能力与误报率,从而为内容审核系统的部署提供实证依据。
背景与挑战
背景概述
随着网络内容的爆炸式增长,内容安全审核成为维护平台生态的关键环节。在此背景下,xyran_train_dataset于2026年由Xyran团队构建,旨在为本地内容安全模型训练提供高质量图像资源。该数据集基于deepghs/anime_dbrating的动漫图像分级标注,将原始标签映射为SFW、NSFW和NSFL三类,并统一转换为WebP格式。数据集包含超过128万张图像,其中SFW图像68.3万张,NSFW图像59.8万张,为内容审核领域提供了大规模、标准化的训练基准,推动了相关模型在真实场景中的部署与评估。
当前挑战
内容安全图像分类面临多重挑战。领域层面,NSFW与NSFL内容常具有高度隐蔽性和多样性,模型需在极低误报率下保持高召回,同时应对对抗性样本和语义模糊边界。构建过程中,数据来源的标注偏差、类别不平衡以及从动漫分级到安全标签的映射可能引入噪声。此外,大规模WebP格式转换需确保视觉无损,而存储与传输效率亦需权衡。这些挑战要求数据集在规模、质量和代表性上持续优化,以支撑鲁棒的内容审核系统。
常用场景
经典使用场景
在内容安全与图像分类领域,xyran_train_dataset 凭借其精细的色情与暴力内容分级标注,成为训练本地内容审核模型的核心资源。该数据集涵盖 SFW、NSFW 和 NSFL 三个类别,尤其适用于二分类或多分类任务,研究者可借助大规模 WebP 图像进行模型微调,以提升对不适宜内容的识别精度。其经典用法包括构建轻量级内容过滤系统,在社交平台或论坛中实时拦截违规图像,从而维护网络环境的健康与安全。
解决学术问题
该数据集有效缓解了内容审核研究中高质量标注数据稀缺的困境,为学术社区提供了可复现的大规模基准。通过整合 anime_dbrating 的分级映射,它解决了跨源数据标签不一致的问题,促进了模型在真实场景下的泛化能力研究。同时,其明确的类别定义和标准化预处理流程,为比较不同审核算法的性能提供了公平基础,推动了内容安全领域的算法创新与评估标准化。
实际应用
在实际应用中,xyran_train_dataset 被广泛部署于本地化内容安全模型训练,例如社区平台的自定义过滤器和企业级审核系统。WebP 格式的统一处理降低了存储与传输开销,使其适合资源受限的边缘设备。此外,该数据集支持快速迭代模型更新,帮助开发者应对不断变化的违规内容模式,从而在保护用户免受有害信息侵扰的同时,兼顾审核效率与准确性。
数据集最近研究
最新研究方向
内容安全领域近期研究聚焦于多模态审核与细粒度分级,xyran_train_dataset作为面向本地内容安全模型训练的数据集,以近128万张WebP图像覆盖SFW、NSFW及NSFL三类,映射自anime_dbrating的评级体系,为色情、暴力等有害内容检测提供大规模基准。当前前沿方向包括基于该数据集的轻量化NSFW分类器微调、跨域泛化评估以及WebP压缩对模型鲁棒性的影响分析,以应对动漫社区内容审核中隐私保护与实时推理的挑战。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务