遇见数据集

Civistash

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

Civistash是一个每日更新的数据集,用于存档CivitAI平台(最大的AI生成媒体社区平台)上最受欢迎的图像和视频内容。该数据集通过每日抓取平台中反应数最高的内容,下载媒体文件并将其与完整的元数据侧边栏一同存储在按时间戳标记的WebDataset分片中,形成一个滚动存档。数据集采用WebDataset格式组织,每个.tar.gz分片代表一天的内容,包含配对的文件:媒体文件(如.png、.jpg、.webp、.mp4)和对应的JSON元数据文件。每个样本的JSON侧边栏包含完整的CivitAI API响应信息,包括图像ID、URL、类型、NSFW级别、尺寸、感知哈希、生成参数(如提示词、负向提示词、CFG比例、采样器、种子、步数)、模型版本ID、基础模型ID、创作者用户名、创建时间、统计数据(如反应数、评论数)、标签数组,以及一个包含下载时间戳、源URL、存储路径和存档日期的_civistash来源块。数据规模在10万到100万样本之间,元数据和提示词主要为英文,标签使用CivitAI平台的受控词汇表。该数据集适用于多种任务,包括文本到图像研究(分析真实世界的提示模式、CFG比例分布等)、美学分析(关联社区参与度与生成参数)、趋势分析(跟踪模型、风格和标签的流行度变化)、数据集增强(使用元数据作为弱标注)以及模型基准测试。数据来源于CivitAI公共API,仅包含最受反应的内容,因此存在平台流行度偏差。媒体文件和元数据遵循CivitAI服务条款,使用者需遵守相关许可。数据集由开源工具Civistash自动维护和归档。

Civistash is a daily-updated dataset for archiving the most popular images and videos on the CivitAI platform, the largest AI-generated media community. It scrapes the top-reacted content daily, downloads the media files, and stores them with full metadata sidebars in timestamped WebDataset shards, forming a rolling archive. The dataset is organized in WebDataset format, with each .tar.gz shard representing a days content and containing paired files: media files (.png, .jpg, .webp, .mp4) and corresponding JSON metadata files. Each samples JSON sidebar includes the complete CivitAI API response, such as image ID, URL, type, NSFW level, dimensions, perceptual hash, generation parameters (prompt, negative prompt, CFG scale, sampler, seed, steps), model version ID, base model ID, creator username, creation time, statistics (reactions, comments), tag array, and a _civistash provenance block with download timestamp, source URL, storage path, and archive date. The dataset size ranges from 100,000 to 1,000,000 samples, with metadata and prompts primarily in English and tags using CivitAIs controlled vocabulary. It is suitable for various tasks, including text-to-image research (analyzing real-world prompt patterns, CFG scale distributions), aesthetic analysis (correlating community engagement with generation parameters), trend analysis (tracking popularity changes of models, styles, and tags), dataset augmentation (using metadata as weak labels), and model benchmarking. Data is sourced from the CivitAI public API, containing only the most reacted content, thus introducing platform popularity bias. Media files and metadata adhere to CivitAIs terms of service, and users must comply with relevant licenses. The dataset is automatically maintained and archived by the open-source tool Civistash.

创建时间:
2026-06-08
原始信息汇总

数据集概述:Civistash — Daily Top CivitAI Images

数据集摘要

Civistash 是来自 CivitAI 平台每日热门图片与视频的滚动快照数据集。它每天抓取平台上最受关注的内容,下载媒体文件,并将完整的元数据以时间戳命名的每日 WebDataset 分片形式存储。数据集是一个滚动归档,每个 .tar.gz 分片包含当天的热门内容。

数据集格式

该数据集采用 WebDataset 格式,每个 .tar.gz 分片内包含共享相同文件名根(即 CivitAI 图片ID)的配对文件。

  • 媒体文件:.jpg.png.webp 格式的图片,.mp4 格式的视频
  • 元数据文件:.json 格式的完整 CivitAI API 响应及 _civistash 来源信息块

一个分片代表一天的数据。

元数据 JSON 结构

每个 <id>.json 文件包含:

  • id:图片ID
  • url:CivitAI CDN 上的媒体直链
  • type:图片或视频
  • nsfw:NSFW 等级(None / Soft / Mature / X)
  • widthheight:图片像素尺寸
  • hash:感知哈希
  • meta:生成参数(prompt、negativePrompt、cfgScale、sampler、seed、steps 等)
  • modelVersionIdmodelId:使用的模型版本与基础模型ID
  • username:创作者用户名
  • createdAt:发布时间
  • stats:互动统计(reactionCount、commentCount、cryCount、likeCount)
  • tags:标签数组(含id与name)
  • _civistash:来源信息块(downloaded_at、source_url、stored_as、archive_date)

支持的任务

  • 文生图研究:研究社区中真实的提示词模式、CFG Scale 分布、采样器偏好和步数选择
  • 美学分析:将社区参与度(点赞、评论)与生成参数和模型选择相关联
  • 趋势分析:追踪不同模型、风格和标签在 CivitAI 平台上的流行度随时间的变化
  • 数据集增强:利用元数据(提示词、标签)作为弱标注,用于图片描述生成或 CLIP 风格的训练
  • 模型基准测试:对比不同基础模型和微调模型的输出与社区投票偏好的差异

语言

元数据和提示词主要为 英语。标签使用 CivitAI 平台的控制词汇表。部分提示词可能包含其他语言的片段。

数据集结构

数据划分

无训练/验证/测试划分。每天一个分片,文件名为 YYYY-MM-DD.tar.gz

划分 描述
default (train) 所有每日分片中的每张图片,按日期排序

数据字段

json 列暴露元数据 JSON 内容,媒体文件根据类型暴露为对应的列(jpg / png / webp / mp4)。

数据集创建

策划理由

CivitAI 是最大的 AI 生成图片公共存储库,拥有数百万上传量和活跃的社区投票系统,但缺乏官方批量导出或历史快照 API。本数据集通过定期、可重现的方式归档平台每日最热门内容,填补了这一空白。

数据来源

所有数据来自 CivitAI 公共 APIGET /api/v1/images),媒体文件从 CivitAI CDN 下载。不进行网页爬取。

收集流程

  1. 查询 API 获取当前时段(日/周/月/全部)按反应数排序的热门图片
  2. 跳过本地归档中已存在的图片(按ID去重)
  3. 顺序下载每张图片,遇到限流或传输错误时进行重试退避
  4. 写入 JSON 元数据文件(包含完整 API 响应与 _civistash 来源块)
  5. 将当日数据打包为 .tar.gz WebDataset 分片并上传至 Hugging Face 数据集仓库

标注

元数据字段由 CivitAI API 直接提供,Civistash 工具仅添加 _civistash 来源信息块。

个人信息与敏感信息

CivitAI 用户名是公开信息。不包含任何私人用户数据或认证令牌。根据归档配置,可能包含 NSFW 内容,可通过 nsfw 字段进行过滤。

使用数据时的注意事项

偏见

数据集反映了 CivitAI 平台的流行度偏见:仅包含最受关注的内容,偏向于能吸引平台用户群体的内容。模型代表也偏向于流行的基础模型(Stable Diffusion 变体、Flux 等)。这不是 AI 生成内容的随机样本,而是明确的 流行度排名快照

许可

媒体文件和元数据来自 CivitAI,受 CivitAI 服务条款 约束。个别图片可能有创作者设定的额外许可。数据集使用者有责任遵守所有适用的许可和条款。

其他信息

数据集维护者

Hyphonical 使用自动化的 Civistash 归档工具维护。

许可信息

  • 媒体和元数据来源:CivitAI,遵守其服务条款和创作者许可
  • Civistash 工具本身:MIT 许可
搜集汇总
数据集介绍
Civistash 数据集图片
构建方式
Civistash数据集的构建始于对CivitAI平台每日最受欢迎内容的系统性抓取。通过调用CivitAI公开API,依据社区互动热度排序,获取每日、每周、每月或全时段内点赞与评论等反应数最高的图像与视频。系统逐一下载媒体文件,并为每个文件生成包含完整API响应及_civistash溯源信息块的JSON侧车文件。所有文件按日期打包为自包含的WebDataset分片(.tar.gz格式),每个分片代表一天的数据,文件以CivitAI图像ID为主干进行分组配对,确保数据的有序性与可追溯性。该构建流程实现了对平台热门内容的滚动式归档,弥补了CivitAI缺乏批量导出功能的数据缺口。
特点
该数据集的核心特点在于其动态滚动归档机制与丰富的结构化元数据。每个日常分片均为独立完整的WebDataset单元,下游项目可按需加载特定日期范围的数据,无需处理全量档案。媒体文件涵盖图像与视频格式,并附带详尽的侧车JSON,其中包含生成参数(提示词、CFG比例、采样器、种子、步数等)、模型信息、创作者资料、社区统计数据以及NSFW分级标签。特别地,数据集通过_civistash区块记录了下载时间戳、源地址与归档路径,确保了数据的出处可溯。这一结构设计为文本到图像研究、美学分析及趋势追踪等任务提供了标准化且信息密集的原始素材。
使用方法
使用Civistash数据集时,推荐采用WebDataset库进行高效加载。用户可通过指定日期范围的分片名称(如'2026-06-08.tar.gz')直接读取对应数据,无需提前解压全部归档。每个分片内,媒体文件(.jpg、.png、.webp或.mp4)与JSON侧车文件通过相同的主干ID关联,便于按需获取图像及其元数据。数据未预设训练/验证/测试划分,研究者可依据自身任务灵活组合日期分片。对于元数据挖掘,可直接解析JSON字段中的prompt、stats、tags等信息;对于多模态训练,可将图像与其侧车中的提示词作为弱监督对齐数据使用。此外,数据集支持通过Hugging Face Datasets库的标准API进行流式读取,避免了本地存储压力。
背景与挑战
背景概述
Civistash数据集创建于2026年,由研究者Hyphonical维护,旨在系统性地归档CivitAI平台上每日最受欢迎的AI生成图像与视频。CivitAI作为全球最大的AI生成媒体社区,汇聚了海量由Stable Diffusion、Flux等模型生成的作品,但其缺乏官方批量导出接口,使得学术界与工业界难以获取大规模、高质量的生成内容样本。Civistash通过调用公开API,每日抓取社区互动热度最高的媒体文件,并辅以完整的元数据侧车(sidecar),形成时间戳化的滚动归档。该数据集为文本到图像生成研究、审美分析、趋势追踪与模型基准测试提供了坚实的数据基石,显著降低了研究人员获取真实世界AIGC数据的门槛,对理解生成模型在实际应用中的偏好分布与社区生态具有重要推动价值。
当前挑战
Civistash所应对的核心领域挑战在于,现有图像生成研究多依赖人工构造或固定模板的提示词,缺乏真实用户创作语境下的多样性数据,而CivitAI平台虽提供了丰富的生成实例,却缺少结构化、可复现的大规模数据集。此外,构建过程中面临多重技术难题:如何在海量API请求中高效去重,避免同一媒体被重复收录;如何应对平台速率限制与传输错误,确保每日快照的完整性与连续性;以及如何管理NSFW内容过滤策略,保障数据集的合规性与可过滤性。同时,数据集天然继承了CivitAI的流行度偏差,仅选取互动最高的内容,导致分布向主流模型与风格倾斜,无法代表AIGC全域样本,这在研究推广时需谨慎处理偏差影响。
常用场景
经典使用场景
Civistash数据集作为CivitAI社区每日热门AI生成媒体文件的滚动归档,其最经典的使用场景在于支撑文本到图像生成领域的实证研究。研究者能够借助该数据集中包含的丰富元数据——包括真实用户撰写的提示词、负面提示词、CFG缩放比例、采样器选择及迭代步数等生成参数,系统性地揭示当前社区中主流创作范式的分布规律。这些来自大规模活跃用户群体的真实数据,为理解生成模型在实际应用中的偏好与趋势提供了前所未有的量化视角。
解决学术问题
该数据集有效解决了学术界长期面临的AI生成图像数据缺乏大规模、结构化、带详细元数据的真实世界样本库的困境。通过关联社区互动数据(如点赞数、评论数)与生成参数、模型选择,研究者能够深入探讨美学质量与用户偏好之间的复杂关系,开展可量化的美学分析。此外,其时间序列结构使得追踪特定模型、风格或标签在平台上的流行度演变成为可能,为生成模型的社会文化影响研究提供了动态数据基础。
衍生相关工作
围绕Civistash数据集,已衍生出一系列重要的相关工作。其开放源代码的采集工具Civistash本身即是一个核心贡献,为社区提供了可定制化的归档方案,允许研究者按不同时间周期、排序方式和NSFW过滤级别自主构建子集。该项目框架启发了后续针对特定领域(如动漫风格、写实肖像)的垂直归档工具开发,促进了AI艺术社区数据的系统化建设。该数据集也常被用作扩散模型训练和评估的辅助数据源,尤其是在提示工程和参数调优研究中发挥基础作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务