Civistash
收藏资源简介:
Civistash是一个每日更新的数据集,用于存档CivitAI平台(最大的AI生成媒体社区平台)上最受欢迎的图像和视频内容。该数据集通过每日抓取平台中反应数最高的内容,下载媒体文件并将其与完整的元数据侧边栏一同存储在按时间戳标记的WebDataset分片中,形成一个滚动存档。数据集采用WebDataset格式组织,每个.tar.gz分片代表一天的内容,包含配对的文件:媒体文件(如.png、.jpg、.webp、.mp4)和对应的JSON元数据文件。每个样本的JSON侧边栏包含完整的CivitAI API响应信息,包括图像ID、URL、类型、NSFW级别、尺寸、感知哈希、生成参数(如提示词、负向提示词、CFG比例、采样器、种子、步数)、模型版本ID、基础模型ID、创作者用户名、创建时间、统计数据(如反应数、评论数)、标签数组,以及一个包含下载时间戳、源URL、存储路径和存档日期的_civistash来源块。数据规模在10万到100万样本之间,元数据和提示词主要为英文,标签使用CivitAI平台的受控词汇表。该数据集适用于多种任务,包括文本到图像研究(分析真实世界的提示模式、CFG比例分布等)、美学分析(关联社区参与度与生成参数)、趋势分析(跟踪模型、风格和标签的流行度变化)、数据集增强(使用元数据作为弱标注)以及模型基准测试。数据来源于CivitAI公共API,仅包含最受反应的内容,因此存在平台流行度偏差。媒体文件和元数据遵循CivitAI服务条款,使用者需遵守相关许可。数据集由开源工具Civistash自动维护和归档。
Civistash is a daily-updated dataset for archiving the most popular images and videos on the CivitAI platform, the largest AI-generated media community. It scrapes the top-reacted content daily, downloads the media files, and stores them with full metadata sidebars in timestamped WebDataset shards, forming a rolling archive. The dataset is organized in WebDataset format, with each .tar.gz shard representing a days content and containing paired files: media files (.png, .jpg, .webp, .mp4) and corresponding JSON metadata files. Each samples JSON sidebar includes the complete CivitAI API response, such as image ID, URL, type, NSFW level, dimensions, perceptual hash, generation parameters (prompt, negative prompt, CFG scale, sampler, seed, steps), model version ID, base model ID, creator username, creation time, statistics (reactions, comments), tag array, and a _civistash provenance block with download timestamp, source URL, storage path, and archive date. The dataset size ranges from 100,000 to 1,000,000 samples, with metadata and prompts primarily in English and tags using CivitAIs controlled vocabulary. It is suitable for various tasks, including text-to-image research (analyzing real-world prompt patterns, CFG scale distributions), aesthetic analysis (correlating community engagement with generation parameters), trend analysis (tracking popularity changes of models, styles, and tags), dataset augmentation (using metadata as weak labels), and model benchmarking. Data is sourced from the CivitAI public API, containing only the most reacted content, thus introducing platform popularity bias. Media files and metadata adhere to CivitAIs terms of service, and users must comply with relevant licenses. The dataset is automatically maintained and archived by the open-source tool Civistash.
数据集概述:Civistash — Daily Top CivitAI Images
数据集摘要
Civistash 是来自 CivitAI 平台每日热门图片与视频的滚动快照数据集。它每天抓取平台上最受关注的内容,下载媒体文件,并将完整的元数据以时间戳命名的每日 WebDataset 分片形式存储。数据集是一个滚动归档,每个 .tar.gz 分片包含当天的热门内容。
数据集格式
该数据集采用 WebDataset 格式,每个 .tar.gz 分片内包含共享相同文件名根(即 CivitAI 图片ID)的配对文件。
- 媒体文件:
.jpg、.png、.webp格式的图片,.mp4格式的视频 - 元数据文件:
.json格式的完整 CivitAI API 响应及_civistash来源信息块
一个分片代表一天的数据。
元数据 JSON 结构
每个 <id>.json 文件包含:
id:图片IDurl:CivitAI CDN 上的媒体直链type:图片或视频nsfw:NSFW 等级(None / Soft / Mature / X)width、height:图片像素尺寸hash:感知哈希meta:生成参数(prompt、negativePrompt、cfgScale、sampler、seed、steps 等)modelVersionId、modelId:使用的模型版本与基础模型IDusername:创作者用户名createdAt:发布时间stats:互动统计(reactionCount、commentCount、cryCount、likeCount)tags:标签数组(含id与name)_civistash:来源信息块(downloaded_at、source_url、stored_as、archive_date)
支持的任务
- 文生图研究:研究社区中真实的提示词模式、CFG Scale 分布、采样器偏好和步数选择
- 美学分析:将社区参与度(点赞、评论)与生成参数和模型选择相关联
- 趋势分析:追踪不同模型、风格和标签在 CivitAI 平台上的流行度随时间的变化
- 数据集增强:利用元数据(提示词、标签)作为弱标注,用于图片描述生成或 CLIP 风格的训练
- 模型基准测试:对比不同基础模型和微调模型的输出与社区投票偏好的差异
语言
元数据和提示词主要为 英语。标签使用 CivitAI 平台的控制词汇表。部分提示词可能包含其他语言的片段。
数据集结构
数据划分
无训练/验证/测试划分。每天一个分片,文件名为 YYYY-MM-DD.tar.gz。
| 划分 | 描述 |
|---|---|
| default (train) | 所有每日分片中的每张图片,按日期排序 |
数据字段
json 列暴露元数据 JSON 内容,媒体文件根据类型暴露为对应的列(jpg / png / webp / mp4)。
数据集创建
策划理由
CivitAI 是最大的 AI 生成图片公共存储库,拥有数百万上传量和活跃的社区投票系统,但缺乏官方批量导出或历史快照 API。本数据集通过定期、可重现的方式归档平台每日最热门内容,填补了这一空白。
数据来源
所有数据来自 CivitAI 公共 API(GET /api/v1/images),媒体文件从 CivitAI CDN 下载。不进行网页爬取。
收集流程
- 查询 API 获取当前时段(日/周/月/全部)按反应数排序的热门图片
- 跳过本地归档中已存在的图片(按ID去重)
- 顺序下载每张图片,遇到限流或传输错误时进行重试退避
- 写入 JSON 元数据文件(包含完整 API 响应与
_civistash来源块) - 将当日数据打包为
.tar.gzWebDataset 分片并上传至 Hugging Face 数据集仓库
标注
元数据字段由 CivitAI API 直接提供,Civistash 工具仅添加 _civistash 来源信息块。
个人信息与敏感信息
CivitAI 用户名是公开信息。不包含任何私人用户数据或认证令牌。根据归档配置,可能包含 NSFW 内容,可通过 nsfw 字段进行过滤。
使用数据时的注意事项
偏见
数据集反映了 CivitAI 平台的流行度偏见:仅包含最受关注的内容,偏向于能吸引平台用户群体的内容。模型代表也偏向于流行的基础模型(Stable Diffusion 变体、Flux 等)。这不是 AI 生成内容的随机样本,而是明确的 流行度排名快照。
许可
媒体文件和元数据来自 CivitAI,受 CivitAI 服务条款 约束。个别图片可能有创作者设定的额外许可。数据集使用者有责任遵守所有适用的许可和条款。
其他信息
数据集维护者
由 Hyphonical 使用自动化的 Civistash 归档工具维护。
许可信息
- 媒体和元数据来源:CivitAI,遵守其服务条款和创作者许可
- Civistash 工具本身:MIT 许可




