booru_tag_and_artist_20241208
收藏资源简介:
该数据集是一个JSON文件,包含从danbooru提取的标签和艺术家信息(2024/12/8版本)。所有数据按标签计数预先排序。还提供了一个JSONL文件,以便在Apache允许Parquet文件的环境中使用。请在本地处理数据(如创建CSV文件)时参考此数据集。该文件基于danbooru API创建。
This dataset is a JSON file containing tags and artist information extracted from Danbooru (version as of December 8, 2024). All data is pre-sorted by tag count. A supplementary JSONL file is also provided for use in environments supporting Apache Parquet files. This dataset should be referenced when conducting local data processing, such as creating CSV files. It is built upon the Danbooru API.
booru_tag_and_artist_20241208
关于
该数据集是一个从danbooru(2024/12/8版本)中提取的标签和艺术家的JSON文件。所有数据按标签计数预先排序。
还提供了一个JSONL文件,以便在Apache允许Parquet文件的环境中使用。请在本地处理数据(如创建CSV文件)时参考此文件。
该文件基于danbooru API创建。
文件描述
- artists_cooked.jsonl: 包含一些处理过的艺术家信息。不应存在未列在标签中的艺术家。
- artists.parquet: artists_cooked.jsonl的Parquet格式。
- tags_booru_full.jsonl: 包含所有标签信息的文件。
- tags_booru_full.parquet: tags_booru_full.jsonl的Parquet格式。
日语部分
该数据集是从danbooru中提取的标签和艺术家的Jsonl、parquet文件(2024/12/8版)。所有数据按标签计数预先排序。
为了在Apache允许Parquet文件的环境中使用,还提供了JSONL文件。请在本地处理数据(如创建CSV文件)时参考此文件。
该文件基于Danbooru的API创建。
文件描述
- artists_cooked.jsonl: 包含一些处理过的艺术家信息。不应存在未列在标签中的艺术家。
- artists.parquet: artists_cooked.jsonl的Parquet格式。
- tags_booru_full.jsonl: 包含所有标签信息的文件。
- tags_booru_full.parquet: tags_booru_full.jsonl的Parquet格式。




