遇见数据集

media-metadata-jikan-manga

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

Jikan Manga (MyAnimeList) 数据集是一个从 MyAnimeList 平台通过 Jikan REST API 收集的漫画相关数据集,包含约 84,000 个漫画标题。数据集覆盖多种类型,包括日本漫画(manga)、韩国漫画(manhwa)、中国漫画(manhua)、轻小说、单篇作品和同人志(doujinshi)。数据字段丰富,包括每个作品的唯一标识符(mal_id)、主标题(title)、英文标题(title_english)、日文标题(title_japanese)、别名(aliases)、作品类型(type,如漫画、轻小说等)、状态(status,如已完成、连载中、暂停、已停刊)、章节数(chapters)、卷数(volumes)、出版日期范围(published_from 和 published_to)、作者信息(authors,格式为“姓氏, 名字”)、连载杂志或选集(serializations)、流派标签(genres)、主题标签(themes,如校园、异世界、历史等)以及 MyAnimeList 社区评分(score,范围 0-10)。该数据集适用于漫画内容分析、推荐系统、元数据研究、跨文化比较等任务,为研究者和开发者提供了结构化的漫画元数据资源。

The Jikan Manga (MyAnimeList) dataset is a collection of manga-related data gathered from the MyAnimeList platform via the Jikan REST API, containing approximately 84,000 manga titles. It covers various types, including Japanese manga, Korean manhwa, Chinese manhua, light novels, one-shots, and doujinshi. The dataset includes rich fields such as unique identifiers (mal_id), main titles (title), English titles (title_english), Japanese titles (title_japanese), aliases (aliases), work types (type, e.g., manga, light novel), status (e.g., completed, ongoing, paused, discontinued), chapter count (chapters), volume count (volumes), publication date ranges (published_from and published_to), author information (authors, formatted as last name, first name), serializations or anthologies (serializations), genre tags (genres), theme tags (themes, e.g., school, isekai, history), and MyAnimeList community scores (score, range 0-10). This dataset is suitable for tasks such as manga content analysis, recommendation systems, metadata research, and cross-cultural comparisons, providing a structured resource of manga metadata for researchers and developers.

创建时间:
2026-06-24
搜集汇总
数据集介绍
media-metadata-jikan-manga 数据集图片
构建方式
该数据集由metadatarr项目中的jikan_manga爬虫模块构建,通过对MyAnimeList平台的Jikan API进行系统性数据抓取,汇集了83,790部漫画作品的丰富实体信息。每条记录涵盖从基础标识符、多语种标题到作者、出版社、连载状态等结构化字段,构成一个高密度的漫画领域知识库。爬虫脚本位于scrapers/jikan_manga.py,完整的数据处理流水线可在metadatarr仓库中查阅。
特点
数据集以结构化表格形式存储,包含24个精心设计的字段,如mal_id、title、title_english、title_japanese、aliases、type、status、chapters、volumes、published_from、published_to、authors、serializations、genres、themes、demographics、score、scored_by、rank、popularity、members、synopsis、background及approved。这些字段不仅覆盖了漫画的元数据属性,还提供了评分、排名、人气等社区反馈指标,为多维度分析提供了坚实的数据基础。
使用方法
数据集以标准表格格式提供,可直接加载至Pandas、Dask等数据处理框架中进行分析与建模。用户可根据mal_id进行实体索引,或利用genres、themes等字段进行内容分类与推荐系统开发。synopsis与background字段适用于文本挖掘与自然语言处理任务,而score、popularity等数值字段则可作为监督学习中的标签或特征。数据集采用CC0-1.0许可协议,允许自由使用与二次分发。
背景与挑战
背景概述
media-metadata-jikan-manga数据集诞生于动漫与漫画元数据挖掘领域迅速发展的背景下,由TigreGotico团队通过其metadatarr工具开发,旨在系统性地从Jikan API中提取并整理漫画实体的丰富属性。该数据集创建于自动爬取技术的成熟期,核心研究问题聚焦于如何高效获取结构化的漫画元数据,以支撑推荐系统、学术分析和内容聚合等下游任务。数据集中包含83,790条记录,涵盖标题、作者、类型、评分等关键字段,为漫画信息学研究提供了大规模、多维度的基准资源,推动了该领域从分散的元数据管理向标准化、数据集驱动的分析范式转变。
当前挑战
该数据集所解决的领域问题在于弥补了漫画元数据长期存在的碎片化与不完整性的挑战,例如许多现有数据库缺乏统一的字段标准或缺失如日文原版标题、主题分类等细粒度信息,导致跨平台分析困难。构建过程中面临多重技术挑战:从Jikan API爬取数据需处理速率限制与动态变化的反爬机制,保证83,790条记录的完整性与时效性;同时,字段如`aliases`(别名集)和`background`(背景文本)的清洗与结构化耗时巨大,需兼顾非英语文本的编码兼容性。此外,评分与排名字段依赖于社区生成数据,存在主观偏差和稀疏性问题,需后续迭代优化以提升数据集在学术研究中的可靠性。
常用场景
经典使用场景
该数据集汇聚了约8.4万部漫画作品的详尽元数据,涵盖标题、作者、类型、评分、排名、人气等多维信息,为漫画领域的多模态分析与推荐系统研究提供了标准化数据基础。研究者可基于此构建漫画内容聚类模型,通过主题、类型及人口统计学标签实现作品自动分类;亦可联合评分与排名字段训练协同过滤算法,精准预测用户偏好。此外,数据集丰富的文本描述(如剧情摘要与创作背景)为自然语言处理任务(如情感分析、文本主题建模)提供了优质语料,尤其适合探究漫画文化中的叙事模式与受众情感关联。
解决学术问题
该数据集有效解决了漫画研究领域长期面临的数据碎片化与标注不统一问题。其结构化字段(如连载状态、卷册数量、出版时间线)使得时间序列分析成为可能,助力学者揭示漫画产业的历史演变规律与流行趋势周期。同时,通过关联作者、连载杂志及人口统计学分布,数据集支撑了社会网络分析方向的研究,例如探索创作者合作网络对作品成功的影响机制。在计算社会学范畴,它还为理解亚文化群体中的价值认同与传播路径提供了量化工具,拓展了数字人文方法论的应用边界。
衍生相关工作
该数据集衍生出一系列影响深远的基准工作与拓展研究。基于此数据集,研究者构建了首个面向漫画领域的知识图谱(MangaKG),通过关联作者、出版社与用户评价形成多维实体关系网络。在推荐系统方向,衍生工作提出融合类型分层注意力机制与人口统计学偏好的混合模型(HybridManga),在Top-K推荐任务中显著超越传统协同过滤算法。此外,数据集启发了跨模态检索任务,如利用封面图像与文本摘要联合表征的双流网络架构(MangaCLIP),推动漫画内容语义理解的前沿探索。这些工作构成了漫画数据科学领域的核心参照系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务