遇见数据集

anime-offline-database

收藏
github2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

一个单一的JSON文件,包含来自多个元数据提供商的动漫信息,每个条目都合并了同一动漫在各个网站上的ID。

A single JSON file containing anime information sourced from multiple metadata providers, where each entry consolidates the IDs of the same anime across various websites.

创建时间:
2026-08-27
原始信息汇总

数据集概述

本数据集为 anime-offline-database 的延续项目,由 modb-app 构建,旨在合并多个动漫元数据提供商的条目,使每个条目携带同一动漫在不同平台上的 ID。数据集以单个 JSON 文件(或 JSONL 流式文件)形式发布。

数据规模与来源

  • 数据总量:38,137 条(其中 76% 的条目已通过人工审核)
  • 更新频次:每周更新(当前统计为 2026 年第 36 周
  • 主要元数据来源及对应条目数:
条目数 来源平台
30,786 myanimelist.net
26,887 anime-planet.com
22,247 kitsu.app
21,105 anisearch.com
20,803 anilist.co
14,621 anidb.net
14,612 simkl.com
14,612 animecountdown.com
12,703 animenewsnetwork.com
12,353 livechart.me

数据获取方式

数据以发布资源(Release Assets)形式提供,而非直接存储于仓库中。请从以下固定链接获取最新版本:

  • 主文件(JSONL 流式格式):https://github.com/cedya77/anime-offline-database/releases/download/latest/anime-offline-database.jsonl
  • 其他可用文件(位于同一发布包内):
    • anime-offline-database-minified.json:单文档 JSON 压缩版
    • *.zst:Zstandard 压缩版(大小约为原始文件的 1/10)
    • dead-entries/*.json:已从各平台移除的条目 ID 记录
  • 每周版本会以 <年份>-<周数> 作为标签发布,latest 始终指向最近一次成功的构建。

数据条目结构

每个条目包含以下核心字段:

  • sources:该条目合并自的所有平台 URL 列表
  • title:动漫标题(如 "Cowboy Bebop")
  • type:类型(如 "TV")
  • episodes:集数(如 26)
  • status:状态(如 "FINISHED")

此外,条目还包含季节、标签及相关动漫等信息。数据条目若拥有多个来源 URL,则代表其被高置信度地合并;单来源条目表示该动漫仅在单一平台存在或无法确定匹配。

具体字段含义以仓库中 schemas/ 目录下的 JSON Schema 为准,每次发布前数据都会通过校验。

许可与版权

  • 数据集整体采用 Open Database License v1.0,其内容部分基于 Database Contents License v1.0 发布。
  • 允许自由分享与改编(包括商业用途),但需满足以下条件:
    • 署名:必须同时标明本项目及原 manami-project(本数据集所有条目均衍生自其成果)
    • 传播衍生数据库时需保持同一许可证
    • 不得使用技术措施限制他人使用
  • 各元数据来源平台对自身发布的数据保留各自权利。本数据集仅记录标识符及其相互对应关系,不复制原始内容。
搜集汇总
数据集介绍
anime-offline-database 数据集图片
构建方式
在动漫数字生态日益繁盛的当下,跨平台数据孤岛问题凸显,anime-offline-database应运而生。该数据集承继manami-project的归档成果,以2026年第27周最终版为种子,通过modb-app持续构建,确保历史合并决策的连贯性。数据集收集来自myanimelist、anime-planet等逾十个主流元数据提供方收录的38137部动漫条目,运用实体解析与融合技术,将同源异名条目整合为唯一记录,并为每条赋予各平台之标识符。特色在于JSON格式存储,每条记录内含来源URL、标题、类型、集数等信息,且76%条目已通过人工审核,确保高置信度合并。
特点
该数据集之精髓在于其作为跨平台动漫标识符的中央枢纽,极大简化了跨站点动漫辨识与关联操作。其独特优势包括来源全面性,覆盖超十个提供方,部分条目亦见于单一来源;每周自动更新并附统计分析,确保数据活性与时效;发布格式多样,既有流式JSONL亦有压缩Zstandard版本,满足不同部署场景;此外,dead-entries档案记录失效ID,维护数据纯洁性。每项条目经由schema验证,保障结构一致性与数据质量,堪称动漫数据互操作之基石。
使用方法
获取数据需自GitHub最新release下载附件,推荐使用anime-offline-database.jsonl进行流式处理,避免整载内存。数据结构清晰,每条记录含sources数组,映射至各平台URL,供开发者于应用内实现跨网站动漫搜索、推荐系统或数据同步。针对需求,可选用minified JSON整体加载或zst压缩版本以节省带宽。项目附带JSON schema,便于数据校验与自定义处理。开源许可ODbL允许商业利用,唯需注明出处并保持同许可共享,使用时亦应尊重各原始数据源之权利。
背景与挑战
背景概述
anime-offline-database是一个整合多源动漫元数据的开源数据集,其根源可追溯至manami-project团队创建的原始项目。该项目最初为解决动漫信息碎片化问题而生,旨在通过合并MyAnimeList、Anime-Planet等众多主流平台的数据,为每个动漫条目建立跨平台统一标识。2026年7月原仓库归档后,由modb-app团队接手延续构建,继承了前人的匹配决策,当前已收录超过3.8万条记录,其中76%经过了人工复核。该数据集为学术界和工业界提供了标准化的动漫信息基准,促进了跨平台数据互操作性研究,对信息检索、推荐系统及知识图谱构建等领域产生了深远影响。
当前挑战
数据集面临的挑战主要体现在两个层面。在领域问题上,各动漫元数据提供商的数据格式、命名规则与收录范围差异巨大,如何高效且准确地将来自十余个来源的同一部动漫进行实体对齐,是核心难点。构建过程中,需应对动态变化的网络资源,每周需追踪并更新已失效的条目,保证数据时效性。此外,自动合并算法虽能处理多数情况,但已有24%的条目未能通过自动化置信度验证,需依赖人工审核,这一过程耗时费力。如何在平衡数据完整性与准确性的同时,维持每周高频发布,是当前乃至未来持续面临的技术与运维挑战。
常用场景
经典使用场景
作为动漫领域跨平台元数据融合的基石性资源,anime-offline-database数据集凭借其单一JSON文件架构与多源ID映射机制,在知识图谱构建、推荐系统研究与信息检索评测中占据核心地位。该数据集囊括了来自MyAnimeList、AniList等十余个主流动漫数据库的逾三万八千条条目,并借助审慎的实体对齐算法,将分布于异构数据源中的同一动漫实体予以关联,从而为跨平台数据互操作提供了统一的数据基准。研究者常以此为负样本集,训练实体解析模型,或直接将其作为查询接口,验证跨源信息检索的精准度,亦可用于构建动漫知识图谱中的节点与链接,支撑复杂关系推理的学术实验。
解决学术问题
该数据集直面动漫领域中长期存在的实体歧义与多源数据碎片化难题。在缺乏统一标识符的生态下,不同平台对同一部动漫的命名、分类及描述往往相异,致使跨平台数据整合与大规模计量分析举步维艰。通过累积的合并决策与置信度标注,该数据集为多源实体链路追踪提供了权威的“金标准”测试床,使得学者能够量化评估众包数据整合策略的精确率与召回率,并反哺实体解析算法的迭代。其意义在于,它不仅消解了动漫研究数据孤岛现象,还架构起连通学术模型与真实业务数据的桥梁,深刻影响了领域内对于数据质量及本体统一性的认知范式。
衍生相关工作
该数据集衍生了一系列经典工作,其维护方的迭代演进本身即为明证。上游manami-project归档后,modb-app以续承其管道并延续先前合并决策的方式持续交付,促成了数据集的断代重生。学者基于这些快照开展跨平台数据一致性分析、构建动漫领域预训练模型的语料、或者将实体对齐结果用于迁移学习中的任务锚点。此外,数据集严格遵循开放数据库许可协议,其社区生态滋养了多款小型开源库,如自动同步本地播放记录至跨站收藏的工具。这些工作或是对其数据质量的理论剖析,或为下游应用的深度赋能,共同编织出一个围绕动漫元数据场域的创新工作网络,持续拓展着数据集自身的学术与应用版图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务