遇见数据集

Anime Professions Dataset

收藏
github2026-07-25 更新2026-08-02 收录
官方服务:

资源简介:

该数据集包含约22,000部动漫中真实职业的出现情况,基于国际标准职业分类ISCO-08进行标注,并提供了每类职业的出现次数和按年代划分的趋势。

This dataset documents the occurrences of real-world occupations across approximately 22,000 anime works. All occupations are annotated in accordance with the International Standard Classification of Occupations 2008 (ISCO-08), and the dataset provides the occurrence counts for each occupational category as well as the chronological trends of these occupations.

创建时间:
2026-07-25
原始信息汇总

Anime Professions 数据集概览

Anime Professions 是一个扫描 21,988 部动画,统计各类现实职业在动画中被提及频率的数据项目。数据集以 ISCO-08(联合国/国际劳工组织标准职业分类)为基准,构建了职业分类体系,并生成了完整的职业提及查询表。

核心发现

  • 教师 是被提及最多的职业(约在 1,370 部动画中出现,占 7.6%),反映了动画以校园为背景的高频设定。
  • 2020 年代,店主超过教师成为提及最多的职业,这与异世界/日常系动画的兴起有关。
  • 若计入奇幻角色(如忍者、魔法师、冒险者、王室、武士等),王室(1,792 部)的出现频率超过所有现实职业。
  • 在约 150 个角色可能被提及的现实职业中,动画从未提及其中 17 个职业,包括金融分析师、系统分析师、驾校教练、印刷工、快餐店员工、船舶工程师等。
  • 部分小众职业的具体提及次数:软件开发者 41 次、保险代理人 18 次(如《Trigun》主角即为保险代理人)、药剂师 15 次、有轨电车/公交车司机 5 次。

数据构建方法

数据检测采用三层文本来源:

  1. 剧情简介与主角:通过 AniList 获取每部动画的剧情摘要。
  2. 配角角色:AniList 角色简介,附带角色定位字段,确保仅出现数集的医生等角色也能被统计。
  3. 对话台词:约 128,000 个日语字幕文件,捕捉仅在对白中提及的职业。

检测流程为两阶段管线:

  • 第一阶段(高召回):使用关键词词典(英语+日语表面对应 ISCO 代码)进行广泛匹配,容忍误报。
  • 第二阶段(高精度):由 LLM(Claude Haiku)结合上下文判断每个模糊候选句,排除否定表述、假设语气、一词多义(如“officer”“band”)以及奇幻同形词(如机甲“驾驶员”不属于航空飞行员)等干扰。

另用更强模型(Claude Opus)对确认命中的分层样本进行精度评估,并以 AniList 标签作为召回率基准。精度低于阈值的数据会被标记为 不可靠(unreliable),而非直接当作事实发布。

数据使用注意事项

  • 统计的是“被提及”而非“被展示”。屏幕中出现但未在文本中标注的职业无法被检测到。
  • 约四分之一职业被标记为不可靠(如“飞机飞行员”多为机甲驾驶员),相关计数应视为上限值。
  • 计数默认按 系列(franchise) 去重(如《名侦探柯南》约 28 部剧场版计为 1),但每部作品保留独立记录,可自行展开或折叠。
  • 每个百分比旁标注了计算分母(约 18,127 部有可扫描文本的作品)。

数据来源与版权说明

  • 动画元数据、标题、角色简介、标签:AniList(GraphQL API)
  • 职业分类体系:ISCO-08(国际劳工组织)
  • 对话文本:社区镜像的日语动画字幕档案

项目仅导出统计数据和定位信息,不存储或转发任何字幕原文、原始 AniList 描述,属非商业粉丝项目。

交互工具

  • 在线探索器:https://elmiram.github.io/anime-professions/ ,可搜索任意职业,查看相关动画及年代趋势。
  • 演示文稿:https://elmiram.github.io/anime-professions/anime-professions-deck.pdf (12 页 PDF)

导出数据

数据集包含三个 CSV 文件:occupation_counts.csv(各职业统计计数)、title_occupation.csv(动画-职业对应关系)、evidence.csv(证据样本)。

搜集汇总
数据集介绍
Anime Professions Dataset 数据集图片
构建方式
该数据集构建于对21,988部日本动画的全面扫描,以国际劳工组织制定的ISCO-08职业分类体系为基准,从436个官方职业代码中筛选出约150个在叙事中可能被明确指称的‘可呈现’职业。数据采集采用三层文本检测:动画剧情摘要、角色简介以及约128,000份日文字幕文件,确保对职业提及的广泛覆盖。检测流程分为两个阶段:第一阶段利用英语和日语的关键词词表进行高召回率筛选,第二阶段则通过Claude Haiku大语言模型对每个有歧义的候选句进行上下文判断,以排除否定、假设、一词多义以及奇幻职业同形词的干扰。此外,借助Claude Opus对确认结果进行分层抽样评估,估算各职业的精确率,并利用AniList标签提供召回率基准。整个流程以命令行工具形式分步执行,支持断点续跑,最终输出职业计数、年代趋势及精确率/召回率估计,生成三个CSV文件。
特点
该数据集的独特之处在于其严谨的方法论与对‘缺席’的深刻洞察。首先,它严格区分真实职业与奇幻角色(如忍者、魔法师),避免混淆统计。其次,数据集的核心发现并非高频职业,而是一份‘从未被提及’的清单——在150个可呈现职业中,有17个在数百万行对话中从未出现,包括金融分析师、系统分析师、驾校教练等,这些‘沉默’职业揭示了动画叙事的偏好与盲区。此外,数据集提供了按十年分段的趋势分析,揭示职业提及的演变,例如2020年代店主超越教师成为最常提及的职业。每项计数均附带精确率/召回率评估,并标记不可靠数据,确保解读的科学性。所有统计均以系列为默认去重单位,并提供原始条目以便灵活聚合,为文化研究提供了量化基础。
使用方法
用户可通过多种方式使用该数据集。交互式探索网站(https://elmiram.github.io/anime-professions/)允许搜索任意职业,查看相关动画及年代趋势,并附有12页的PDF演示文稿。若需本地运行,可执行`python ap.py web`启动本地服务器,或使用`python ap.py export-static`生成静态站点。对于深度分析,用户可自行运行完整流水线:按README指引安装依赖、配置Anthropic API密钥,依次执行`collect`、`franchise`、`extract`、`estimate`、`adjudicate`、`measure`、`analyse`和`export`等命令,即可从原始数据到最终CSV的完整复现。可选的字幕层(Layer C)提供额外命令以增强对话检测。所有输出CSV可供数据科学家直接用于统计或可视化,而代码库的模块化设计便于用户定制职业分类或检测逻辑。
背景与挑战
背景概述
动漫作为全球流行文化的重要载体,不仅映射社会现实,也潜移默化地塑造公众对职业的认知。然而,鲜有研究系统量化动漫中的职业呈现。Anime Professions Dataset 于近年由独立研究者创建,依托 AniList 的元数据与字幕档案,对 21,988 部动漫作品进行大规模文本分析,并依据国际劳工组织 ISCO-08 职业分类标准,构建了动漫职业出现的全量检索表。该数据集的核心研究问题在于揭示动漫中真实职业的呈现规律与缺失图谱,其首要发现是动漫中从未提及的 17 种职业(如金融分析师、快餐店员等),深刻反映了动漫叙事对服务性与事务性职业的系统性忽视。该数据集为媒介研究、社会学及职业心理学提供了独特的量化视角,其公开的交互式探索工具与可视化报告亦推动了数据驱动的文化研究。
当前挑战
该数据集构建面临多重挑战。领域层面,动漫作为虚构叙事载体,其职业呈现与真实世界存在偏差,如奇幻职业(忍者、魔法师)与真实职业混杂,需严格分层;同时,'命名即呈现'的检测方法难以捕捉仅视觉出现但未提及的职业,导致无法检测服务性岗位。技术层面,职业名称的多义性(如'pilot'既可指飞行员也可指机甲驾驶员)和否定、假设等语境修饰易造成误判,虽引入 LLM 进行上下文裁决,但仍有约四分之一职业的准确性被标记为不可靠。数据层面,对话语料源自社区字幕库,涉及版权问题,仅能提取计数与定位信息,无法存储原文;此外,不同来源的数据(AniList 描述、字幕)在语言、时态上差异巨大,增加了跨语种关键词匹配的复杂度。构建过程中,需在召回率与精确率间取得平衡,同时兼顾大规模批处理(超十万次 LLM 判断)的经济性与可复现性。
常用场景
经典使用场景
Anime Professions Dataset以其对21,988部动画作品职业描绘的系统性梳理,开创了流行文化文本量化分析的新范式。研究者可借助该数据集,利用ISCO-08职业分类体系对动画文本进行词频统计与语义消歧,进而构建跨时空的职业呈现图谱。其层次化检测管线(关键词召回与LLM精判相结合)为文本社会学的计算研究提供了可复现的方法论模板,尤其适用于考察职业称谓在虚构叙事中的可见性异质性,为文化表征研究确立了基于证据的实证路径。
解决学术问题
该数据集直面虚构文本中职业表征的隐形不平等这一长期困扰文化研究者的难题。通过将动画对白、角色简介与剧情摘要纳入统一分析框架,其揭示出财务分析师、系统分析师等后台职业在主流叙事中的系统性缺席,将零散的文化评论转化为可检验的统计事实。这种将劳工社会学与计算语言学交叉融合的数据建构,不仅填补了媒介研究中职业声望量化评估的空白,更为探讨社会分工在流行文化中的选择性再现提供了严谨的学术基准,推动了从印象式批评向数据驱动式论证的范式转型。
衍生相关工作
该数据集所催生的学术衍生工作已初现端倪,诸如基于其职业计数矩阵开展的叙事类型学比较研究,借用其揭示的缺席清单探索媒介内容与真实劳动力市场之间的结构性对话,以及利用其多年份数据描绘职业声望在流行文化板块中的迁移轨迹。其构建的幻想职业与真实职业分离的分析框架,亦启发了对奇幻叙事中社会阶层的量化考古,进而将动漫研究推入具备可重复性与跨学科黏性的计算社会科学领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务