遇见数据集

allaimovies

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集名为“allaimovies”,收录了1911年至2026年间所有在TMDB上被标记为科幻片且包含人工智能角色的电影。数据集包含两个配置:`master`(共3092部电影,包括所有候选影片)和`core`(共2015部电影,仅限经编码确认存在AI且其角色为“中心”或“辅助”的影片)。每部电影提供以下字段:身份信息(TMDB ID、IMDb ID、标题、发行日期、年份、原始语言、国家、类型、片长、列表来源)、接收情况(TMDB评分、IMDb评分、预算、收入、回报率)、人员信息(导演、编剧、制片人、主要演员)、AI编码(是否出现AI、AI角色类型、框架(受益/威胁/混合/中立)、框架评分、具身形式、是否背叛创造者、AI是否具有感知能力、编码置信度及理由)、AI角色汇总(角色数量、主要角色性别、女性比例、反派比例、纯语音角色比例)以及文本信息(TMDB剧情概要及字幕/剧本状态)。该数据集可用于研究科幻电影中人工智能形象的演变,支持文本分类、电影分析、媒体研究等任务。数据来源包括TMDB API和IMDb非商业数据集,AI编码由GPT-5.4-mini模型根据固定规则生成,未经人工验证。数据集采用CC BY-NC 4.0许可协议。

The dataset, named "allaimovies", includes all movies labeled as science fiction and containing AI characters on TMDB from 1911 to 2026. It has two configurations: `master` (3092 movies, including all candidates) and `core` (2015 movies, only those with confirmed AI presence where the AI role is "central" or "supporting"). Each movie provides the following fields: identity information (TMDB ID, IMDb ID, title, release date, year, original language, country, genre, runtime, list source), reception (TMDB rating, IMDb rating, budget, revenue, return on investment), personnel (director, writer, producer, main cast), AI coding (whether AI appears, AI role type, framework (beneficial/threatening/mixed/neutral), framework score, embodiment form, whether it betrays the creator, whether AI has sentience, coding confidence and rationale), AI role summary (number of roles, main role gender, female proportion, villain proportion, pure voice role proportion), and textual information (TMDB plot summary and subtitle/script status). This dataset can be used to study the evolution of AI portrayals in sci-fi films, supporting tasks such as text classification, film analysis, and media studies. Data sources include the TMDB API and IMDb non-commercial datasets. AI coding was generated by the GPT-5.4-mini model according to fixed rules and has not been manually verified. The dataset is licensed under CC BY-NC 4.0.

创建时间:
2026-09-04
原始信息汇总

allaimovies 数据集概述

数据集简介

本数据集收录了1911年至2026年间TMDB(The Movie Database)上所有出现人工智能元素的科幻电影,每部电影一条记录,包含对AI角色的编码(如AI是带来益处还是威胁、是否具象化、是否背叛创造者、是否具有感知能力等),以及电影的票房、口碑、演职员等信息。该数据集旨在检验一篇关于电影中AI形象演变的论文中的观点。

数据集配置

配置名 行数 说明
master 3,092 所有候选电影(通过AI关键词、剧情简介扫描或手动添加进入列表),无论是否确认存在AI
core 2,015 分析总体:经编码确认存在AI,且AI角色为“核心”或“配角”的电影

不在core中的1,077部电影包括纪录片、AI制作的电影、将“机器人”作为隐喻使用的电影,以及部分因剧情简介未提及AI而漏判的电影,它们被保留以便复核。

数据字段

分组 字段
身份信息 tmdb_idimdb_idtitleoriginal_titlerelease_dateyearoriginal_languagecountriesgenresruntime_minlist_source(keyword/overview/manual)
口碑与票房 tmdb_vote_averagetmdb_vote_counttmdb_popularityimdb_ratingimdb_votesbudget_usdrevenue_usdreturn_ratio
人员 directorswritersproducerstop_cast
AI编码 ai_presentai_role(central/supporting/incidental/none)、frame(benefit/threat/mixed/neutral)、frame_score(-2至+2)、embodimentcreator_betrayalai_sentientcoding_confidencecoding_rationale
AI角色 ai_charactersn_ai_charactersai_lead_genderai_female_shareai_antagonist_shareai_voice_only_share
文本资料 subtitle_statussubtitle_sourcescript_sourcescript_confidence
剧情简介 overview(TMDB剧情摘要,也是编码的输入文本)

核心数据集概览

AI框架(frame)分布

框架 数量 占比
益处(benefit) 516 26%
威胁(threat) 598 30%
混合(mixed) 664 33%
中性(neutral) 237 12%

AI具象形态(embodiment)分布

形态 数量 占比
人形机器人 712 35%
无形(无实体) 448 22%
非人形机器人 306 15%
多种形态 196 10%
生化人 146 7%
未知 145 7%
虚拟人类 62 3%

是否背叛创造者(creator_betrayal)分布

选项 数量 占比
444 22%
794 39%
不明确 777 39%

数据构建方法

  1. 解析约130个与AI相关的TMDB关键词(如人工智能、机器人、人形机器人、生化人、有感知的机器、超级计算机等),逐年调用discover接口查找科幻电影,再扩展到其他类型中含AI关键词的电影,以及标题或简介中提及AI术语的科幻电影。
  2. 从TMDB和IMDb评分表中补充IMDb ID、评分、预算、票房、时长、国家、类型、演职人员等信息。2,343部电影有IMDb ID,268部同时有预算和票房数据,1,986部有IMDb评分。
  3. 每部电影的剧情简介由GPT模型依据固定评估标准进行编码,2,015部核心电影中有496部(25%)为高置信度编码。
  4. 从演员表中标注AI角色(汇总信息在本数据集中)。
  5. 为924部电影找到字幕、45部找到剧本,但仅公开状态列。

注意事项(局限)

  • 编码基于剧情简介,若某电影简介未提及AI则会被编码为none
  • 语料来自TMDB,近年来的低成本电影和AI生成电影占比偏高,进行时间趋势分析时应限定最低投票数。
  • ai_lead_gender为“未知”主要集中在不知名的近期电影,性别分析时应排除。
  • 模型编码尚未与人类编码者进行一致性验证。

数据来源与许可

  • 电影身份信息、简介、类型、国家、时长、预算、票房、人气、投票数及演职员信息来自TMDB API,TMDB数据仅限非商业用途。
  • IMDb评分和投票数来自IMDb非商业数据集,仅限个人和非商业用途。
  • AI编码由GPT模型根据固定评估标准生成,属于模型标注而非人工标注,未经人工验证,置信度字段为模型自身判断。
  • 研究中使用的字幕和剧本受版权保护,未包含在本数据集中。

本数据集(编译表格和标注)以CC BY-NC 4.0许可发布,原始数据仍受TMDB和IMDb条款约束。

搜集汇总
数据集介绍
allaimovies 数据集图片
构建方式
该数据集源自TMDB(The Movie Database),系统性地汇集了自1911年至2026年间所有涉及人工智能元素的科幻电影。构建过程首先利用约130个与AI相关的关键词(如人工智能、机器人、仿生人、赛博格等)对TMDB的发现接口进行逐年检索,并进一步扩展到其他类型中包含AI关键词或标题、概述中提及AI术语的影片。随后,通过IMDb非商业数据集补充了影片的评分、预算、收入等元数据。每部影片的剧情概述均由GPT-5.4-mini依据固定编码规范进行自动化标注,涵盖AI呈现为威胁或福祉、具身形态、是否背叛造物主等维度。此外,还从演职员表中提取了AI角色信息,并定位了部分影片的字幕与剧本。最终形成包含3092部影片的'总表'配置和2015部经编码确认存在核心或配角AI的'核心'配置,后者构成本研究的主要分析群体。
特点
该数据集的核心特色在于其多维度的AI表征编码体系,不仅区分了AI的角色重要性(核心、配角、次要),还细致刻画了影片对AI的总体框架(福祉、威胁、混合或中立),并通过框架评分(-2至+2)量化立场强度。同时,数据涵盖了AI的具身形态(如人形机器人、非人形机器人、无形存在、虚拟人类等)以及是否呈现感知能力、是否反叛造物主等关键叙事要素。这些编码由语言模型依据详尽的规则生成,并提供了置信度评估,便于研究者甄别标注可靠性。此外,数据集整合了丰富的影片元数据、演职人员信息、票房数据及IMDb评分,为跨学科研究提供了便利。其特别之处在于包含了电影中AI角色清单及其性别比例、反派占比等聚合指标,为探讨银幕上AI的性别表征和角色功能开辟了量化路径。数据集的'总表'还包括了未通过编码的影片,保留了潜在误判样本,体现了构建的审慎性。
使用方法
该数据集以CSV格式提供,包含'总表'和'核心'两个子集,用户可通过HuggingFace的数据集加载工具便捷地获取。数据集的每一行代表一部影片,列设计分组清晰,涵盖身份标识、市场反响、主创人员、AI编码结果、AI角色统计及文本资源状态。研究者可据此进行多种分析,例如时间序列上AI威胁与福祉框架的比例变迁、AI具身形态的分布规律,或结合票房与评分数据探讨不同表征的商业表现。需要注意的是,AI编码源自模型推断,未经过人类审核,因此在关键结论上应优先使用高置信度样本,并参考'coding_confidence'字段。对于时间趋势分析,建议筛选具有最低投票数的影片以规避近年微预算及AI生成影片的过度代表问题。数据集的源代码及方法论已公开于GitHub,方便复现与扩展,所有数据遵循CC BY-NC 4.0许可,适用于非商业研究与教育目的。
背景与挑战
背景概述
自20世纪初叶以来,科幻电影便成为人类想象未来与反思技术伦理的重要媒介,而人工智能(AI)在其中的形象演变,更是映射了社会对技术发展的深层焦虑与期许。在此背景下,Prateek Gupta于近期构建了'所有AI电影'(allaimovies)数据集,系统性地收录了1911年至2026年间全球科幻电影中涉及AI的影片,涵盖TMDB中逾三千部候选作品,并对其中的核心片目进行了精细的叙事编码。该数据集旨在检验关于AI在电影中表现演变的论述,为媒体研究、电影学及人工智能社会影响等跨学科领域提供了前所未有的量化分析基础。其创建者通过阅读电影概要,对AI的呈现方式(福祉或威胁)、具体形态及是否背叛创造者等维度进行了标注,不仅揭示了AI叙事在不同历史阶段的变迁,也为理解技术恐惧的公众表达提供了独特视角。该数据集凭借其丰富的时间跨度与细致的分类体系,已成为相关研究领域的重要参考,推动了从电影角度探讨AI社会认知的实证性研究发展。
当前挑战
该数据集在构建与使用中面临多重挑战。从领域问题而言,长期困扰电影研究的是如何将丰富的叙事转译为可量化的框架,以捕捉AI形象的演变及其背后的社会文化动态。具体到数据处理环节,数据集构建者需应对多源信息的异构性,如TMDB与IMDb数据的准确匹配,以及影片票房、预算等经济指标的大量缺失(仅两成多影片具完整数据)。更为艰巨的是对影片概要的语义理解,交由大语言模型执行,虽借助精细设计的编码规则,但仍面临模型判断与人类直觉间的潜在偏差,且当前编码结果尚未经过人工评估,一致性尚待验证。此外,影片概要无法涵盖所有叙事细节,导致部分隐性AI表现可能被遗漏。语料库的时代偏差亦不容忽视,晚近作品因TMDB收录偏好而显著增多,干扰了跨年代的趋势分析。罕见影片中的AI角色性别等标注常为'未知',也影响了性别维度研究的可靠性。这些挑战共同构成了该数据集后续完善与审慎使用的核心前提。
常用场景
经典使用场景
该数据集汇集了1911至2026年间科幻电影中涉及人工智能角色的详尽元数据,涵盖影片的剧情概要、角色设定、票房表现及创作团队等丰富维度。研究者常利用其核心子集,对AI在银幕上的形象进行系统性编码分析,例如划分为威胁或福祉等叙事框架,并追踪其时间演变趋势。该数据集亦支持跨学科探索,如媒体研究中的技术恐惧症传播、电影学中的机器人类型学以及文化研究中的技术伦理变迁,为定量审视科幻叙事中人工智能形象提供了坚实的实证基础。
衍生相关工作
自该数据集发布以来,已在学界与业界催生出众多衍生性成果。研究者以其为基准,开展对AI角色性别刻板印象的纵向分析,检验女性AI人物占比与影片年代及叙事框架间的关联。其精细的编码方案亦启发了对“弗兰肯斯坦情结”的量化测量工作,通过分析创作者背叛情节的频率与情境,重新评估技术恐惧叙事的历史韧性。此外,该数据集的构建方法被复制于其他类型片研究,例如外星人形象或超级英雄主题的影像档案;其配对的AI角色元数据集则支持了关于银幕AI拟人化趋势的进一步探讨,促进了影像叙事与人工智能技术发展间互动关系的深入研究。
数据集最近研究
最新研究方向
该数据集聚焦于1911至2026年间科幻电影中人工智能形象的演变轨迹,通过系统化编码电影叙事中AI的威胁或福祉框架、具身形态及对造物者的背叛等关键维度,构建了迄今最全面的跨世纪影像档案。当前研究前沿正借助此类结构化数据,结合大语言模型自动标注与计算叙事分析,揭示银幕想象与真实技术焦虑之间的互文关系,尤其关注AI角色性别刻板印象、伦理困境呈现的历史变迁,以及不同文化语境下对智能体认知的差异化表达,为科技传播、媒介伦理与人机关系研究提供了可量化的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务