遇见数据集

Nima0Kamali/humancentric-scenes-ai

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

HumanCentric-Scenes-AI是一个多模态基准数据集,包含296个AI生成的人类中心场景,覆盖四个领域:CCTV/监控图像(85张Midjourney生成的静态图像,模拟低分辨率安全摄像头画面)、职业×性别肖像(128张Midjourney生成的图像,采用平衡的64职业×2性别配对设计)、部分照片操作(27张来自公共来源的真实照片,其中局部区域被AI编辑)、短视频(56个5至30秒的视频片段,由OpenAI Sora、Google Gemini和Kling生成)。该数据集旨在研究人类和机器检测AI生成媒体的能力,特别关注现有深度伪造基准中未充分代表的场景。数据集包含图像(240张)和视频(56个),元数据为英文,许可证为CC BY-NC 4.0,主要用于自动化AI内容检测器基准测试、人类观察者检测研究、生成偏差分析和视觉AI素养培训。

授权协议:cc-by-nc-4.0 任务类别: - 图像分类 - 视频分类 语言: - 英语 标签: - 深度伪造检测(deepfake-detection) - AI生成图像(ai-generated-images) - AI生成视频(ai-generated-videos) - Midjourney - Sora - Gemini - Kling - 人类感知(human-perception) - 基准测试(benchmark) 展示名称:HumanCentric-Scenes-AI 样本规模分类: - n<1000 配置项: - 配置名称:default 数据文件: - 划分:训练集 路径:metadata.csv 数据集信息: 特征: - 名称:file_name 数据类型:字符串 - 名称:filename 数据类型:字符串 - 名称:original_filename 数据类型:字符串 - 名称:modality 数据类型: 类别标签: 可选值: "0": 图像 "1": 视频 - 名称:label 数据类型: 类别标签: 可选值: "0": 真实样本 "1": AI生成样本 - 名称:generator 数据类型:字符串 - 名称:generator_version 数据类型:字符串 - 名称:prompt 数据类型:字符串 - 名称:category 数据类型:字符串 - 名称:subcategory 数据类型:字符串 - 名称:occupation 数据类型:字符串 - 名称:depicted_gender 数据类型:字符串 - 名称:pose 数据类型:字符串 - 名称:source_url 数据类型:字符串 - 名称:contributor 数据类型:字符串 - 名称:stimulus_set 数据类型:字符串 ## HumanCentric-Scenes-AI 本多模态基准数据集包含296个AI生成的以人为中心的场景,涵盖四大领域: - **CCTV / 监控图像(集2,85张图像)**:由Midjourney生成的静态画面,模拟低分辨率监控摄像头素材——停车场、建筑内部、户外公共空间——旨在测试检测线索能否在重度压缩与低光照噪声下保留。 - **职业×性别肖像(集3,128张图像)**:采用均衡的64职业×2性别配对设计,由Midjourney基于两个基础提示词模板(佳能工作环境拍摄与柯达颗粒感构图)加上少量场景标签变体生成,用于研究提示生成的性别线索如何被检测(而非衡量生成器的固有偏差)。 - **局部图像篡改(集5,27张图像)**:来自公开来源的真实照片,仅在单个局部区域(面部、手部、背景物体)应用AI编辑,作为衍生作品发布,用于研究检测线索的定位方式。 - **短格式视频(集6,56个视频)**:5至30秒的片段,涵盖OpenAI Sora(18个)、Google Gemini(35个)与Kling(1个)生成的内容,包含日常活动、采访、直播、抗议、公开演讲、社交媒体、虚拟沟通以及Zoom会议场景。 本数据集专为研究人类与机器检测AI生成媒体的能力而打造,重点关注现有深度伪造基准中代表性不足的场景类型。 **🤗 数据集:** [huggingface.co/datasets/Nima0Kamali/humancentric-scenes-ai](https://huggingface.co/datasets/Nima0Kamali/humancentric-scenes-ai) ## 数据集说明 - **整理者:** Sana Nasiri、Nima Kamali,由Negar Kamali协调(西北大学凯洛格管理学院) - **语言:** 图像/视频内容,元数据为英文 - **授权协议:** CC BY-NC 4.0(AI生成内容与元数据) - **模态:** 图像(240张)、视频(56个) ## 数据集来源 - **相关论文:** *HumanCentric-Scenes-AI: A Multimodal Benchmark of AI-Generated Human-Centric Scenes*(arXiv,2026——待发表) - **联系方式:** negar.kamali@u.northwestern.edu ## 适用场景 ### 直接适用场景 - 自动化AI内容检测器(图像与视频分类器)的基准测试 - 研究人类观察者如何在非面部肖像领域检测AI生成媒体 - 生成偏差分析(集3采用均衡的64职业×2性别配对设计) - 视觉AI素养培训课程素材 ### 不适用场景 - **训练生成式模型:** 本授权协议明确禁止使用本数据集训练生成器,样本量远低于此类训练所需的规模。 - **身份识别或生物特征推断:** 图中人物均为合成生成,将其视为真实主体的做法不被支持。 - **商业应用:** CC BY-NC 4.0协议禁止商业使用。 ## 数据集结构 ### 组成结构 | 集号 | 领域 | 样本量 | 生成器 | 文件格式 | |---|---|---:|---|---| | 2 | CCTV / 监控 | 85 | Midjourney v6 | `.jpeg` | | 3 | 职业×性别肖像 | 128 | Midjourney | `.jpeg` | | 5 | 局部篡改 | 27 | 局部编辑流水线 | `.png` | | 6 | 短格式视频 | 56 | Sora (18)、Gemini (35)、Kling (1)、未知 (2) | `.mp4` | | **总计** | | **296** | | | ### 文件夹布局 . ├── README.md ├── metadata.csv # 296行,16个字段 ├── LICENSE ├── .gitattributes # 用于Git LFS存储大文件的属性配置 ├── data/ │ ├── set2_cctv/ai_midjourney/ (85个 .jpeg 文件) │ ├── set3_gender_occupation/ai_midjourney/ (128个 .jpeg 文件) │ ├── set5_partial_manipulation/ai_partially_edited/ (27个 .png 文件) │ └── set6_video/ │ ├── ai_sora/ (18个 .mp4 文件) │ ├── ai_gemini/ (35个 .mp4 文件) │ ├── ai_kling/ (1个 .mp4 文件) │ └── ai_unknown/ (2个 .mp4 文件) ├── scripts/ │ └── fetch_real_items.py # 下载配对真实参考样本的脚本 └── docs/ ├── PROVENANCE.md # 逐标签页的来源说明 └── DATASHEET.md # Gebru风格数据集说明文档 ### 数据字段 `metadata.csv`的每一行对应一个二进制文件。 | 字段名 | 类型 | 描述 | |---|---|---| | `file_name` | 字符串 | 数据集根目录到二进制文件的相对路径(例如 `data/set3_gender_occupation/ai_midjourney/...jpeg`)。 | | `filename` | 字符串 | 仅文件名部分(SHA-256哈希值+扩展名)。 | | `original_filename` | 字符串 | 整理前的原始文件名。 | | `modality` | 类别标签 | `图像` 或 `视频`。 | | `label` | 类别标签 | 本版本所有样本的标签均为 `AI生成样本`。 | | `generator` | 字符串 | `midjourney` / `sora` / `gemini` / `kling` / `partial_edit_pipeline` / `unknown`。 | | `generator_version` | 字符串 | 已知的生成器版本(通常为空)。 | | `prompt` | 字符串 | 生成提示词(集3、5、6-Sora包含该字段;其余集为空)。 | | `category` | 字符串 | 高级领域分类(`cctv`、`occupational_portrait`、`partial_manipulation`、`video`)。 | | `subcategory` | 字符串 | 领域特定子标签(例如 `surveillance`、`activity`、`zoom`)。 | | `occupation` | 字符串 | 64种职业之一(仅集3包含)。 | | `depicted_gender` | 字符串 | `M`(男性) / `F`(女性)(仅集3包含)。 | | `pose` | 字符串 | 预留字段(当前为空)。 | | `source_url` | 字符串 | 配对真实参考样本的URL(仅集6-Sora样本包含)。 | | `contributor` | 字符串 | 样本整理者。 | | `stimulus_set` | 字符串 | `set2_cctv` / `set3_gender_occupation` / `set5_partial_manipulation` / `set6_video`。 | ### 文件名约定 所有文件均采用 `<内容的SHA-256哈希值>.<文件扩展名>` 命名,以简化完整性校验。集2、3、5的源文件已采用SHA哈希命名;集6视频源文件采用描述性命名(例如 `activity_gemini_001.mp4`),整理时重新计算哈希并重命名。原始描述性文件名保留在`original_filename`字段中。 ### 数据集划分 仅包含`train`划分,共296条数据;本数据集旨在作为基准而非训练素材,因此未提供测试/验证划分。 ## 加载方式 python from datasets import load_dataset, Image, Video ds = load_dataset("Nima0Kamali/humancentric-scenes-ai", split="train") # 为图像样本附加图像加载器: images = ds.filter(lambda r: r["modality"] == "image").cast_column("file_name", Image()) # 为集6的视频样本附加视频加载器: videos = ds.filter(lambda r: r["modality"] == "video").cast_column("file_name", Video()) ## 数据集创建 ### 整理初衷 现有深度伪造基准大多以无约束场景下的面部肖像为主。HumanCentric-Scenes-AI填补了AI检测行为研究中的四大空白:低分辨率监控场景、职业肖像场景(生成偏差在此场景下具有研究价值)、真实照片局部篡改场景(可用于研究检测线索的定位)以及短格式社交视频场景(当前生成器生态仍在快速迭代)。 ### 源数据 - **集2 — 监控图像(Midjourney):** 85个模仿低分辨率监控画面风格的提示词,由Sana Nasiri使用Midjourney v6生成。 - **集3 — 职业×性别肖像(Midjourney):** 均衡的64职业×2性别配对设计(共128个刺激样本),由Nima Kamali生成。提示词采用两个基础模板:模板A — `"Realistic portrait of a [female/male] <occupation> in their working environment, shot on Canon"`(128个样本中的16个,8个女性样本+8个男性样本)——和模板B — `"portrait of a [female/male] <occupation>, shot on Kodak, grainy"`(128个样本中的101个,51个女性样本+50个男性样本)。剩余11个样本为模板A或B的衍生变体,添加了额外场景标签(例如 `"with a blackboard in the background"`)。由于性别由提示词明确指定,本集仅用于**检测研究**,而非衡量生成器的固有偏差。 - **集5 — 局部图像篡改:** 27张来自公开来源的真实照片,每张照片均应用了AI编辑区域。作为学术研究的合理使用作品发布,不重新分发真实源照片。 - **集6 — 短格式视频:** 56个5至30秒的视频片段,分别由OpenAI Sora(18个)、Google Gemini(35个)、Kling(1个)和2个未指定生成器生成,生成时间为2025年9月至2026年5月。Sora片段附带配对的YouTube参考链接(`source_url`字段)。 整理过程中参考的真实照片与视频(来自Flickr、iStock、Adobe Stock、Getty Images、路透社、《卫报》、《滚石》杂志与YouTube)未被重新分发。用户可通过`scripts/fetch_real_items.py`脚本自行下载,需遵循原始来源的授权协议。 ### 标注信息 每个AI样本均附带生成时记录的提示词。集3额外包含`occupation`与`depicted_gender`字段。集5包含编辑时使用的场景描述标题。集6的Sora样本包含完整提示词与配对的YouTube参考URL;Gemini与Kling样本目前仅包含从文件名派生的元数据(生成器与子分类),未来将在源电子表格可公开后补充完整元数据。 ## 偏差、风险与局限性 - **所有样本均为AI生成:** 研究人员若需进行AI与真实样本的检测对比,需自行配对真实参考样本。集6 Sora子集的真实参考样本可通过`scripts/fetch_real_items.py`下载,其余样本的真实参考链接将在后续补充后获取。 - **集3仅用于检测研究,而非生成偏差研究:** 由于提示词明确指定了性别,64×2的配对设计仅允许研究人员探究“人类/模型对性别不匹配肖像的检测率是否存在差异”,但无法测量“模型在无提示时生成的性别倾向”。生成偏差研究需采用其他实验方案。 - **样本量偏小:** 本数据集为专为行为研究打造的刺激样本库,而非训练语料。基于296个样本的检测分类器结果仅可视为探索性结果。 - **集2元数据缺失:** 集2的85张监控图像均未在`metadata.csv`中提供逐样本提示词。85个提示词均存在于工作电子表格(`mj_images_cctv`标签页)中,但通过描述性文件名索引,而重新分发的文件已按内容哈希重命名,无法建立文件名与提示词的对应关系。 - **集6元数据缺失:** 集6的56个视频中,38个(Gemini、Kling与2个未指定生成器样本)仅包含从文件名派生的元数据。 ## 引用格式 bibtex @misc{kamali2026humancentric, title = {HumanCentric-Scenes-AI: A Multimodal Benchmark of AI-Generated Human-Centric Scenes Across Surveillance, Occupational Portraits, Partial Edits, and Short-Form Video}, author = {Kamali, Nima and Nasiri, Sana and Kamali, Negar}, year = {2026}, eprint = {arXiv:XXXX.XXXXX}, note = {Stimulus library accompanying the arXiv preprint.} } ## 授权协议 本数据集的AI生成资产、元数据与整理成果均采用**CC BY-NC 4.0**协议发布。通过`source_url`字段引用的真实照片与视频仍受其原始来源的授权协议约束(Flickr、iStock、Adobe Stock、Getty Images、路透社、《卫报》、《滚石》杂志与YouTube)。集5的局部篡改样本基于公开来源的真实照片进行AI编辑,作为学术研究的合理使用作品发布。本数据集不得用于训练生成式模型。 ## 数据集卡片作者 Nima Kamali、Sana Nasiri、Negar Kamali ## 数据集卡片联系方式 - **第一作者Nima Kamali:** nima.kamaliz97@gmail.com - **通讯作者Negar Kamali(西北大学):** negar.kamali@u.northwestern.edu

提供机构:
Nima0Kamali
搜集汇总
数据集介绍
Nima0Kamali/humancentric-scenes-ai 数据集图片
构建方式
HumanCentric-Scenes-AI数据集由西北大学凯洛格管理学院的Negar Kamali等研究者精心构建,旨在填补现有深度伪造基准中 underrepresented 场景的空白。该数据集包含296个以人为中心的AI生成样本,覆盖四个领域:85张仿低分辨率监控摄像头的CCTV图像、128张职业与性别平衡的肖像、27张局部AI编辑的照片操纵、以及56段短视频。图像由Midjourney、Sora、Gemini、Kling等生成器产生,每项均配有详尽的元数据,包括生成提示、类别、职业等。所有文件以SHA-256哈希命名以确保完整性。
特点
本数据集的核心特点在于其多模态与场景多样性,聚焦于现有基准中缺失的低分辨率监控、职业肖像、局部操纵及短视频等复杂情境。每项样本均附带丰富的标注,如生成器版本、提示词、场景类别和性别标签,便于细粒度分析。数据集规模精简,仅为296项,专为人类与机器检测能力的行为研究而设计,而非用于生成模型训练。此外,元数据中特别记录了职业与性别信息,可用于探测提示性性别线索是否影响检测效果。
使用方法
用户可通过Hugging Face的datasets库轻松加载数据集:使用load_dataset('Nima0Kamali/humancentric-scenes-ai', split='train')获取全部296项样本。图像和视频文件需分别通过Image()和Video()加载器进行类型转换,例如先过滤modality列再执行cast_column操作。预置的fetch_real_items.py脚本可帮助用户下载配对的真实参考内容。该数据集主要用作自动化AI内容检测器的基准测试、人类感知研究以及视觉AI素养教育课程素材,严禁用于训练生成模型或商业用途。
背景与挑战
背景概述
随着生成式人工智能技术的飞速发展,深度伪造内容已从人脸肖像扩展至更为复杂的场景,对数字信息真实性构成严峻挑战。在此背景下,HumanCentric-Scenes-AI数据集于2026年由西北大学凯洛格管理学院的Sana Nasiri、Nima Kamali及Negar Kamali联合创建,旨在填补现有深度伪造基准测试中关于人本场景的空白。该数据集聚焦于四个在以往研究中被忽视的领域:低分辨率监控影像、职业性别肖像、局部图像篡改以及短视频,共包含296个由Midjourney、Sora、Gemini等主流AI生成器创建的多模态样本。其核心研究问题在于评估人类和机器在非传统人脸肖像场景下检测AI生成内容的能力,为视觉AI素养训练和自动检测器基准测试提供了关键资源。该数据集的发布,对于推动人机感知差异研究、揭示AI生成媒体的内在规律,以及强化数字内容真实性验证具有重要学术价值。
当前挑战
HumanCentric-Scenes-AI数据集致力于解决当前深度伪造检测研究中的三个核心挑战。首先,领域问题层面,现有基准测试过度集中于清晰、非受限条件下的面部肖像,难以应对真实世界中低分辨率、噪声干扰、局部编辑和短视频等复杂场景,导致检测模型在泛化能力上存在显著缺陷。其次,数据集构建过程中面临多重困难:一是样本来源的多样性与可控性难以兼顾,例如职业性别肖像集需在平衡64种职业与两种性别的配对设计下,确保提示词精确控制生成内容,避免引入生成偏差;二是视频样本的生成器版本与元数据完整性难以保障,如38个视频仅拥有基于文件名的描述,而无完整的提示词与生成日志;三是局部篡改集的创作涉及对真实照片的编辑,需在衍生作品版权和学术使用合理性之间取得平衡,同时不重新分发原始照片。此外,小样本量(296项)虽适用于行为研究,却限制了作为机器学习训练集的统计效力,其检测结果需谨慎解读。这些挑战共同界定了数据集在推进人机交互检测研究中的独特定位与局限性。
常用场景
经典使用场景
HumanCentric-Scenes-AI数据集作为一个多模态基准测试集,主要用于评估自动化的AI生成内容检测器在图像和视频分类任务上的性能。其经典使用场景涵盖了对监控摄像头画面、职业肖像、局部图像编辑以及短视频等多种以人为中心的合成媒体进行真伪辨识。研究者可利用该数据集中的296个精心策划的样本,系统性地测试和比较不同检测算法在面对低分辨率、性别与职业组合、部分区域篡改以及新兴视频生成器输出时的鲁棒性与准确性。该数据集尤其关注现有深度伪造基准中相对薄弱的环节,因此成为检验人机检测能力差异的理想工具。
衍生相关工作
该数据集衍生了多项值得关注的相关工作,首先它本身即为一篇学术论文的配套资源,详细阐述了多模态AI生成场景基准的设计原理与初步发现。其次,Set 3中64种职业与两种性别的平衡配对设计,为研究生成模型在描绘不同社会角色时如何体现刻板印象提供了结构化素材,促使后续研究探讨人类观察者检测性别不匹配肖像的速率差异。此外,Set 6中涵盖Sora、Gemini和Kling等多种视频生成器的56个短片,已成为追踪视频合成技术快速演进的参照基准,推动了针对短视频平台AI内容的专用检测器开发。这些衍生工作共同构成了一个从感知心理学到计算机视觉的交叉研究网络。
数据集最近研究
最新研究方向
当前,随着以Midjourney、Sora、Gemini为代表的生成式AI技术的爆发式发展,AI生成的人像与场景已逼近以假乱真的程度,引发了对深度伪造检测能力的迫切需求。该数据集敏锐地聚焦于现有基准中严重不足的真实世界场景——包括低分辨率监控影像、职业性别肖像、局部图像编辑以及短视频内容,通过精心构建的296个跨模态样本,为评估人机在非传统伪造情境下的感知与判别能力提供了独特的实验平台。这一前沿方向不仅填补了当前研究在复杂环境与细粒度操纵中的空白,更直接关联到社交媒体中虚假信息的传播与取证、安防监控的可靠性等热点事件,为推动更具鲁棒性与泛化性的AI生成内容检测技术奠定了关键基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务