遇见数据集

RA-Bench

收藏
github2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

基于真实事件锚定的基准测试,用于在现实危机场景中检测AI生成的视频。

A benchmark test anchored on real-world events for detecting AI-generated videos in real-world crisis scenarios

创建时间:
2026-08-13
原始信息汇总

RA-Bench 数据集详情

数据集简介

RA-Bench 是一个用于AI生成视频检测的基准数据集,核心特点是以真实危机事件视频为锚点,评估现有检测器能否识别与真实镜头高度相似的生成视频。该数据集将真实视频与来自4个开源和5个闭源生成器的输出进行配对,并进一步扩展评估至能误导人类评审的视频以及经过序列化传播流程处理的视频。

数据集规模

项目 数量
视频总数 17,886
真实视频锚点 1,830
生成视频 16,056
生成来源 9
社会风险类别/子类别 10 / 44
人类难以辨别的生成视频 633

Hugging Face 发布版本包含25,575个公共媒体文件,总大小达93.8 GB。其中1,319个真实锚点以媒体形式重新分发,511个因版权审查仅提供源URL,生成媒体则完整发布。

基准测试轨道

数据集包含三个评估轨道:

  1. RA-Bench: 主基准测试,用于评估跨生成器的泛化能力,包含匹配的真实-生成视频对。
  2. RA-Bench-HumanProof: 包含633个被全部五位评审判定为"真实"的生成视频,媒体文件复用自主基准。
  3. RA-Bench-LastMile: 评估检测器在六种序列化传播条件下的鲁棒性,从标准化视频到完整处理链。

评估方法

核心指标

  • 连续伪造分数: 使用AUC和TPR@5%FPR指标
  • 离散真实/生成决策: 使用BAcc、Macro-F1和FakeR指标

评估规则

  • 采用源匹配评估,每个生成源与其对应的真实锚点单独评估
  • 基准级别结果为九个生成源指标的算术平均值,确保各源贡献均等
  • 预测文件需包含 item_idfake_scoreprediction 字段
  • 支持 public-media(仅评估已重新分发的媒体)和 full(完整清单,含仅URL锚点)两种覆盖模式
  • 评估器会拒绝重复ID和不完整的预测文件,自动修正标签方向

数据格式与获取

bash git clone https://github.com/24029100313/RA-Bench.git python -m pip install -r requirements.txt python scripts/download_dataset.py --output RA-Bench python scripts/verify_dataset.py RA-Bench

存储结构

text RA-Bench/ |-- assets/ |-- metadata/ | |-- ra_bench_main.csv | |-- ra_bench_humanproof.csv | |-- ra_bench_lastmile.csv | |-- real_rights_release.csv | -- release_inventory.json |-- scripts/ | |-- download_dataset.py | |-- evaluate_predictions.py | -- verify_dataset.py |-- EVALUATION.md `-- README.md

元数据同时提供CSV和JSONL两种格式。

使用规范与版权声明

  • 每个真实锚点的发布模式、源URL、权利依据和署名要求记录在 metadata/real_rights_release.csv
  • 仅含URL的记录不会被重新分发,用户必须保留源归属并遵守各源的条款
  • 数据集包含危机相关内容,仅用于检测、溯源、鲁棒性和负责任的媒体分析研究,禁止用于创建或传播欺骗性内容
搜集汇总
数据集介绍
RA-Bench 数据集图片
构建方式
RA-Bench,全称为Real-Anchored Benchmark,是一项针对AI生成视频检测的基准测试,其核心构建理念在于利用真实危机事件视频作为锚点,系统评估现有检测器对生成式视频的识别能力。该基准的构建流程严谨而细致:首先,精心筛选了1,830个真实视频作为基础锚点,这些视频涵盖10个大类、44个子类的社会风险场景。随后,研究团队利用四款开源和五款闭源视频生成器,基于这些真实锚点生成对应的合成视频,总计构建了16,056个生成视频,与真实视频形成配对的真实-生成对。在数据管理层面,RA-Bench遵循版权法规,对于1,319个真实锚点视频以媒体文件形式重新分发,而对另外511个则仅提供来源URL,确保数据使用的合法性。此外,该基准还特别设计了两个高级评估轨道,包括经过人工评审认定为高度逼真的633个生成视频子集,以及经过六种顺序传播条件处理的视频集,以此模拟现实世界中的信息扩散场景。整个数据集的构建不仅关注了数据的规模与多样性,更通过精细化的配对设计和多维度评估轨道,为AI生成视频检测研究提供了扎实可靠的数据基础。
使用方法
使用RA-Bench进行模型评估的流程清晰且工具化。首先,用户需通过Git克隆仓库并安装依赖,随后运行脚本从Hugging Face下载完整的媒体文件,并通过验证脚本确保数据完整性。评估阶段,用户需按既定格式准备预测文件,其中包含每个视频项的fake_score(连续伪造得分)和/或prediction(离散的real或generated标签)。数据集提供了三个评估轨道的专用脚本,例如,运行'evaluate_predictions.py'时需指定轨道(main、humanproof或lastmile)和覆盖模式(public-media或full)。默认的public-media模式仅使用可重新分发的真实锚点进行评估,而full模式则需用户自行获取URL-only的真实视频,以遵循原始版权条款。工具会自动检查预测文件的完整性和唯一性,并固定评分方向,确保评估的标准化。最终,评估结果以JSON格式输出,包含AUC、TPR@5%FPR、BAcc、Macro-F1和FakeR等关键指标。此外,RA-Bench鼓励研究者探索检测之外的领域,如来源追踪和鲁棒性增强,但明确要求不得用于制作或传播欺骗性内容,体现了负责任的AI研究伦理。
背景与挑战
背景概述
随着生成式视频技术的迅猛发展,深度伪造视频对社会稳定与公共安全构成日益严峻的威胁,尤其在危机事件背景下,伪造视频可能引发恐慌与信息混乱。RA-Bench基准数据集应运而生,由研究团队于近期构建,旨在系统评估现有检测器对以真实危机视频为锚点生成的高逼真伪造视频的识别能力。数据集涵盖17,886个视频,包括1,830个真实锚点视频及来自9种生成器(4种开源、5种闭源)的16,056个生成视频,覆盖10类危机事件,并额外包含633个经人类评估者误判的欺骗性视频。其核心研究问题在于:当前检测器能否有效抵御基于真实事件视频的生成伪造?RA-Bench通过源匹配评估协议,提供公平的跨生成器性能对比,对视频取证领域具有重要推动作用,为检测算法的鲁棒性研究提供了标准化基准。
当前挑战
RA-Bench面临的挑战多维且严峻。领域层面,现有检测器在面对与真实危机视频高度语义对齐的生成视频时,泛化能力显著不足,尤其是在跨生成器场景下,性能急剧下降;同时,经过人类筛选的欺骗性生成视频(RA-Bench-HumanProof)进一步暴露了检测器的脆弱性。最后一公里(RA-Bench-LastMile)挑战则模拟了现实传播链路中的六种顺序处理条件,检测器需在视频经历压缩、加噪等常见操作后仍保持准确性。构建层面,数据集的制作需确保真实视频与生成视频的严格配对,涉及大规模视频采集与处理;版权问题上,511个真实视频仅以URL形式提供,需处理复杂的权利溯源与合规使用;此外,生成视频的多样性要求覆盖多种生成器与危机类别,数据量庞大(93.8GB),对存储、分发及元数据管理提出高要求。
常用场景
经典使用场景
RA-Bench作为一项针对AI生成视频检测的基准测试,其经典使用场景聚焦于评估检测器在真实危机事件视频为基础生成的伪造视频上的识别能力。基准精心设计了三个递进式的评测轨道:主轨道(RA-Bench)以源匹配方式检验检测器的泛化性能,确保每个生成源与对应的真实锚点视频配对评估;人类欺骗轨道(RA-Bench-HumanProof)则筛选出能够误导人类审查员的生成视频,用以测试检测器面对高逼真伪造内容时的鲁棒性;最后,最后里程轨道(RA-Bench-LastMile)模拟视频经社交媒体传播链的六种连续处理条件,考察检测器在现实场景下的稳定性。这一多维度评测框架为研究者提供了标准化的评估协议和公开的预测提交接口,极大地便利了不同检测方法的横向对比与性能验证。
解决学术问题
RA-Bench直面当前AI生成视频检测领域面临的重大挑战:现有检测器在面对源自真实危机事件的生成视频时性能骤降,且缺乏针对复杂传播场景的评测基准。该数据集通过构建包含17,886个视频的大规模基准,涵盖9种生成源和10类社会风险事件,系统性地解决了生成视频检测的泛化性、可欺骗性和鲁棒性评估问题。其源匹配评估方法确保了公平对比,而人类欺骗子集和传播链模拟则填补了现有基准对真实威胁建模不足的空白。这一工作不仅为生成视频检测提供了首个以真实视频为锚点的危机场景基准,还促进了检测算法向实际应用场景的迁移,对维护信息真实性和社会安全具有深远学术影响。
实际应用
在实际应用领域,RA-Bench可服务于社交媒体平台、新闻机构和公共安全部门,用于部署和验证AI生成视频检测系统。通过利用该基准,相关机构能够评估其检测工具在危机事件(如自然灾害、社会冲突等)中的可靠性,从而有效识别并遏制虚假信息的传播。此外,该数据集的公开媒体资源允许开发者在真实场景下微调检测模型,提升对生成视频的辨识精度。其权限管理机制和可复现的评估脚本,也支持法律合规下的内容审核工作流,为构建可信赖的媒体环境提供了技术验证工具,推动了AI内容检测技术的社会化应用落地。
数据集最近研究
最新研究方向
RA-Bench聚焦于人工智能生成视频检测的前沿挑战,尤其是在危机事件情境下,利用真实视频作为锚点,系统评估现有检测器对高逼真度生成内容的辨识能力。该基准通过构建包含17,886个视频的大规模数据集,覆盖九种生成器与十类社会风险场景,并引入人类欺骗性样本及顺序传播链路下的鲁棒性测试,推动了检测技术向更贴近实际应用的方向演进。其源匹配评估策略确保了跨生成源的公平比较,为后续研究提供了严谨的度量框架。RA-Bench的发布回应了深度伪造内容在社交媒体上快速传播的紧迫问题,对维护信息生态安全、促进负责任的AI发展具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务