RA-Bench
收藏资源简介:
基于真实事件锚定的基准测试,用于在现实危机场景中检测AI生成的视频。
A benchmark test anchored on real-world events for detecting AI-generated videos in real-world crisis scenarios
RA-Bench 数据集详情
数据集简介
RA-Bench 是一个用于AI生成视频检测的基准数据集,核心特点是以真实危机事件视频为锚点,评估现有检测器能否识别与真实镜头高度相似的生成视频。该数据集将真实视频与来自4个开源和5个闭源生成器的输出进行配对,并进一步扩展评估至能误导人类评审的视频以及经过序列化传播流程处理的视频。
数据集规模
| 项目 | 数量 |
|---|---|
| 视频总数 | 17,886 |
| 真实视频锚点 | 1,830 |
| 生成视频 | 16,056 |
| 生成来源 | 9 |
| 社会风险类别/子类别 | 10 / 44 |
| 人类难以辨别的生成视频 | 633 |
Hugging Face 发布版本包含25,575个公共媒体文件,总大小达93.8 GB。其中1,319个真实锚点以媒体形式重新分发,511个因版权审查仅提供源URL,生成媒体则完整发布。
基准测试轨道
数据集包含三个评估轨道:
- RA-Bench: 主基准测试,用于评估跨生成器的泛化能力,包含匹配的真实-生成视频对。
- RA-Bench-HumanProof: 包含633个被全部五位评审判定为"真实"的生成视频,媒体文件复用自主基准。
- RA-Bench-LastMile: 评估检测器在六种序列化传播条件下的鲁棒性,从标准化视频到完整处理链。
评估方法
核心指标
- 连续伪造分数: 使用AUC和TPR@5%FPR指标
- 离散真实/生成决策: 使用BAcc、Macro-F1和FakeR指标
评估规则
- 采用源匹配评估,每个生成源与其对应的真实锚点单独评估
- 基准级别结果为九个生成源指标的算术平均值,确保各源贡献均等
- 预测文件需包含
item_id、fake_score和prediction字段 - 支持
public-media(仅评估已重新分发的媒体)和full(完整清单,含仅URL锚点)两种覆盖模式 - 评估器会拒绝重复ID和不完整的预测文件,自动修正标签方向
数据格式与获取
bash git clone https://github.com/24029100313/RA-Bench.git python -m pip install -r requirements.txt python scripts/download_dataset.py --output RA-Bench python scripts/verify_dataset.py RA-Bench
存储结构
text
RA-Bench/
|-- assets/
|-- metadata/
| |-- ra_bench_main.csv
| |-- ra_bench_humanproof.csv
| |-- ra_bench_lastmile.csv
| |-- real_rights_release.csv
| -- release_inventory.json |-- scripts/ | |-- download_dataset.py | |-- evaluate_predictions.py | -- verify_dataset.py
|-- EVALUATION.md
`-- README.md
元数据同时提供CSV和JSONL两种格式。
使用规范与版权声明
- 每个真实锚点的发布模式、源URL、权利依据和署名要求记录在
metadata/real_rights_release.csv中 - 仅含URL的记录不会被重新分发,用户必须保留源归属并遵守各源的条款
- 数据集包含危机相关内容,仅用于检测、溯源、鲁棒性和负责任的媒体分析研究,禁止用于创建或传播欺骗性内容




