copyrightgpt-v1
收藏资源简介:
CopyrightGPT Video Fingerprint Dataset 是一个用于视频版权检测的初版指纹数据集。其核心目标是快速判断一段视频是否已被收录或存在高度相似的版本。数据集包含一个简单但完整的视频指纹处理流水线:通过 Python 脚本对视频进行采样、计算感知哈希(pHash),并将指纹以自定义二进制格式存储(每个视频一个文件夹,包含元数据文件 main.bin 和多个帧哈希文件 patch-N.dat)。每个视频分配一个 YouTube 风格的 11 字符随机 ID。数据集还提供了命令行工具,支持导入视频(ingest)、检查新视频是否匹配(check)以及列出已收录视频(list)。匹配结果以 match_ratio(匹配帧比例)表示,并可在阈值(默认 0.5)以上标记为 likely copyrighted。该数据集为早期原型,仅基于帧的感知哈希进行无序匹配,不包含音频指纹、不支持裁剪/旋转等变换、也未实现大规模索引或并行处理。适用于视频相似性初步筛查、重复上传检测等场景。
The CopyrightGPT Video Fingerprint Dataset is an initial fingerprint dataset for video copyright detection. Its core goal is to quickly determine whether a video has been indexed or if there is a highly similar version. The dataset includes a simple but complete video fingerprint processing pipeline: sampling videos via Python scripts, computing perceptual hashes (pHash), and storing fingerprints in a custom binary format (each video in a folder containing a metadata file main.bin and multiple frame hash files patch-N.dat). Each video is assigned an 11-character random ID in YouTube style. The dataset also provides command-line tools to import videos (ingest), check new videos for matches (check), and list indexed videos (list). The matching result is represented as match_ratio (proportion of matching frames), and can be marked as likely copyrighted above a threshold (default 0.5). This dataset is an early prototype, only performing unordered matching based on frame perceptual hashes, without audio fingerprints, support for cropping/rotation transformations, or large-scale indexing/parallel processing. It is suitable for preliminary video similarity screening, duplicate upload detection, and similar scenarios.
数据集概述
CopyrightGPT Video Fingerprint Dataset 是一个用于视频版权检测的早期草稿数据集,旨在回答一个核心问题:这段视频(或与之高度相似的视频)是否已被收录过?
该数据集通过为每个摄取的视频生成类似 YouTube 风格的随机 ID,并存储其感知哈希(pHash)指纹,从而能够对新视频与库内已有视频进行相似度比对,标记潜在的重复或二次上传内容。
技术实现
- 指纹计算:对视频采样帧进行感知哈希(pHash)计算,生成帧级指纹
- ID 生成:为每个视频生成 11 位随机 ID(类似 YouTube 视频 ID)
- 存储格式:采用自定义二进制格式(通过 Python
struct实现),非 pickle 或 JSON,包含长度前缀字符串及打包的(timestamp, hash)记录 - 架构:包含
idgen.py(ID 生成)、fingerprint.py(指纹计算)、storage.py(读写存储)、ingest.py(视频摄入)、match.py(相似度匹配)、cli.py(命令行界面)及hf_sync.py(推送至 Hugging Face)等模块
核心功能
- 摄入视频:通过 CLI 命令
ingest将视频及其指纹加入数据集 - 查重比对:通过
check命令计算查询视频与库内视频的match_ratio(匹配比例),当该值超过可配置阈值(默认 0.5)时标记为is_likely_copyrighted: true - 列表查看:通过
list命令列出数据集中已有的视频条目 - 增量更新:支持对同一视频重复摄入时追加新的补丁文件(
patch-N.dat)
数据集局限(初版)
- 匹配方式简单:采用无序最近邻哈希帧匹配,无法可靠识别重度裁剪、旋转或编辑过的片段,也无法定位短视频片段在长视频中的具体出现位置
- 无音频指纹:目前仅处理视频帧,未包含音频指纹识别
- 性能限制:单进程运行,尚无批处理或大规模索引机制,不适用于生产级版权检测场景





