DOJ Epstein Archive – No Images Produced Dataset
收藏资源简介:
该仓库记录了公开发布的DOJ Epstein档案材料子集的技术分析,重点关注从查询no images produced返回的文件。DOJ档案经常提供标记为.pdf扩展名的URL,即使底层文件类型不是PDF。该项目尝试通过编程方式确定每个条目的真实文件类型。
This repository presents a technical analysis of a subset of publicly released DOJ Epstein archive materials, with a focus on files returned from the query "no images produced". DOJ archives often provide URLs labeled with the .pdf file extension, even when the underlying file type is not PDF. This project attempts to programmatically determine the true file type of each entry.
DOJ Epstein Archive -- "No Images Produced" 数据集概述
数据集简介
该数据集是对美国司法部(DOJ)公开的爱泼斯坦档案材料子集进行技术分析的记录。分析重点针对来自特定搜索查询“no images produced”返回的文件。数据集旨在通过程序化方法,利用魔数字节检测,确定每个条目的真实文件类型,因为DOJ档案提供的URL常带有.pdf扩展名,但其底层实际内容可能是视频、音频、图像、压缩包或其他媒体格式。
数据集状态
这是一个进行中的数据集。
- 基础数据集已收集完成。
- 文件扩展名解析部分完成。
- 当前发布的
resolved.partial.csv反映了阶段性运行结果。 - 由于网站速率限制,部分条目尚未解析。
- 部分条目可能需要额外的探测轮次。 当前发布的CSV文件是原始的,如实反映了上传时的解析状态。
数据集文件
no_images_produced_links.csv
直接从DOJ搜索结果中提取的基础数据集。这些是DOJ网站发布的原始URL。大多数条目以.pdf结尾,无论其真实文件类型如何。该文件代表了当前正在分析的完整基础集合。
resolve_extensions.py
用于绕过WAF保护、探测URL并在不完全下载大型媒体文件的情况下确定真实文件扩展名的Python脚本。
resolved.partial.csv
一个阶段性的解析结果数据集。该文件包含以下字段:
base_idoriginal URLbase URL(去除扩展名)resolution statusresolved URL(如果找到)detected extensiondetected file type(通过魔数字节检测)HTTP content-typeresolution notes由于DOJ网站实施了严格的速率限制和反机器人控制,解析必须分批进行。随着更多轮次完成,该数据集将逐步更新。脚本会自动读取此文件以恢复进度。
技术方法
解析采用以下技术:
- 基于Playwright的会话处理:用于通过年龄验证、生成有效Cookie并伪造标准浏览器标头。
- HTTP范围请求:仅获取文件的前64KB,以节省大量带宽。
- 魔数字节检测:无论服务器的HTTP标头如何,都能可靠地确定真实文件类型。
- 内容类型验证与分层探测:采用媒体优先的猜测策略(如.mp4, .mov等)。
- HTML/网关检测:用于过滤由软404或WAF重定向导致的误报HTTP 200响应。
限制与注意事项
- IP绑定:会话Cookie严格绑定到您的IP地址。更改VPN或重启路由器将使
justice_storage_state.json失效,导致HTTP 401/403错误。若发生此情况,需删除JSON文件并重新运行脚本以生成新的Cookie。 - 速率限制:DOJ网站执行严格的速率限制。脚本目前每次处理1个文件,并带有随机抖动延迟(2.5秒至5.5秒)以模拟人类行为。
- 蜂窝网络热点:如果您的住宅IP或VPN被WAF永久标记,将机器连接到5G/LTE移动热点通常可以绕过限制,因为运营商级NAT(CGNAT)IP具有较高的可信度。
免责声明
此存储库中引用的所有数据均源自司法部公开的材料。 此存储库不托管、修改或重新分发源文件。它记录了针对可公开访问的URL进行的技术分析和文件类型解析,用于研究和档案完整性目的。



