Parti Québécois (PQ) web archive collection derivatives
收藏资源简介:
Web archive derivatives of the Parti Québécois (PQ) collection from the Bibliothèque et Archives nationales du Québec. The derivatives were created with the Archives Unleashed Toolkit. Merci beaucoup BAnQ! These derivatives are in the Apache Parquet format, which is a columnar storage format. These derivatives are generally small enough to work with on your local machine, and can be easily converted to Pandas DataFrames. See this notebook for examples. <strong>Domains</strong> <pre><code class="language-java">.webpages().groupBy(ExtractDomainDF($"url").alias("url")).count().sort($"count".desc)</code></pre> Produces a DataFrame with the following columns: domain count <strong>Web Pages</strong> <pre><code class="language-java">.webpages().select($"crawl_date", $"url", $"mime_type_web_server", $"mime_type_tika", RemoveHTMLDF(RemoveHTTPHeaderDF(($"content"))).alias("content"))</code></pre> Produces a DataFrame with the following columns: crawl_date url mime_type_web_server mime_type_tika content <strong>Web Graph</strong> <pre><code class="language-java">.webgraph()</code></pre> Produces a DataFrame with the following columns: crawl_date src dest anchor <strong>Image Links</strong> <pre><code class="language-java">.imageLinks()</code></pre> Produces a DataFrame with the following columns: src image_url <strong>Binary Analysis</strong> Audio Images PDFs Presentation program files Spreadsheets Text files Word processor files
本数据集为魁北克国家图书馆与档案馆(Bibliothèque et Archives nationales du Québec,简称BAnQ)所藏魁北克人党(Parti Québécois,简称PQ)馆藏的网页归档衍生数据集。该衍生数据集通过Archives Unleashed Toolkit工具生成,特此致谢BAnQ! 本衍生数据集采用Apache Parquet列式存储格式,该格式为列存结构。数据集整体体积小巧,可在本地设备上便捷处理,且能轻松转换为Pandas数据框(DataFrame)。相关使用示例可参考此Notebook文档。 <strong>域名统计</strong> <pre><code class="language-java">.webpages().groupBy(ExtractDomainDF($"url").alias("url")).count().sort($"count".desc)</code></pre> 执行上述代码将生成包含以下字段的数据框:域名(domain)、计数(count) <strong>网页数据</strong> <pre><code class="language-java">.webpages().select($"crawl_date", $"url", $"mime_type_web_server", $"mime_type_tika", RemoveHTMLDF(RemoveHTTPHeaderDF(($"content"))).alias("content"))</code></pre> 执行上述代码将生成包含以下字段的数据框:爬取日期(crawl_date)、URL(url)、服务器MIME类型(mime_type_web_server)、Tika识别MIME类型(mime_type_tika)、网页内容(content,已移除HTTP头与HTML标签) <strong>网页图数据</strong> <pre><code class="language-java">.webgraph()</code></pre> 执行上述代码将生成包含以下字段的数据框:爬取日期(crawl_date)、源URL(src)、目标URL(dest)、锚文本(anchor) <strong>图片链接数据</strong> <pre><code class="language-java">.imageLinks()</code></pre> 执行上述代码将生成包含以下字段的数据框:源URL(src)、图片URL(image_url) <strong>二进制文件分析</strong> 涵盖以下文件类型:音频文件、图片文件、PDF文件、演示文稿文件、电子表格文件、文本文件、文字处理文件



