遇见数据集

Oracc-parser Package: Datasets

收藏
Zenodo2026-06-10 更新2026-05-26 收录
官方服务:

资源简介:

Pre-downloaded and cached data for the oracc-parser Python package. Contains: oracc_jsonzip_all.zip — 138 ORACC project JSON data bundles oracc_html_translations.zip — 25,903 cached translations HTML pages (translations mostly to English, sometimes other modern languages) catalogues.zip — the original oracc metadata information for the documents per project in csv form plaides_scraped_data.zip — Cached Pleiades geographical data for city provenance Documents stored according to 31 ORACC umbrella projects, in csv form. Stored in zipped folders under project name Download these files to enable oracc-parser to work entirely offline, without hitting ORACC or Pleiades servers. Usage: python scripts/download_zenodo_data.py

面向oracc-parser Python包的预下载缓存数据集。 本数据集包含以下内容: oracc_jsonzip_all.zip:139个ORACC项目的JSON数据打包文件 oracc_html_translations.zip:22999条已缓存的英文翻译HTML页面 plaides_scraped_data.zip:用于城市出处溯源的Pleiades地理信息缓存数据 oracc_csvs.zip:提取自oracc_jsonzip_all.zip中139个ORACC项目的楔形文字文档词级CSV文件,可提升处理速度 catalogues.zip:按项目分类的文档原始ORACC元数据CSV文件 下载上述文件后,即可使oracc-parser完全离线运行,无需访问ORACC或Pleiades服务器。 使用方法:运行python scripts/download_zenodo_data.py

提供机构:
Zenodo
创建时间:
2026-02-14
二维码
社区交流群
二维码
科研交流群
商业服务