登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
storytracer/hathi_full_20240501
storytracer/hathi_full_20240501
收藏
Hugging Face
2024-05-31 更新
2024-06-12 收录
数据链接:
https://hf-mirror.com/datasets/storytracer/hathi_full_20240501
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc0-1.0 ---
许可证:CC0 1.0
应用场景:
提供机构:
storytracer
原始信息汇总
数据集许可证信息
许可证类型
: CC0-1.0
相关数据集
storytracer/US-PD-Books
公共领域书籍
文本生成
该数据集包含超过65万本英文书籍(约610亿字),这些书籍被认为在美国属于公共领域,并由Internet Archive数字化,作为Open Library项目的一部分进行编目。数据集由Sebastian Majstorovic编译,包含来自Internet Archive(IA)各种收藏的653,983个OCR文本(约2亿页)。为了尽可能限制数据集为书籍,仅包含具有Open Library(OL
Hugging Face
2024-03-13 更新
92
0
storytracer/LoC-PD-Books
文化数字化
自然语言处理
该数据集包含超过140,000本英文书籍(约80亿字),这些书籍由美国国会图书馆数字化,并在美国属于公共领域。数据集通过LoC JSON API筛选并整理,包含OCR文本和基本元数据字段,如标题、作者和出版年份。数据集的总大小为47GB(未压缩)和26GB(压缩后的Parquet文件)。每本书的主要语言被分类为英语,OCR由国会图书馆生成。数据集的使用和重用遵循公共领域的版权规定,数据集本身(不包
Hugging Face
2024-03-13 更新
21
0
storytracer/public_library_1929_dolma
--- license: cc0-1.0 ---
Hugging Face
2024-06-13 更新
6
0
storytracer/openlibrary_dump_2024-04-30
图书馆数据
数据分析
--- license: unknown license_link: https://openlibrary.org/developers/licensing pretty_name: OpenLibrary Dump (2024-04-30) size_categories: - 10M<n<100M configs: - config_name: dumps default: true
Hugging Face
2024-05-26 更新
36
0
storytracer/German-PD-Newspapers
文本生成
历史文献
--- license: cc0-1.0 task_categories: - text-generation language: - de tags: - newspapers - ocr - public domain pretty_name: Public Domain Newspapers (German) size_categories: - 10B<n<100B --- # Datas
Hugging Face
2024-03-20 更新
20
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广