遇见数据集

pg19

收藏
Opencsg2024-07-19 更新2025-05-03 收录
官方服务:

资源简介:

PG-19主要用于语言建模基准测试,它包含从Project Gutenberg图书库中提取的1919年之前出版的一系列书籍,以及书籍标题和出版日期等元数据。数据集规模超过Billion Word基准的两倍,文档平均长度是WikiText长程语言建模基准的20倍。书籍被划分为训练集、验证集和测试集,元数据存储在包含book_id、short_book_title和publication_date的metadata.csv文件中。PG-19不限制词汇量大小,而是以开放词汇基准的形式发布数据,仅对文本进行了少量处理,例如删除样板许可文本,并将Ofcom指定的冒犯性歧视词映射到占位符。该数据集支持长程语言模型的基准测试,也可用于预训练其他需要长程推理的自然语言处理任务。PG-19采用Apache 2.0许可。

创建时间:
2024-07-19
搜集汇总
数据集介绍
pg19 数据集图片
背景与挑战
背景概述
PG-19是一个用于长程语言建模基准测试的大型数据集,包含1919年之前出版的Project Gutenberg图书,文档平均长度是WikiText基准的20倍。它采用开放词汇形式,仅进行少量文本处理(如移除许可文本),可用于评估长程语言模型或预训练其他需要长程推理的任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务