pg19
收藏官方服务:
资源简介:
PG-19主要用于语言建模基准测试,它包含从Project Gutenberg图书库中提取的1919年之前出版的一系列书籍,以及书籍标题和出版日期等元数据。数据集规模超过Billion Word基准的两倍,文档平均长度是WikiText长程语言建模基准的20倍。书籍被划分为训练集、验证集和测试集,元数据存储在包含book_id、short_book_title和publication_date的metadata.csv文件中。PG-19不限制词汇量大小,而是以开放词汇基准的形式发布数据,仅对文本进行了少量处理,例如删除样板许可文本,并将Ofcom指定的冒犯性歧视词映射到占位符。该数据集支持长程语言模型的基准测试,也可用于预训练其他需要长程推理的自然语言处理任务。PG-19采用Apache 2.0许可。
创建时间:
2024-07-19
搜集汇总
数据集介绍

背景与挑战
背景概述
PG-19是一个用于长程语言建模基准测试的大型数据集,包含1919年之前出版的Project Gutenberg图书,文档平均长度是WikiText基准的20倍。它采用开放词汇形式,仅进行少量文本处理(如移除许可文本),可用于评估长程语言模型或预训练其他需要长程推理的任务。
以上内容由遇见数据集搜集并总结生成



