WikiText Long Term Dependency Language Modeling Dataset 长期依赖语言建模数据集
收藏数据链接:
官方服务:
资源简介:
WikiText 长期依赖语言建模数据集包含 1 亿个英文词汇,其来自于 Wikipedia 优质文章和标杆文章。
The WikiText long-range dependency language modeling dataset contains 100 million English tokens, sourced from high-quality and featured articles of Wikipedia.
创建时间:
2023-04-22
搜集汇总
数据集介绍

背景与挑战
背景概述
WikiText长期依赖语言建模数据集包含1亿个英文词汇,来源于Wikipedia优质文章,分为WikiText-2和WikiText-103两个版本,其规模超过PTB词库并保留原始文章,适用于长时依赖的自然语言建模任务。该数据集由Salesforce Research于2016年发布,相关研究论文为《Pointer Sentinel Mixture Models》。
以上内容由遇见数据集搜集并总结生成



