遇见数据集

WikiText Long Term Dependency Language Modeling Dataset 长期依赖语言建模数据集

收藏
超神经2023-09-12 更新2024-05-15 收录
数据链接:
官方服务:

资源简介:

WikiText 长期依赖语言建模数据集包含 1 亿个英文词汇,其来自于 Wikipedia 优质文章和标杆文章。

The WikiText long-range dependency language modeling dataset contains 100 million English tokens, sourced from high-quality and featured articles of Wikipedia.

创建时间:
2023-04-22
搜集汇总
数据集介绍
WikiText Long Term Dependency Language Modeling Dataset 长期依赖语言建模数据集 数据集图片
背景与挑战
背景概述
WikiText长期依赖语言建模数据集包含1亿个英文词汇,来源于Wikipedia优质文章,分为WikiText-2和WikiText-103两个版本,其规模超过PTB词库并保留原始文章,适用于长时依赖的自然语言建模任务。该数据集由Salesforce Research于2016年发布,相关研究论文为《Pointer Sentinel Mixture Models》。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务