遇见数据集

glove

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

本数据集是GloVe预训练词向量的HuggingFace版本,旨在为自然语言处理任务提供高质量的预训练词嵌入表示。它包含四个主要配置:6B配置基于Wikipedia 2014和Gigaword 5语料,有400,000个词条;42B配置基于Common Crawl 42B tokens语料,有1,917,494个词条;840B配置基于Common Crawl 840B tokens语料,有2,196,017个词条;twitter27B配置基于Twitter 27B tokens语料,有1,193,514个词条。每个配置下提供不同维度的split(如25维、50维、100维、200维、300维)。每个样本包含word字段(字符串类型的原始词表token)和vector字段(float32类型的向量列表)。该数据集适用于文本分类、情感分析、机器翻译等任务,用户可按需选择配置和维度加载,总下载大小约为7.9GB。

This dataset is the HuggingFace version of GloVe pre-trained word vectors, designed to provide high-quality pre-trained word embeddings for natural language processing tasks. It includes four main configurations: the 6B configuration is based on Wikipedia 2014 and Gigaword 5 corpus, with 400,000 entries; the 42B configuration is based on the Common Crawl 42B tokens corpus, with 1,917,494 entries; the 840B configuration is based on the Common Crawl 840B tokens corpus, with 2,196,017 entries; and the twitter27B configuration is based on the Twitter 27B tokens corpus, with 1,193,514 entries. Each configuration offers splits of different dimensions (e.g., 25d, 50d, 100d, 200d, 300d). Each sample contains a word field (string type, representing the original token with case, punctuation, and tokenization preserved) and a vector field (a list of float32 values, with the length determined by the split dimension). The dataset is suitable for tasks such as text classification, sentiment analysis, and machine translation, and users can load specific configurations and dimensions as needed, with a total download size of approximately 7.9GB.

创建时间:
2026-07-13
原始信息汇总

GloVe 预训练词向量数据集

该数据集将 GloVe(Global Vectors for Word Representation)预训练词向量整理为 Hugging Face Dataset 格式,每个配置对应一套官方发布语料,每个 split 名称表示词向量维度。

数据集配置

配置 语料 维度 词表大小
6B Wikipedia 2014 + Gigaword 5 50d, 100d, 200d, 300d 400,000
42B Common Crawl 42B tokens 300d 1,917,494
840B Common Crawl 840B tokens 300d 2,196,017
twitter27B Twitter 27B tokens 25d, 50d, 100d, 200d 1,193,514

全部配置的下载大小合计约为 7.9 GB。

字段说明

每行表示一个 token 及其词向量:

  • word:原始词表中的 token(字符串类型)
  • vector:对应的 float32 向量,长度由 split 名称决定

例如,6B 配置的 100d split 中,每个 vector 包含 100 个浮点数。

使用方式

可通过 load_dataset 加载指定配置和维度,例如加载 6B 全部维度或仅加载 twitter27B100d 维度。也可通过 Dataset.filter() 查询特定词向量,但需注意该方法会扫描整个 split。

注意事项

  • token 的大小写、标点和分词形式沿用原始 GloVe 文件。
  • 不同配置的词表互不保证一致。
  • split 名称是向量维度,不是训练集或测试集划分。
  • 向量以 float32 保存。

引用

该数据集基于 GloVe 论文,引用格式:

bibtex @inproceedings{pennington2014glove, title={GloVe: Global Vectors for Word Representation}, author={Pennington, Jeffrey and Socher, Richard and Manning, Christopher D.}, booktitle={Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP)}, pages={1532--1543}, year={2014} }

原始向量、语料说明和使用条款请以 GloVe 官方项目页面(https://nlp.stanford.edu/projects/glove/)为准。

搜集汇总
数据集介绍
glove 数据集图片
构建方式
GloVe数据集源自斯坦福大学提出的Global Vectors for Word Representation词向量模型,其构建基于大规模无标注语料库,通过统计词与词在上下文中共现的全局信息,将词语映射为低维稠密向量。该数据集在Hugging Face平台上被整理为多个配置,分别对应不同来源和规模的语料:'6B'配置来自Wikipedia 2014与Gigaword 5,包含40万词条;'42B'与'840B'配置均基于Common Crawl语料,词表规模分别达到191万与219万词条;'twitter27B'配置则从Twitter文本中提炼,覆盖119万词条。每一配置内进一步按向量维度划分为不同子集,如50维、100维、200维与300维,各维度独立存储为split,且所有向量均以float32格式保存。
特点
该数据集的核心特点在于其多语料、多维度与标准化格式的灵活性。用户可根据应用场景选择适合的语料背景——例如处理通用文本可选用6B配置,而社交媒体任务则可倾向twitter27B配置——同时在各配置内自由选择不同维度的向量,以满足计算资源与表征精度的平衡。数据集字段设计简洁,每个样本仅包含'word'字符串与'vector'浮点数列表,便于直觉化调用。此外,不同配置间的语料与词表互不重叠,用户只需加载所需配置与维度即可使用,无需下载无关数据,显著提升了存储与使用的效率。
使用方法
使用该数据集时,可通过Hugging Face Datasets库的load_dataset函数加载指定配置与split。例如,加载6B配置的全部维度可直接指定config为'6B',而仅加载twitter27B配置的100维向量则可设置split='100d'。查询特定词向量推荐使用Dataset.filter方法进行逐token扫描,但频繁查询时建议预先构建词到向量索引以避免全局搜索。需注意split名称仅标示向量维度而非数据集划分,且原始token的大小写与标点形式均保留自GloVe官方发布文件。各配置的数据文件以shard形式组织,加载时会自动拼接完成。
背景与挑战
背景概述
GloVe(Global Vectors for Word Representation)是由斯坦福大学Jeffrey Pennington、Richard Socher和Christopher D. Manning于2014年提出的预训练词向量数据集。该数据集旨在解决自然语言处理中词语语义表示的核心问题,通过融合全局矩阵分解与局部上下文窗口方法的优势,从大规模无标注语料中学习稠密向量表示。GloVe涵盖了Wikipedia 2014、Gigaword 5、Common Crawl及Twitter等多样化语料,提供从25维到300维的多种向量规格,词表规模达数百万级别。作为词嵌入领域的里程碑工作,GloVe显著推动了文本分类、命名实体识别、机器翻译等下游任务的发展,其发布至今仍是学术与工业界广泛使用的基准资源。
当前挑战
GloVe面临的核心挑战在于动态语境捕获的局限性:固定向量表示难以消解一词多义现象,亦无法适应词汇语义随时间的演化。构建过程中,大规模语料的预处理面临内存与计算资源的严峻考验,尤其对于Common Crawl 840B配置,其词表规模超过200万,存储和检索需高效索引机制。此外,不同语料间的词表不一致性增加了跨域迁移的难度,而低维向量在特定领域任务中的表达力不足也限制了其泛化能力。如何平衡表示维度、语料规模与计算效率,仍是后续研究亟待突破的关键瓶颈。
常用场景
经典使用场景
在自然语言处理领域,词向量是语义表示的基础工具。GloVe预训练词向量数据集提供了在不同大规模语料上训练得到的稠密向量表示,其经典使用场景包括作为神经网络的嵌入层初始化参数,以及用于计算词汇之间的语义相似度。例如,在文本分类、命名实体识别、情感分析等任务中,研究者可以直接加载对应维度的预训练向量,避免了从零开始训练词嵌入的高昂计算成本。该数据集支持从50维到300维的多种配置,能够灵活适配不同复杂度的下游模型架构。通过简单的向量运算,如"king - man + woman ≈ queen",直观展示了其捕获词语类比关系的能力,成为语义空间探索的标志性工具。
衍生相关工作
GloVe数据集的提出催生了一系列重要的扩展性工作。在词嵌入领域,有研究者基于其共现矩阵分解思想提出了子词级别的FastText向量,以及针对多义词问题的语境化嵌入模型如ELMo。在评价体系方面,SimLex-999和WordSim-353等语义相似度基准数据集的设计直接参考了GloVe向量的评估框架。跨语言方向的工作包括利用该向量进行双语词典映射的无监督对齐方法,以及将其作为初始化参数提升神经机器翻译性能的研究。更为深远的影响体现在预训练语言模型的发展中,BERT等模型在预训练阶段的初始化策略亦借鉴了GloVe对词汇先验知识的编码范式,尽管其最终被上下文表示所超越,但全同统计建模的思想仍在Transformer架构的共现注意力机制中留有印迹。
数据集最近研究
最新研究方向
在自然语言处理领域,GloVe预训练词向量凭借其全局词频共现矩阵的统计特性,持续为下游任务提供稳健的词汇语义表征基础。当前前沿方向聚焦于将GloVe与深度学习模型深度耦合,例如在情感分析、命名实体识别及语义相似度计算中,通过微调其300维或更高维度的向量空间以捕捉细粒度语义关系。近期研究热点包括在跨语言迁移学习中,将GloVe向量与Transformer架构结合,用于低资源语言的零样本推理,以缓解词表不匹配问题。此外,随着大语言模型对动态嵌入的需求增长,GloVe作为静态嵌入的经典范式,常被用于对比基线或与上下文表示融合,以提升模型在专业领域(如生物医学或法律文书)中的术语理解能力。该数据集的多个语料版本(如Common Crawl 840B)覆盖了海量互联网文本,为大规模语义空间构建和知识图谱补全提供了可靠的数据支撑,其影响力体现在推动词嵌入标准化评估体系的形成,并在可解释性研究中作为分析语言统计规律的基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务