English word2vec embeddings trained on OpenSubtitles Part 5
收藏资源简介:
This dataset contains the subs2vec embeddings for English, as presented in https://zenodo.org/records/17243814. The embeddings were trained on large-scale subtitle corpora and represent semantic vector spaces derived from naturalistic language use in films and television from the OpenSubtitles 2018 datasets: https://opus.nlpl.eu/OpenSubtitles/corpus/version/OpenSubtitles. For this language, we provide all embedding variants explored in the study. Specifically, the dataset includes vectors generated under different combinations of: Dimensionality: multiple vector sizes (e.g., 100, 200, 300, …) Window size: varying context windows (e.g., 2, 5, 10, …) Each file corresponds to a unique configuration (dimension × window size). Each file contains the vocabulary for that language (column 1) and then the embedding values (columns 2 through dimension size + 1). If you use this dataset, please cite: Manuscript: https://doi.org/10.5281/zenodo.17243812 Data: This Zenodo dataset (using the DOI provided here) sha256sum checksums: en_300_3_sg_wxd.csv.bz2 2e6f80ec20aa7bab032d0def845aecaed881ae7dfabb2141112af972d1e51139 en_300_4_cbow_wxd.csv.bz2 d40266f317c0e615d75ab0bd3a7ac4dd21adde50369a58ec4f17f91e34ebd029 en_300_4_sg_wxd.csv.bz2 6603c6f3ae494a90605c1e8f48312fd43474f84ee86a271f418a4ec5b45f9433 en_300_5_cbow_wxd.csv.bz2 2c98360e7af1f2d729bec0cd926266fae34e3e1a62028dc8d7a130d4914bdfe8 en_300_5_sg_wxd.csv.bz2 0b84df4ab4a2d6f4a91ac1cd0c6aae67495116eda5a6e2385f474f3c59151dc2



