Wikipedia Entity Embeddings for Entity-Aware Document Ranking (enwiki-20190701, 300-dim)
收藏资源简介:
A comprehensive dataset mapping Wikipedia entities to their Wikipedia2Vec embeddings, used for entity-aware document ranking and retrieval systems. Built from the English Wikipedia dump (2019-07-01) using Wikipedia2Vec with 300-dimensional embeddings. Each entry contains the entity ID, canonical entity name, Wikipedia2Vec entity identifier (with ENTITY/ prefix), and the corresponding 300-dimensional dense vector embedding. The dataset includes approximately 11.8 million entity embeddings extracted from the full Wikipedia2Vec model, filtered to include only entities (not words). This dataset supports the QDER (Query-Specific Document and Entity Representations) and DREQ (Document Re-ranking Using Entity-Based Query Understanding) models for entity-oriented neural information retrieval. The embeddings enable query-relevant entity emphasis in document representations and entity-centric ranking approaches.



