遇见数据集

Google News dataset

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是一个用于提取名词对之间语义关系的语料库,它包含了300万词汇和短语的三维向量。此外,该数据集已经用于预训练Word2Vec向量,并且与SemEval-2010任务8的语义关系提取相匹配。它的任务是进行名词对之间多类别分类的语义关系分析。

This dataset is a corpus designed for extracting semantic relations between noun pairs. It contains 3-dimensional vectors for 3 million vocabulary terms and phrases. Additionally, this dataset has been utilized for pre-training Word2Vec vectors and aligns with the semantic relation extraction task of SemEval-2010 Task 8. Its core task is to conduct multi-class classification-based semantic relation analysis between noun pairs.

提供机构:
Google
搜集汇总
数据集介绍
Google News dataset 数据集图片
背景与挑战
背景概述
该数据集是Google News dataset的预训练词向量,基于约1000亿单词的新闻文本训练生成,包含300万个单词和短语的300维向量表示。这些向量可用于自然语言处理任务,如计算词语相似度和进行向量运算。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务