facebook/wiki_dpr|文本检索数据集|语言建模数据集
收藏数据集概述
基本信息
- 数据集名称: Wiki-DPR
- 语言: 英语
- 许可证: CC-BY-NC-4.0
- 多语言性: 多语言
- 数据集大小: 10M<n<100M
- 源数据: 原始数据
- 任务类别:
- 填空
- 文本生成
- 任务ID:
- 语言建模
- 掩码语言建模
- 标签: 文本搜索
数据集结构
配置详情
-
配置名称: psgs_w100.nq.exact
- 特征:
id
: 字符串text
: 字符串title
: 字符串embeddings
: 浮点数序列
- 分割:
train
:- 字节数: 78419248156
- 样本数: 21015300
- 下载大小: 85288677114
- 数据集大小: 78419248156
- 特征:
-
配置名称: psgs_w100.nq.compressed
- 特征:
id
: 字符串text
: 字符串title
: 字符串embeddings
: 浮点数序列
- 分割:
train
:- 字节数: 78419248156
- 样本数: 21015300
- 下载大小: 85288677114
- 数据集大小: 78419248156
- 特征:
-
配置名称: psgs_w100.nq.no_index
- 特征:
id
: 字符串text
: 字符串title
: 字符串embeddings
: 浮点数序列
- 分割:
train
:- 字节数: 78419248156
- 样本数: 21015300
- 下载大小: 85288677114
- 数据集大小: 78419248156
- 特征:
-
配置名称: psgs_w100.multiset.exact
- 特征:
id
: 字符串text
: 字符串title
: 字符串embeddings
: 浮点数序列
- 分割:
train
:- 字节数: 78419248156
- 样本数: 21015300
- 下载大小: 85289275855
- 数据集大小: 78419248156
- 特征:
-
配置名称: psgs_w100.multiset.compressed
- 特征:
id
: 字符串text
: 字符串title
: 字符串embeddings
: 浮点数序列
- 分割:
train
:- 字节数: 78419248156
- 样本数: 21015300
- 下载大小: 85289275855
- 数据集大小: 78419248156
- 特征:
-
配置名称: psgs_w100.multiset.no_index
- 特征:
id
: 字符串text
: 字符串title
: 字符串embeddings
: 浮点数序列
- 分割:
train
:- 字节数: 78419248156
- 样本数: 21015300
- 下载大小: 85289275855
- 数据集大小: 78419248156
- 特征:
数据实例
每个实例包含最多100个单词的段落,以及该段落来自的维基百科页面的标题和DPR嵌入(一个768维的向量)。
示例
json { "id": "1", "text": "Aaron Aaron ( or ; "Ahärôn") is a prophet, high priest, and the brother of Moses in the Abrahamic religions. Knowledge of Aaron, along with his brother Moses, comes exclusively from religious texts, such as the Bible and Quran. The Hebrew Bible relates that, unlike Moses, who grew up in the Egyptian royal court, Aaron and his elder sister Miriam remained with their kinsmen in the eastern border-land of Egypt (Goshen). When Moses first confronted the Egyptian king about the Israelites, Aaron served as his brothers spokesman ("prophet") to the Pharaoh. Part of the Law (Torah) that Moses received from", "title": "Aaron", "embeddings": [-0.07233893871307373, 0.48035329580307007, 0.18650995194911957, -0.5287084579467773, -0.37329429388046265, 0.37622880935668945, 0.25524479150772095, ... -0.336689829826355, 0.6313082575798035, -0.7025573253631592] }
数据字段
所有分割的数据字段相同:
id
: 字符串特征text
: 字符串特征title
: 字符串特征embeddings
: 浮点数序列特征
数据分割
名称 | 训练样本数 |
---|---|
psgs_w100.multiset.compressed | 21015300 |
psgs_w100.multiset.exact | 21015300 |
psgs_w100.multiset.no_index | 21015300 |
psgs_w100.nq.compressed | 21015300 |
psgs_w100.nq.exact | 21015300 |

中国区域交通网络数据集
该数据集包含中国各区域的交通网络信息,包括道路、铁路、航空和水路等多种交通方式的网络结构和连接关系。数据集详细记录了各交通节点的位置、交通线路的类型、长度、容量以及相关的交通流量信息。
data.stats.gov.cn 收录
猫狗图像数据集
该数据集包含猫和狗的图像,每类各12500张。训练集和测试集分别包含10000张和2500张图像,用于模型的训练和评估。
github 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
Fruits-360
一个高质量的水果图像数据集,包含多种水果的图像,如苹果、香蕉、樱桃等,总计42345张图片,分为训练集和验证集,共有64个水果类别。
github 收录
PDT Dataset
PDT数据集是由山东计算机科学中心(国家超级计算济南中心)和齐鲁工业大学(山东省科学院)联合开发的无人机目标检测数据集,专门用于检测树木病虫害。该数据集包含高分辨率和低分辨率两种版本,共计5775张图像,涵盖了健康和受病虫害影响的松树图像。数据集的创建过程包括实地采集、数据预处理和人工标注,旨在为无人机在农业中的精准喷洒提供高精度的目标检测支持。PDT数据集的应用领域主要集中在农业无人机技术,旨在提高无人机在植物保护中的目标识别精度,解决传统检测模型在实际应用中的不足。
arXiv 收录