BigBird Dataset|自然语言处理数据集|长文本建模数据集
收藏
- BigBird Dataset首次发表于2020年,由Google Research团队提出,旨在解决长序列建模问题。
- BigBird Dataset首次应用于自然语言处理任务,特别是在问答系统和文本摘要领域,展示了其在处理长文本时的优越性能。
EleutherAI/proof-pile-2
Proof-Pile-2是一个包含550亿个token的数学和科学文档数据集,用于训练Llemma 7B和Llemma 34B模型。该数据集由三个子集组成:arxiv(29B tokens)、open-web-math(15B tokens)和algebraic-stack(11B tokens)。arxiv子集来自RedPajama,open-web-math子集包含互联网上的高质量数学文本,algebraic-stack子集是一个新的数学代码数据集,包括数值计算、计算机代数和形式数学。每个数据行包含文本和元数据。数据集的内容详细列出了AlgebraicStack中各编程语言的token数量。许可证信息未改变原始数据的许可证。版本历史包括v1.1.0和v1.0.0,分别对应不同版本的OpenWebMath。引用部分提供了对整个数据集及其子集的引用格式。
hugging_face 收录
中国1km分辨率逐月降水量数据集(1901-2024)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
Breast Ultrasound Images (BUSI)
小型(约500×500像素)超声图像,适用于良性和恶性病变的分类和分割任务。
github 收录
UAVDT
UAVDT是一个用于目标检测任务的数据集。
github 收录
TCIA: The Cancer Imaging Archive
TCIA: The Cancer Imaging Archive 是一个公开的癌症影像数据库,包含多种癌症类型的影像数据,如乳腺癌、肺癌、脑癌等。数据集还包括相关的临床数据和生物标记物信息,旨在支持癌症研究和临床应用。
www.cancerimagingarchive.net 收录