kaggle-toxic-annotated|毒性评论分析数据集|自然语言处理数据集
收藏数据集概述
数据集信息
- 数据集名称: Kaggle toxic dataset annotated with gpt-4o-mini
- 数据集大小: 370369620 字节
- 下载大小: 159301273 字节
数据集特征
- id: 字符串类型
- comment_text: 字符串类型
- toxic: 64位整数类型
- severe_toxic: 64位整数类型
- obscene: 64位整数类型
- threat: 64位整数类型
- insult: 64位整数类型
- identity_hate: 64位整数类型
- toxic_commons_label: 结构体类型
- ability_discrimination_reasoning: 字符串类型
- ability_discrimination_score: 64位整数类型
- aggressive_violent_reasoning: 字符串类型
- aggressive_violent_score: 64位整数类型
- gender_sex_discrimination_reasoning: 字符串类型
- gender_sex_discrimination_score: 64位整数类型
- racial_origin_discrimination_reasoning: 字符串类型
- racial_origin_discrimination_score: 64位整数类型
- religious_discrimination_reasoning: 字符串类型
- religious_discrimination_score: 64位整数类型
数据集分割
- train:
- 样本数量: 159570
- 字节数: 190721507
- test:
- 样本数量: 153163
- 字节数: 179648113
配置信息
- 配置名称: default
- 数据文件路径:
- train: data/train-*
- test: data/test-*
- 数据文件路径:

Figshare
Figshare是一个在线数据共享平台,允许研究人员上传和共享各种类型的研究成果,包括数据集、论文、图像、视频等。它旨在促进科学研究的开放性和可重复性。
figshare.com 收录
Global Flood Database (GFD)
全球洪水数据库(GFD)是一个包含全球范围内洪水事件记录的数据集。该数据集提供了详细的洪水事件信息,包括洪水发生的时间、地点、影响范围、受灾人口和财产损失等。数据集的目的是为了支持洪水风险评估、灾害管理和气候变化研究。
global-flood-database.cloudtostreet.info 收录
MeSH
MeSH(医学主题词表)是一个用于索引和检索生物医学文献的标准化词汇表。它包含了大量的医学术语和概念,用于描述医学文献中的主题和内容。MeSH数据集包括主题词、副主题词、树状结构、历史记录等信息,广泛应用于医学文献的分类和检索。
www.nlm.nih.gov 收录
中国1km分辨率逐月平均气温数据集(1901-2024)
该数据为中国逐月平均温度数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。数据单位为0.1 ℃。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
YOLO-dataset
该数据集用于训练YOLO模型,包括分类、检测和姿态识别模型。目前支持v8版本,未来计划支持更多版本。
github 收录