toutiao-text-classfication-dataset|文本分类数据集|新闻数据数据集
收藏中文文本分类数据集概述
数据来源
- 今日头条客户端
数据格式
- 每条数据包含五个字段,以
_!_
分割,分别为:新闻ID、分类code、分类名称、新闻标题、新闻关键词。
分类信息
- 共有15个分类,每个分类对应一个code和名称,例如:
- 100: 民生故事 (news_story)
- 101: 文化文化 (news_culture)
- 102: 娱乐娱乐 (news_entertainment)
- 103: 体育体育 (news_sports)
- 104: 财经财经 (news_finance)
- 106: 房产房产 (news_house)
- 107: 汽车汽车 (news_car)
- 108: 教育教育 (news_edu)
- 109: 科技科技 (news_tech)
- 110: 军事军事 (news_military)
- 112: 旅游旅游 (news_travel)
- 113: 国际国际 (news_world)
- 114: 证券股票 (stock)
- 115: 农业三农 (news_agriculture)
- 116: 电竞游戏 (news_game)
数据规模
- 总计382688条数据,分布于上述15个分类中。
采集时间
- 2018年05月
实验结果
- 分类实验结果如下:
- 平均准确率(precision)、召回率(recall)和F1分数(f1-score)为84%。
- 部分分类的性能较低,主要原因是数据不均衡和分类之间的模糊性。
后续优化建议
- 增加数据量
- 完善分类体系
- 平衡各类别数据量
- 引入新闻正文内容

中国1km分辨率逐月降水量数据集(1901-2024)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
安徽新能源汽车产业链图谱企业名单数据
根据安徽新能源产业链上下游特点。将安徽新能源产业分为发、储、送、 运共计95个产业链节点。依托佰腾专利大数据资源,将涉及节点的企业进行分类上链,产业链节点上显示的是涉及节点产品的所有企业的详情,通过产业链图谱企业数据集可以精准把握产业链上下游产品节点及链主、伙伴角色,深度挖掘产业链中企业、高校、专家、专利的关联关系,精准匹配产业链产品�
安徽省数据知识产权登记平台 收录
中国近海台风路径集合数据集(1945-2024)
1945-2024年度,中国近海台风路径数据集,包含每个台风的真实路径信息、台风强度、气压、中心风速、移动速度、移动方向。 数据源为获取温州台风网(http://www.wztf121.com/)的真实观测路径数据,经过处理整合后形成文件,如使用csv文件需使用文本编辑器打开浏览,否则会出现乱码,如要使用excel查看数据,请使用xlsx的格式。
国家海洋科学数据中心 收录
Natural Questions
Natural Questions (NQ) 包含真实用户向Google搜索提出的问题,以及注释者从维基百科找到的答案。NQ旨在用于训练和评估自动问答系统。
github 收录
ISCX-VPN-NonVPN-2016
该数据集包含VPN和非VPN流量的网络流量数据,用于网络流量分类和分析。数据集包括多种网络协议和应用的流量,旨在帮助研究者开发和评估网络流量分类算法。
www.unb.ca 收录