CNTC Chinese News Text Classification Dataset
收藏数据链接:
官方服务:
资源简介:
The CNTC corpus is a public dataset available on the Baidu PaddlePaddle AI Studio platform, containing 668,854 text samples. It covers multiple news categories, providing comprehensive support for text classification tasks across different domains and making it suitable for various text mining scenarios. The CNTC corpus exhibits a significant imbalance in category distribution.
CNTC语料库(CNTC corpus)是百度飞桨(Baidu PaddlePaddle)AI Studio平台上的公开数据集,包含668,854条文本样本。该语料库涵盖多种新闻类别,可为跨领域文本分类任务提供全面支撑,适用于各类文本挖掘场景,但其类别分布存在显著失衡问题。
提供机构:
figshare创建时间:
2025-01-25



