遇见数据集

CNTC Chinese News Text Classification Dataset

收藏
DataCite Commons2025-06-01 更新2025-05-07 收录
官方服务:

资源简介:

The CNTC corpus is a public dataset available on the Baidu PaddlePaddle AI Studio platform, containing 668,854 text samples. It covers multiple news categories, providing comprehensive support for text classification tasks across different domains and making it suitable for various text mining scenarios. The CNTC corpus exhibits a significant imbalance in category distribution.

CNTC语料库(CNTC corpus)是百度飞桨(Baidu PaddlePaddle)AI Studio平台上的公开数据集,包含668,854条文本样本。该语料库涵盖多种新闻类别,可为跨领域文本分类任务提供全面支撑,适用于各类文本挖掘场景,但其类别分布存在显著失衡问题。

提供机构:
figshare
创建时间:
2025-01-25
二维码
社区交流群
二维码
科研交流群
商业服务