新闻分类
收藏资源简介:
本文中所用的数据集清华NLP组提供的THUCNews新闻文本分类数据集的一个子集(原始的数据集大约74万篇文档,训练起来需要花较长的时间)。 本次训练使用了其中的体育, 财经, 房产, 家居, 教育, 科技, 时尚, 时政, 游戏, 娱乐10个分类,每个分类6500条,总共65000条新闻数据。每个分类6500条,总共65000条新闻数据。数据集划分如下: cnews.train.txt: 训练集(50000条) cnews.val.txt: 验证集(5000条) cnews.test.txt: 测试集(10000条)
The dataset utilized in this paper is a subset of the THUCNews news text classification dataset provided by the Tsinghua University NLP Group. The original dataset contains approximately 740,000 documents, which requires a long training time. For this training task, we selected 10 categories from the dataset: sports, finance, real estate, home furnishing, education, technology, fashion, current politics, games, and entertainment, with 6,500 samples per category, resulting in a total of 65,000 news data samples. The dataset is split as follows: - cnews.train.txt: training set (50,000 samples) - cnews.val.txt: validation set (5,000 samples) - cnews.test.txt: test set (10,000 samples)




