遇见数据集

heegyu/news-category-balanced-top10

收藏
Hugging Face2023-02-13 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc-by-4.0 --- ### Top10 sampled news category dataset randomly sampled news data original dataset: https://www.kaggle.com/datasets/rmisra/news-category-dataset ### Value Counts per Category ``` ENTERTAINMENT 10000 POLITICS 10000 WELLNESS 10000 TRAVEL 9900 STYLE & BEAUTY 9814 PARENTING 8791 HEALTHY LIVING 6694 QUEER VOICES 6347 FOOD & DRINK 6340 BUSINESS 5992 ```

--- 许可证:知识共享署名4.0(CC BY 4.0) --- ### 十大抽样新闻类别数据集 本数据集为随机抽样获取的新闻数据,原始数据集来源:https://www.kaggle.com/datasets/rmisra/news-category-dataset ### 各类别样本量统计 娱乐(ENTERTAINMENT) 10000 政治(POLITICS) 10000 健康养生(WELLNESS) 10000 旅游(TRAVEL) 9900 时尚与美容(STYLE & BEAUTY) 9814 育儿(PARENTING) 8791 健康生活(HEALTHY LIVING) 6694 酷儿之声(QUEER VOICES) 6347 饮食(FOOD & DRINK) 6340 商业(BUSINESS) 5992

提供机构:
heegyu
原始信息汇总

数据集概述

数据集名称

Top10 sampled news category dataset

数据集描述

随机抽样的新闻数据,原始数据集来源于Kaggle

数据集许可

cc-by-4.0

类别及样本数

  • ENTERTAINMENT: 10000
  • POLITICS: 10000
  • WELLNESS: 10000
  • TRAVEL: 9900
  • STYLE & BEAUTY: 9814
  • PARENTING: 8791
  • HEALTHY LIVING: 6694
  • QUEER VOICES: 6347
  • FOOD & DRINK: 6340
  • BUSINESS: 5992
搜集汇总
数据集介绍
heegyu/news-category-balanced-top10 数据集图片
构建方式
该数据集源自Kaggle上由Rishabh Misra发布的新闻类别数据集,原始数据涵盖数十种新闻主题。为构建一个类别均衡且聚焦于高频话题的子集,研究者从原始语料中筛选出出现频次最高的十个新闻类别,并针对每个类别进行随机抽样。其中,娱乐、政治与健康等七个类别的样本量被设定为10,000条,而旅行、风格与美容等其余类别则因原始数据量限制,分别抽取了9,900至5,992条不等。这一抽样策略在保持数据多样性的同时,显著缓解了类别分布极不均衡的问题。
特点
本数据集最显著的特征在于其类别分布的平衡性。与原始数据集中长尾类别占据主导不同,该版本通过人为控制抽样数量,使得排名前十的新闻类别在样本规模上趋于一致。这种设计极大便利了多类别分类任务的模型训练,避免了模型因数据倾斜而偏向高频类别。此外,数据集涵盖娱乐、政治、健康、旅行、饮食等多元话题,能够支持对新闻文本语义理解与主题辨识能力的全面评估。
使用方法
该数据集以HuggingFace数据集格式发布,用户可通过`load_dataset`函数直接加载使用。加载后,数据以字典形式包含'category'与'headline'等字段,适用于文本分类模型的训练与评测。研究者可将其划分为训练集与验证集,用于监督学习场景下的新闻主题预测。由于类别标签已预先定义且样本量均衡,该数据集特别适合作为基准测试平台,用于比较不同分类算法在新闻领域上的表现差异。
背景与挑战
背景概述
在自然语言处理领域,新闻文本分类是一项基础而关键的任务,其目标在于将海量新闻文章自动归入预定义的类别,以支持信息检索、内容推荐和舆情分析等应用。heegyu/news-category-balanced-top10数据集由研究人员基于Kaggle上的新闻类别数据集精心构建,创建时间可追溯至近年,旨在解决原始数据中类别分布不均衡的问题。该数据集聚焦于十大常见新闻类别,如娱乐、政治、健康等,通过随机采样实现了各类别样本数量的平衡,为新闻分类模型提供了更公平的训练基础。其影响力体现在为多类别文本分类研究提供了标准化基准,推动了算法在类别均衡场景下的性能评估与优化。
当前挑战
该数据集所解决的领域问题在于新闻分类任务中类别不均衡带来的模型偏见,例如原始数据中部分类别样本过少导致分类器倾向多数类。构建过程中的挑战包括:1) 从Kaggle原始数据中筛选并平衡十大类别时,需确保采样策略不丢失关键语义特征,避免人为引入偏差;2) 类别定义存在模糊性,如‘STYLE & BEAUTY’与‘HEALTHY LIVING’可能重叠,需在保持类别独立性的同时进行数据清洗;3) 平衡后样本量有限(如BUSINESS仅5992条),可能限制模型对少数类别深层模式的学习,影响泛化能力。
常用场景
经典使用场景
heegyu/news-category-balanced-top10 数据集聚焦于新闻文本的多类别分类任务,涵盖了娱乐、政治、健康、旅游、时尚、育儿、美食、商业等十大典型新闻主题。该数据集从原始不平衡的新闻语料中精心采样,确保每个类别拥有接近均衡的样本量,为研究者构建鲁棒的文本分类模型提供了标准化的训练与评估基准。在自然语言处理领域,它常被用于验证词嵌入、预训练语言模型及轻量级分类器的性能差异,尤其适合探索类别平衡策略对分类精度的影响。
实际应用
在实际应用中,该数据集可支撑新闻聚合平台的内容自动标签系统,帮助运营方快速将海量实时新闻按主题归类,优化用户个性化推荐。例如,娱乐与政治类别的准确区分能显著提升新闻推送的相关性,而健康与育儿内容的精细分拣则有助于构建垂直领域的知识图谱。此外,它还可用于社交媒体舆情监测中的话题识别,辅助媒体机构分析不同类别新闻的传播模式,从而指导内容生产策略与广告投放的精准定向。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于BERT的新闻主题分类微调实验、利用对比学习增强文本表征的跨类别迁移研究,以及结合类别平衡采样的集成学习方法。研究者还将其与原始不平衡版本对比,提出了动态加权损失函数和自适应数据增强策略。此外,部分工作探索了多标签分类与层次分类的扩展,例如在十大类别基础上构建子类别分类器,或结合命名实体识别提升对政治新闻中人物与事件的关联分析能力。这些工作共同推动了新闻文本理解从粗粒度分类向细粒度语义解析的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务