遇见数据集

BBC News Category Dataset

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是一个包含六个新闻文章类别的多类别分类数据集,它被用于测试基于印地语的多种语言模型。其任务是对新闻文章进行多类别分类。

This is a multi-class classification dataset containing six news article categories, designed to evaluate various Hindi-based language models. Its task is to perform multi-class classification on news articles.

提供机构:
GitHub
搜集汇总
数据集介绍
BBC News Category Dataset 数据集图片
背景与挑战
背景概述
BBC Hindi v0.1数据集包含4335个来自BBC印地语新闻网站的文档,每个文档标注有14个唯一类别之一,适用于文本分类任务。数据以CSV和JSON格式提供,包括标签、文本内容及额外信息如URL和标题,需注意使用UTF-8编码加载文件。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务