遇见数据集

nepali-news-dataset

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是一个自动聚合、每4小时更新一次的尼泊尔语和英语新闻数据集,包含超过15,000篇全文新闻文章,且数量持续增长。数据来源包括Ekantipur(कान्तिपुर)、Nagarik News(नागरिक दैनिक)、The Kathmandu Post和News24 Nepal(न्युज २४)四个新闻门户。每条记录包含标题、摘要(正文)、来源、语言(尼泊尔语代码np或英语代码en)、原文链接、图片链接、发布日期和抓取时间戳。数据集采用UTF-8天城文编码,遵循MIT开源协议。适用于文本分类(如主题分类)、新闻摘要、新闻标题生成、特征提取等自然语言处理任务。用户可通过Hugging Face datasets库直接加载,也可通过无认证、无速率限制的API端点获取实时或历史数据。

This dataset is an automatically aggregated, updated every 4 hours Nepali and English news dataset, containing over 15,000 full-text news articles and growing. Data sources include four news portals: Ekantipur (कान्तिपुर), Nagarik News (नागरिक दैनिक), The Kathmandu Post, and News24 Nepal (न्युज २४). Each record contains title, summary (body), source, language (Nepali code np or English code en), original link, image link, publication date, and crawl timestamp. The dataset is encoded in UTF-8 Devanagari script and follows the MIT open-source license. It is suitable for NLP tasks such as text classification (e.g., topic classification), news summarization, news headline generation, and feature extraction.

创建时间:
2026-08-24
原始信息汇总

🇳🇵 Nepali News Dataset & NLP Corpus 数据集详情

数据集概述

该数据集是一个开放获取的尼泊尔语和英语新闻数据集,专为自然语言处理(NLP)和机器学习任务设计,包含15,000+篇全文新闻文章,并通过自动化管道每4小时更新一次。

基本信息

  • 语言:尼泊尔语(np/ne)和英语(en),采用干净的UTF-8天城文(Devanagari)编码
  • 许可证:MIT License
  • 数据规模:10K < n < 100K
  • 多语言性:多语言(multilingual)
  • 标注方式:无人工标注(no-annotation)
  • 数据来源:原始数据(original)

数据字段结构

每条数据记录包含以下字段:

字段 类型 描述
title string 新闻标题(尼泊尔语天城文或英语)
summary string 文章完整多段落正文
source string 新闻门户来源(Ekantipur、KathmanduPost、NagarikNews、News24)
language string 语言代码(np为尼泊尔语,en为英语)
source_url string 文章原始链接
image_url string 特色缩略图/照片URL
date string 发布快照日期(YYYY-MM-DD格式)
scraped_at string 文章抓取时的ISO时间戳

数据来源(支持的新闻门户)

门户 语言 更新频率 网站
Ekantipur(कान्तिपुर) 尼泊尔语(np 每4小时 https://ekantipur.com
Nagarik News(नागरिक दैनिक) 尼泊尔语(np 每4小时 https://nagariknews.nagariknetwork.com
The Kathmandu Post 英语(en 每4小时 https://kathmandupost.com
News24 Nepal(न्युज २४) 尼泊尔语(np 每4小时 https://news24nepal.com

适用任务

该数据集支持以下NLP任务:

  • 文本分类(主题分类)
  • 摘要生成(新闻文章摘要)
  • 特征提取
  • 新闻标题生成

数据配置与访问

  • 配置名称default
  • 数据文件data/train.parquet(训练集)
  • 数据集大小分类:10K < n < 100K

数据更新机制

数据通过GitHub Actions自动化管道每4小时自动抓取和更新,支持实时和历史数据访问。用户可通过Hugging Face原始端点(raw endpoints)获取当日实时新闻和历史每日存档数据,无需身份验证且无速率限制。

搜集汇总
数据集介绍
nepali-news-dataset 数据集图片
构建方式
在尼泊尔数字化媒体蓬勃发展的背景下,该数据集通过自动化GitHub Actions管道,以每四小时为周期从Ekantipur、Nagarik News、Kathmandu Post及News24 Nepal等主流新闻门户持续采集全文文章。采集过程遵循原始发布结构,涵盖标题、多段落正文、来源网站、语言标识、原文链接、配图地址、出版日期及抓取时间戳等字段,经UTF-8编码清洗后以Parquet格式存储,构建起规模逾一万五千篇、且不断扩增的双语新闻语料库,全程无需人工标注,保障了数据的时效性与可复现性。
使用方法
研究者可借助Hugging Face datasets库以单行代码加载完整语料,亦可通过原始端点直接获取实时或历史JSON数据,无需认证与速率限制。加载后利用filter函数即可按语言字段筛选尼泊尔语或英语子集,结合字段映射抽取标题与正文用于摘要或标题生成任务;同时可依托数据集服务器的无服务查询接口,以分页方式获取指定行数据,灵活支撑文本分类、主题识别及特征提取等下游实验的快速迭代与验证。
背景与挑战
背景概述
尼泊尔语作为低资源语言,长期缺乏大规模、高质量且可持续更新的新闻语料,制约了该语言在自然语言处理领域的发展。该数据集由独立研究者Gaurav Giri创建并维护,依托自动化管道每四小时从Ekantipur、Nagarik News、The Kathmandu Post及News24 Nepal等主流媒体聚合逾一万五千篇尼泊尔语与英语全文文章,以MIT许可开放。其核心研究问题在于为尼泊尔语文本分类、摘要生成及特征抽取等任务提供标准化基准,填补了德瓦纳加里文编码资源空白,对推动多语言NLP研究与南亚语言技术生态具有奠基性意义。
当前挑战
在领域问题层面,尼泊尔语新闻处理面临形态丰富、语码混合普遍、标注资源稀缺等固有困难,现有模型难以直接迁移至高资源语言范式。构建过程中,挑战集中于异构新闻门户的网页结构差异与非标准化德瓦纳加里文编码,需持续适配解析规则以保障全文抽取的完整性;自动化管道每四小时高频抓取对去重、时效对齐与存储稳定性提出严苛要求;多源数据的版权合规与内容过滤亦构成持续运营压力。此外,摘要字段实为全文的设定虽利于摘要任务,却使标题生成等任务缺乏精炼参考,需依赖模型自行归纳。
常用场景
经典使用场景
在低资源语言自然语言处理研究中,尼泊尔语新闻数据集作为典型的文本分类与摘要生成语料库,常被用于训练和评估主题分类、新闻摘要及标题生成模型。研究者依托其涵盖埃坎蒂普尔、加德满都邮报等主流媒体的多源文本,构建基准测试,以检验模型在德瓦纳格里文字与英文混合语境下的表征学习能力,并借助其持续更新的时间序列特性开展动态语言建模实验。
解决学术问题
该数据集缓解了尼泊尔语及尼英双语自然语言处理资源匮乏的困境,为跨语言迁移学习、低资源文本摘要和主题分类提供了标准化基准。其定期自动采集机制保障了语料的时效性与规模增长,使研究者得以探究新闻文本中的语言演变与事件演化规律,对推动南亚语言计算研究具有基础性意义,并促进了多语言预训练模型在真实新闻场景中的公平评估。
实际应用
在传媒监测与信息检索领域,该数据集支撑新闻聚合平台的内容自动分类、摘要生成与标题推荐,帮助读者快速获取尼泊尔语及英文新闻要点。其零配置API接口便于开发者实时获取最新资讯,用于构建舆情分析、多语言新闻推送及媒体偏见检测系统,亦可服务于面向尼泊尔语使用者的智能助手与教育工具,提升信息获取效率。
数据集最近研究
最新研究方向
在低资源语言自然语言处理日益受到重视的背景下,nepali-news-dataset凭借其高频更新机制与多源异构新闻聚合能力,正推动尼泊尔语信息抽取与跨语言理解研究向纵深发展。当前前沿方向聚焦于基于该数据集构建尼泊尔语新闻主题分类、摘要生成及标题生成的基准评测体系,同时借助其尼英双语平行特性探索低资源场景下的跨语言迁移学习与多语言预训练模型微调策略。该数据集每四小时自动更新的实时数据流,为虚假新闻检测、事件演化追踪等时效敏感型任务提供了稀缺的动态语料资源,对南亚区域媒体监测与计算社会科学研究具有显著的支撑价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务