遇见数据集

gluclose-D/nepali-news-scraped

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- language: - ne license: cc-by-nc-4.0 tags: - news - low-resource-language - nepali-nlp - text-classification - scraped - text-generation pretty_name: Scraped Nepali News Corpus for Low-Resource NLP size_categories: - 10K<n<100K --- # Scraped Nepali News Corpus for Low-Resource NLP ## Dataset Description This dataset is a curated collection of text scraped from prominent Nepalese news portals, including **Kantipur, Gorkhapatra, Setopati**, and others. Nepali (`ne`) is historically classified as a **low-resource language** in Natural Language Processing (NLP) due to the scarcity of high-quality, cleanly formatted, and large-scale textual corpora available for training modern machine learning models. This repository aims to bridge that gap by providing a clean, tabular dataset of contemporary Devanagari text suitable for training tokenizer vocabularies, fine-tuning language models (like BERT, DeBERTa, or LLaMA variants via QLoRA), and evaluating downstream text classification tasks. ### Dataset Details - **Language:** Nepali (नेपाली) - **Script:** Devanagari - **Data Source Portals:** Kantipur (इकान्तिपुर), Gorkhapatra (गोरखापत्र), Setopati (सेतोपाटी), and alternative mainstream portals. - **Format:** .txt --- ## Intended Uses & Applications This corpus is highly valuable for researchers and developers working on South Asian language technologies, specifically targeting: 1. **Custom Tokenization:** Training subword tokenizers (Byte-Pair Encoding, Unigram) to optimize token efficiency for the Nepali script. 2. **Masked Language Modeling (MLM):** Pre-training or domain-adapting Transformer models on clean Nepali prose. 3. **Downstream Classification:** Categorizing news into sectors such as Politics (राजनीति), Sports (खेलकुद), Economy (अर्थतन्त्र), and Entertainment (मनोरञ्जन). 4. **Text Summarization:** Using pairs of titles and body text to fine-tune sequence-to-sequence models. --- ## Data Cleaning & Preprocessing Notice * **Encoding:** Fully standardized to `UTF-8` to preserve accurate Devanagari Unicode rendering without corruption. * **Noise Reduction:** Standard web scrapers introduce HTML tags, Javascript fragments, and navigation breadcrumbs; this dataset has undergone structural filtering to ensure only raw, readable news text remains. ## Licensing & Attribution This dataset is intended primarily for **academic and research purposes** under the Creative Commons Attribution-NonCommercial 4.0 International (`cc-by-nc-4.0`) license. The intellectual property of the individual articles belongs entirely to their respective original publishers (Kantipur Media Group, Gorkhapatra Sansthan, Setopati Media, etc.). Users of this dataset must respect the copyright guidelines of the original news portals.

This dataset is a curated collection of text scraped from prominent Nepalese news portals, including Kantipur, Gorkhapatra, Setopati, and others. Nepali is historically classified as a low-resource language in Natural Language Processing due to the scarcity of high-quality, cleanly formatted, and large-scale textual corpora. This repository bridges that gap by providing a clean, tabular dataset of contemporary Devanagari text suitable for training tokenizer vocabularies, fine-tuning language models (like BERT, DeBERTa, or LLaMA variants via QLoRA), and evaluating downstream text classification tasks. The dataset is in Nepali language, uses Devanagari script, is formatted as .txt files, and has been standardized to UTF-8 encoding with noise reduction to retain only raw, readable news text.

提供机构:
gluclose-D
搜集汇总
数据集介绍
gluclose-D/nepali-news-scraped 数据集图片
构建方式
尼泊尔语(Nepali)作为低资源语言,其自然语言处理发展长期受限于高质量文本语料的匮乏。为应对这一挑战,本数据集通过系统性地从Kantipur、Gorkhapatra、Setopati等主流尼泊尔新闻门户网站抓取文本内容,构建了一个结构化且清洁的新闻语料库。数据采集后,经过严格的预处理流程,包括统一标准化为UTF-8编码以保障天城文(Devanagari)字符的完整呈现,以及通过结构性过滤去除HTML标签、JavaScript片段等网络抓取带来的噪声信息,最终仅保留纯净的新闻正文文本,并以.txt格式存储。
使用方法
研究者可直接将数据集用于多种NLP任务的开发与评估。在分词器训练方面,可利用其纯净文本优化子词词表,提升尼泊尔语脚本的编码效率。对于预训练场景,可将数据用于掩码语言模型的领域适应性训练。在文本分类任务中,数据已隐含新闻主题标签,可作为监督学习的基准。此外,其标题与正文的天然对结构,使其适合用于开发序列到序列的文本摘要模型。数据集遵循CC-BY-NC 4.0许可,仅限学术研究使用,使用时需尊重原始新闻媒体的版权规定。
背景与挑战
背景概述
尼泊尔语(नेपाली)作为一种低资源语言,在自然语言处理领域长期面临高质量标注语料匮乏的困境。为缓解这一瓶颈,研究人员于近年构建了名为nepali-news-scraped的数据集,该数据集由来自Kantipur、Gorkhapatra、Setopati等主流尼泊尔新闻门户的文本构成,采用天城体(Devanagari)书写体系,涵盖政治、体育、经济及娱乐等多类别新闻内容。该语料库的创立,旨在为低资源语言NLP研究提供经过标准化清洗的现代语料,支撑子词分词器训练、掩码语言模型预微调及下游文本分类任务,显著推动了南亚语言技术的学术探索与应用发展。
当前挑战
该数据集所应对的核心挑战源自尼泊尔语作为低资源语言的天然局限,包括高质量、大规模且格式规范文本的极度稀缺,这使得传统机器学习和深度学习模型难以获得充足的训练数据。同时,在构建过程中,需克服网络爬虫引入的HTML标签、JavaScript片段及导航面包屑等噪声干扰,确保UTF-8编码下天城体Unicode字符的无损渲染。此外,数据集的收集还面临多来源新闻门户之间格式不统一、领域标签不完整以及遵守原始出版商版权政策的合规性难题,进一步增加了语料整理与公开分发的复杂性。
常用场景
经典使用场景
在自然语言处理领域,尼泊尔语作为低资源语言长期面临大规模高质量语料匮乏的困境。该数据集从坎蒂普尔、戈拉卡帕特拉、塞托帕蒂等主流尼泊尔新闻门户网站爬取并清洗出十万量级的纯文本语料,为研究者提供了标准化的梵文字符编码语料库。其典型应用场景包括构建针对尼泊尔语的子词分词器、开展掩码语言模型预训练,以及监督式微调Transformer架构模型。数据集以新闻标题与正文的结构化组合形式,天然适用于文本摘要生成任务,同时新闻主题分类标签的缺失也为无监督或半监督分类方法的研究提供了理想平台。数据集的发布标志着尼泊尔语NLP研究迈入可复现、可规模化验证的新阶段。
解决学术问题
该数据集精准回应了低资源语言自然语言处理中两大核心痛点:一是高质量训练数据的稀缺性,二是跨语言模型适配时因字符复杂度导致的词表效率低下。在学术层面,它使研究者能够系统性地开展尼泊尔语领域的多项基础性探索,包括基于字节对编码或单子词算法的词表压缩优化、针对南亚语系形态丰富性的预训练策略设计,以及在有限监督信号下的文本分类鲁棒性分析。通过提供统一编码格式的当代尼泊尔语语料,数据集有效降低了因网页噪声、编码错误等共性问题带来的实验偏差风险,从而为低资源场景下的迁移学习与域适应研究提供了可靠基准,显著提升了相关学术结论的可信度与可迁移性。
实际应用
在实际应用层面,该数据集为南亚区域语言技术落地提供了关键基础设施。新闻媒体机构可利用其构建自动新闻分类系统,实现政治、经济、体育等栏目的智能归档;教育科技公司可基于语料库训练面向尼泊尔母语者的智能写作助手,辅助检查语法正确性与文风一致性。对于社交平台内容审核场景,该数据集支撑的文本分类模型能够有效识别并过滤尼泊尔文信息流中的违规内容。此外,新闻摘要功能在移动新闻聚合应用中具有明确商业价值,可帮助用户在流量受限环境下快速获取要点信息。数据集采用的非商业许可协议既保障了学术自由探索空间,又为产学研合作预留了合规边界。
数据集最近研究
最新研究方向
在当前低资源语言自然语言处理的前沿探索中,该数据集专注于为尼泊尔语这一典型低资源语言构建高质量语料库,以突破其因数据匮乏而导致的技术瓶颈。近期研究热点集中于利用此语料对预训练语言模型(如BERT、DeBERTa及基于QLoRA微调的LLaMA变体)进行领域自适应与掩码语言建模,从而提升模型对天城文新闻文本的语义理解能力。同时,研究方向已延伸至下游任务如新闻主题分类(政治、体育、经济等)及文本摘要生成,旨在验证该数据集在推动南亚语言智能信息处理中的关键作用,其意义在于为低资源语言NLP社区提供可复现的基准资源,促进语言技术的民主化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务