遇见数据集

Arabic-news-daily

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

Arabic News Daily 是一个每日自动更新的阿拉伯语新闻数据集,从 Al Jazeera Arabic、BBC Arabic、RT Arabic 和 Al Arabiya 等主要阿拉伯语新闻来源收集。与其他静态快照数据集不同,该数据集每天增长,持续提供最新鲜的阿拉伯语文本,适用于需要实时语料的研究。每条记录包含以下字段:唯一标识符(id,基于URL的MD5哈希)、标题(title)、清洗后的正文(content)、原始URL(url)、来源名称(source,包括 aljazeera、bbc_arabic、rt_arabic、alarabiya)、发布时间(published_at,RFC 2822格式)和采集时间(collected_at,ISO 8601 UTC时间戳)。数据集通过自动化流水线在每天UTC 03:00更新,规模随时间增长,当前约有一万至十万条样本。该数据集可用于阿拉伯语语言模型预训练/微调、阿拉伯语NLP基准测试、新闻摘要、命名实体识别(阿拉伯语)以及主题分类等任务。采用CC BY 4.0许可证。

Arabic News Daily is a daily automatically updated Arabic news dataset collected from major Arabic news sources such as Al Jazeera Arabic, BBC Arabic, RT Arabic, and Al Arabiya. Unlike other static snapshot datasets, this dataset grows daily, continuously providing the freshest Arabic text, suitable for research requiring real-time corpora. Each record contains the following fields: a unique identifier (id, MD5 hash based on URL), title, cleaned text content, original URL, source name (including aljazeera, bbc_arabic, rt_arabic, alarabiya), publication time (published_at, RFC 2822 format), and collection time (collected_at, ISO 8601 UTC timestamp). The dataset is updated via an automated pipeline daily at 03:00 UTC, with its size growing over time, currently around 10,000 to 100,000 samples. This dataset can be used for Arabic language model pre-training/fine-tuning, Arabic NLP benchmarks, news summarization, named entity recognition (Arabic), and topic classification. It is licensed under CC BY 4.0.

创建时间:
2026-08-01
原始信息汇总

数据集名称:Arabic News Daily 🗞️

数据集简介:这是一个每日更新的阿拉伯语新闻数据集,由系统自动从多家主要阿拉伯语新闻源收集。与静态快照型数据集不同,该数据集会每日增长,适合需要最新阿拉伯语文本的研究工作。

语言与许可证

  • 语言:阿拉伯语(ar)
  • 许可证:CC BY 4.0

数据规模与划分

  • 样本数量:12.2万条(训练集)
  • 数据大小:约140 KB(数据下载大小约63 KB)
  • 规模类别:10K < n < 100K
  • 数据划分:仅包含训练集(train),共122条样本

数据来源 数据集从以下四个主要阿拉伯语新闻源收集:

  • Al Jazeera Arabic(现代标准阿拉伯语)
  • BBC Arabic(现代标准阿拉伯语)
  • RT Arabic(现代标准阿拉伯语)
  • Al Arabiya(现代标准阿拉伯语)

数据集结构 每条记录包含以下字段:

  • id:URL的MD5哈希值
  • title:文章标题
  • content:文章正文(经过清洗处理)
  • url:文章链接
  • source:来源标识(aljazeera | bbc_arabic | rt_arabic | alarabiya)
  • published_at:发布日期(RFC 2822格式)
  • collected_at:收集时间(ISO 8601 UTC时间戳)

更新机制 数据集通过自动化流水线(运行于自托管家庭实验室)于每天UTC时间03:00进行收集和推送更新。

适用任务 该数据集适用于以下NLP任务:

  • 阿拉伯语语言模型预训练/微调
  • 阿拉伯语NLP基准测试
  • 新闻摘要研究
  • 阿拉伯语命名实体识别
  • 主题分类

引用方式 如需引用该数据集,请使用以下BibTeX格式:

bibtex @dataset{unohamza_arabic_news_daily, author = {unohamza}, title = {Arabic News Daily}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/unohamza/Arabic-news-daily} }

搜集汇总
数据集介绍
Arabic-news-daily 数据集图片
构建方式
该数据集由自动化流水线于每日协调世界时03:00从阿拉伯世界四大权威新闻源——半岛电视台阿拉伯语频道、BBC阿拉伯语频道、RT阿拉伯语频道及阿拉比亚电视台——自动采集而成。每条记录囊括新闻标题、经清洗处理的正文内容、原始链接、来源标识、发布时间与采集时间等字段,并以URL的MD5哈希值作为唯一标识,确保数据的完整性与可追溯性。有别于传统静态快照型数据集,此数据集呈现每日持续增长的动态特性,专为需要即时阿拉伯语文本的研究场景精心打造。
特点
该数据集的核心特色在于其具有每日自动更新的时效性优势,弥补了现有阿拉伯语新闻语料库静态僵化的不足。收录文章均采用现代标准阿拉伯语撰写,经由多种来源汇聚,有效提升了数据的多样性与覆盖面。每条记录均包含结构清晰的元数据,便于基于时间与来源进行精细化筛选。目前数据集已涵盖超过一万两千条样本,文本体量达116兆字节,为阿拉伯语自然语言处理研究提供了规模可观且鲜活的资源基础。
使用方法
此数据集具有广泛的应用场景,适用于阿拉伯语语言模型的预训练与微调、自然语言处理任务的基准测试、新闻文本自动摘要的研发、阿拉伯语命名实体识别以及新闻主题分类等多项研究工作。依托其每日更新的特性,研究者和开发者可获取最新动态新闻语料,用于构建和评估对时间敏感的模型及系统。数据集采用CC BY 4.0许可协议,方便学术与商业用途的安全使用,同时建议引用其提供的专属文献条目以示尊重。
背景与挑战
背景概述
Arabic-news-daily数据集由独立研究者unohamza于2026年创建,是一个每日自动更新的阿拉伯语新闻语料库,整合自半岛电视台、BBC阿拉伯语、RT阿拉伯语及阿拉伯卫星电视台四大权威新闻源,覆盖现代标准阿拉伯语。该数据集的核心研究问题在于突破传统静态新闻数据集的局限,为阿拉伯语自然语言处理(NLP)提供持续流动的实时文本资源,支持预训练、微调及基准测试等任务。其动态增长特性填补了阿拉伯语NLP领域对新鲜语料的需求空白,对新闻摘要、命名实体识别及话题分类等研究具有重要推动作用,尤其在低资源语言模型开发中展现了独特价值。
当前挑战
该数据集面临的首要领域挑战是阿拉伯语丰富的形态学与方言多样性,即使聚焦现代标准阿拉伯语,仍需处理复杂的词形变化、拼写变体及多义词,这要求清洗流程高度鲁棒。构建过程中的挑战包括多源采集的实时同步(每日03:00 UTC)、内容去重与噪声过滤以平衡篇幅与质量,以及跨源格式一致性的维护。此外,动态更新的特性对持久化存储、版本控制和长期维护提出了更高要求,确保数据时间戳的准确性及源站结构变化时的适应能力,这些均构成持续的技术与运维挑战。
常用场景
经典使用场景
Arabic-news-daily数据集作为阿拉伯语自然语言处理领域的动态语料库,其核心应用场景在于为阿拉伯语大语言模型的预训练与微调提供持续更新的文本素材。该数据集每日自动采集自多家权威阿拉伯语新闻源,覆盖现代标准阿拉伯语的多样表达,能够有效缓解静态语料在时效性与领域覆盖上的不足。研究者可依托此数据集的动态特性,开展基于时间维度的语言演变分析、新闻文本的实时情感分析、以及面向特定时期的语料增强等研究,为阿拉伯语NLP模型的持续学习与适应提供支撑。
实际应用
在实际应用中,Arabic-news-daily数据集展现出广泛的产业价值。其每日更新的特性使其成为阿拉伯语新闻聚合平台、舆情监测系统及智能推荐引擎的理想训练来源。企业可基于该数据集训练阿拉伯语新闻摘要生成模型,实现关键信息的快速提取;媒体机构可利用其进行自动化的文章分类与关键词标注,提升内容管理效率。此外,该数据集还可用于构建阿拉伯语问答系统,通过从最新新闻中抽取答案,满足用户对时效性信息的需求,从而在智能客服、信息检索等领域产生直接的经济与社会效益。
衍生相关工作
该数据集的独特动态性已催生了一系列开创性工作。基于其每日更新的语料,研究者开发了面向阿拉伯语的时间感知语言模型,用以捕捉新闻事件对语言表达的影响。此外,数据集的多源标签支持了跨媒体叙事差异研究,衍生出关于阿拉伯语新闻偏见评估的基准任务。在文本生成方向,利用其时间序列特性,出现了用于预测新闻趋势的序列到序列模型变体。同时,该数据集也作为阿拉伯语命名实体识别挑战赛的基准数据,促使了多种融合上下文与外部知识库的稳健实体抽取方法的涌现,进一步推动了阿拉伯语NLP生态的繁荣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务