community-datasets/farsi_news
收藏官方服务:
资源简介:
FarsiNews数据集包含从两个波斯语新闻机构(Hamshahri和RadioFarda)的RSS feed中提取的波斯语新闻数据。该数据集主要用于文本生成和掩码语言建模任务。数据集包含标题、摘要、链接和标签等字段,并分为hamshahri和radiofarda两个子集。
The FarsiNews dataset contains Persian news data extracted from the RSS feeds of two Persian news agencies, Hamshahri and RadioFarda. This dataset is primarily used for text generation and masked language modeling tasks. The dataset includes fields such as title, summary, link, and tags, and is divided into two subsets: hamshahri and radiofarda.
提供机构:
community-datasets原始信息汇总
数据集卡片:FarsiNews
数据集描述
数据集摘要
包含用于机器学习任务,特别是自然语言处理的波斯语(Farsi)数据集。这些数据集是从两个波斯语新闻机构网站的RSS订阅中提取的:
- Hamshahri
- RadioFarda
支持的任务和排行榜
[更多信息需要]
语言
[更多信息需要]
数据集结构
数据实例
[更多信息需要]
数据字段
- title: 字符串类型
- summary: 字符串类型
- link: 字符串类型
- tags: 字符串序列类型
数据分割
- hamshahri:
- 字节数: 1267639
- 示例数: 2203
- radiofarda:
- 字节数: 265252
- 示例数: 284
数据集创建
策划理由
[更多信息需要]
源数据
[更多信息需要]
初始数据收集和规范化
[更多信息需要]
源语言生产者是谁?
[更多信息需要]
注释
[更多信息需要]
注释过程
[更多信息需要]
注释者是谁?
[更多信息需要]
个人和敏感信息
[更多信息需要]
使用数据集的注意事项
数据集的社会影响
[更多信息需要]
偏见的讨论
[更多信息需要]
其他已知限制
[更多信息需要]
附加信息
数据集策展人
[更多信息需要]
许可信息
[更多信息需要]
引用信息
https://github.com/sci2lab/Farsi-datasets
贡献
感谢 @Narsil 添加此数据集。
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,波斯语作为一门资源相对稀缺的语言,其语料库的构建对于推动该语言的机器学习研究具有重要意义。FarsiNews数据集正是基于这一背景,通过从伊朗两大新闻机构——Hamshahri和RadioFarda的RSS订阅源中自动抓取并整理而成。该数据集以原始新闻文本为基础,未经过人工标注或二次加工,属于自发性收集(found)的数据资源。其构建过程体现了对真实新闻语境的忠实还原,旨在为波斯语的语言模型训练与掩码语言建模任务提供基础数据支持。
特点
FarsiNews数据集呈现出鲜明的结构特征与语言专一性。它完全以波斯语(fa)为单一语言,属于单语语料库,规模上涵盖约两千余条样本,分布在hamshahri与radiofarda两个子集中。每条数据包含新闻标题、摘要、原始链接及标签序列,形成多维度的信息结构,尤其标签字段为多标签分类任务提供了潜在支持。该数据集专注于语言建模与掩码语言建模任务,其简洁的字段设计便于研究者快速应用于预训练或微调场景,同时保持了数据的原始新闻属性,有助于捕捉波斯语新闻文本的语体特征与表达模式。
使用方法
使用FarsiNews数据集时,研究者可通过HuggingFace Datasets库直接加载,配置默认设置即可获取hamshahri与radiofarda两个划分的文本数据。该数据集适用于文本生成与掩码语言建模任务,例如基于标题或摘要进行序列预测,或利用标签字段训练多标签分类模型。由于数据未经人工标注,建议在使用前进行必要的预处理,如分词、去噪或标签标准化。此外,结合波斯语特有的拼写与语法规则,可进一步优化模型对波斯语新闻文本的理解能力,从而在低资源语言的自然语言处理研究中发挥其基准语料的价值。
背景与挑战
背景概述
在自然语言处理领域,低资源语言的数据匮乏长期制约着语言模型的泛化能力与地域适应性。FarsiNews数据集由sci2lab团队于近年构建,旨在为波斯语(Farsi)这一拥有逾亿使用者的语言提供标准化的新闻语料资源。该数据集从伊朗主流媒体Hamshahri及国际波斯语媒体RadioFarda的RSS订阅源中采集,涵盖标题、摘要、链接及标签等结构化字段,总计约2500条样本。其核心研究问题聚焦于如何利用有限规模的语料支持语言建模与掩码语言建模任务,从而推动波斯语在文本生成、语义理解等方向的探索。作为波斯语NLP开源生态的早期贡献,该数据集为后续模型预训练与评估提供了基准参考,尤其对中东地区数字化语言资源的建设具有示范意义。
当前挑战
当前FarsiNews数据集面临的首要挑战在于语料规模的局限性,总计不足三千条样本难以支撑深层神经网络的有效训练,限制了其在复杂语言模型上的应用潜力。其次,数据来源仅涵盖两家媒体机构,导致语料风格与话题分布存在显著偏差,可能引入地域性偏见或政治倾向,影响模型的公平性与泛化能力。构建过程中,从RSS订阅源自动抓取新闻虽提高了效率,但缺乏人工校验机制,致使元数据质量参差不齐,部分标签缺失或冗余。此外,波斯语自身的形态复杂性(如阿拉伯语借词、变体拼写)未在预处理中得到充分规范,进一步增加了后续任务中噪声处理的难度。这些挑战共同凸显了低资源语言数据集在规模、多样性与标注质量上的典型困境。
常用场景
经典使用场景
FarsiNews数据集汇聚了来自伊朗两大新闻机构——Hamshahri与RadioFarda的波斯语新闻语料,为自然语言处理领域提供了高质量的单语文本资源。其最经典的使用场景在于语言建模与掩码语言建模任务,研究者可基于该数据集训练或微调波斯语的预训练语言模型,例如通过自回归方式预测新闻标题与摘要的序列分布,或借助掩码策略捕捉上下文的语义关联。该数据集包含标题、摘要、链接及标签等结构化字段,支持无监督学习范式,尤其适合探索波斯语新闻文本的语法结构、词汇模式与主题分布,为低资源语言的神经语言模型研究奠定了坚实基础。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作,包括基于波斯语新闻语料的预训练语言模型ParsBERT的微调优化,以及针对低资源场景的跨语言知识蒸馏框架。研究者利用其多标签结构开发了新闻主题层次分类模型,并引入对比学习范式提升了语义相似度计算的鲁棒性。此外,围绕该数据集涌现了多任务联合学习方案,将语言建模与文本生成任务协同训练,显著改善了波斯语自动摘要的质量。这些工作不仅验证了数据集在低资源语言领域的通用性,还推动了波斯语自然语言处理从基础工具向产业化应用的跨越。
数据集最近研究
最新研究方向
在低资源自然语言处理领域,波斯语新闻语料库的构建与语言模型预训练正成为前沿焦点。FarsiNews数据集汇聚了来自伊朗两大主流媒体Hamshahri与RadioFarda的新闻文本,为波斯语掩码语言建模与文本生成任务提供了宝贵的原始语料。当前研究趋势聚焦于利用此类领域特定数据集微调多语言预训练模型,以提升对波斯语新闻篇章结构与语义理解的深度。该数据集的发布不仅填补了波斯语NLP资源的稀缺缺口,还推动了面向中东地区舆情分析、信息检索及跨语言迁移学习等热点应用的发展,其社会意义在于促进非英语语言在人工智能时代的平等参与。
以上内容由遇见数据集搜集并总结生成



