登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
urd_news_2020
urd_news_2020
收藏
corpora.uni-leipzig.de
2025-03-22 收录
乌尔都语
新闻语料
数据链接:
https://corpora.uni-leipzig.de?corpusId=urd_news_2020
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Urdu news corpus based on material from 2020
基于2020年资料的乌尔都语新闻语料库
应用场景:
提供机构:
corpora.uni-leipzig.de
相关数据集
Ax-to-Grind Urdu
假新闻检测
乌尔都语
Ax-to-Grind Urdu是首个大规模公开的乌尔都语假新闻检测数据集,由武汉大学网络空间安全学院创建。该数据集包含10,083条来自巴基斯坦和印度主流乌尔都语报纸和新闻网站的新闻,涵盖15个不同领域,从2017年至2023年。数据集的创建过程包括从网站抓取新闻,并通过专家记者进行手动标注。该数据集主要用于解决乌尔都语假新闻检测问题,旨在通过提供丰富的多领域数据来提高检测算法的准确性和鲁棒性。
arXiv
2024-03-21 更新
28
0
Dataset-of-Urdu-Abusive-Language
乌尔都语
辱骂语言检测
公开的乌尔都语辱骂语言数据集,数据集通过使用特定乌尔都语辱骂关键词的Tweepy API抓取推文,并由乌尔都语母语者进行标注。数据集经过预处理和清洗,移除了不需要的元素如停用词、标签、提及和URL。数据集平衡,推文长度在10到256个字符之间。
github
2024-03-16 更新
17
0
smi_newscrawl_2011
萨米文化
新闻语料库
Sami news corpus based on material crawled in 2011
corpora.uni-leipzig.de
11
0
Urdu Summary Corpus
乌尔都语
自然语言处理
乌尔都语摘要语料库包含从各种来源收集的50篇文章。从原始HTML文档中仅保留了未格式化的内容文本,移除了所有其他内容。我们为这50篇文章提供了抽象摘要。经过规范化处理后,我们进一步应用了不同的NLP工具对文章进行处理,以生成词性标注、形态分析、词形化和词干提取的文章。
github
2020-02-11 更新
22
0
tur_news_2022
土耳其新闻
文本语料库
Turkish news corpus based on material from 2022
corpora.uni-leipzig.de
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广