登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Indonesia Wikipedia Pages
Indonesia Wikipedia Pages
收藏
kaggle
2023-01-07 更新
2024-03-07 收录
Wikipedia
印度尼西亚语
数据链接:
https://www.kaggle.com/datasets/greegtitan/indonesia-wikipedia-pages
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Preprocessed Wikipedia Pages From Wikipedia Database Dump.
源自维基百科数据库转储的预处理维基百科页面
应用场景:
创建时间:
2022-12-02
相关数据集
SEACrowd/nerp
实体识别
印度尼西亚语
NERP数据集(Hoesen和Purwarianti,2018)包含从多个印度尼西亚新闻网站收集的文本,具有五个标签:PER(人名)、LOC(地名)、IND(产品或品牌名称)、EVT(事件名称)和FNB(食品和饮料名称)。NERP数据集使用IOB分块格式,类似于TermA数据集。该数据集主要用于命名实体识别任务。
Hugging Face
2024-06-24 更新
41
0
SEACrowd/indonli
自然语言处理
印度尼西亚语
该数据集名为Indonli,专为自然语言推理(NLI)任务设计,特别针对印尼语。它通过明确包含各种语言现象(如数值推理、结构变化、习语、时间和空间推理)来提供一个具有挑战性的测试平台。数据集支持的任务是文本蕴含(Textual Entailment)。
Hugging Face
2024-06-24 更新
24
0
SEACrowd/singgalang
实体识别
印度尼西亚语
Singgalang是一个基于规则的印尼语命名实体识别(NER)数据集,包含48,957个句子或1,478,286个标记。标注遵循Stanford-NER格式,涵盖Person、Organisation和Place三个NER标签。数据集由41,297、14,770和82,179个实体标记组成,分别来自14、6和5条规则。数据集支持的任务是命名实体识别,并提供了使用`datasets`和`seacr
Hugging Face
2024-06-24 更新
22
0
Ti-Ma/wikipedia_2018
Wikipedia
时间序列分析
该数据集是基于截至2018年12月31日的Wikipedia数据构建的。通过选择每年12月31日的最新修订版本,确保数据集反映了每年年底Wikipedia上最新的信息。数据集经过清理,去除了文件链接、强调、注释、缩进、HTML、引用等不需要的特征和属性。数据集适用于历时研究、历史LLM预训练以及需要严格时间划分数据的任务。
Hugging Face
2024-04-26 更新
30
0
wikilite
Wikipedia
离线搜索
该数据集提供了预处理的SQLite数据库,用于Wikilite工具,支持离线搜索和访问Wikipedia内容。支持的语言包括撒丁语、意大利语、西班牙语和英语。数据集结构为每种语言存储为一个单独的压缩文件。使用方法包括下载、解压缩数据库、安装Wikilite、运行Wikilite以及访问Web界面。Wikilite工具具有快速灵活的词汇搜索、增强的语义搜索、离线访问、命令行界面和Web界面等功能。
Hugging Face
2024-12-30 更新
23
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广