登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
zha_wikipedia_2012
zha_wikipedia_2012
收藏
corpora.uni-leipzig.de
2025-03-25 收录
壮语
维基百科
数据链接:
https://corpora.uni-leipzig.de?corpusId=zha_wikipedia_2012
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Zhuang Wikipedia corpus based on material from 2012
基于2012年资料的壮语维基百科语料库
应用场景:
提供机构:
corpora.uni-leipzig.de
相关数据集
mmnga/wikipedia-ja-20230720-50k
维基百科
日本语应用
该数据集是从[izumi-lab/wikipedia-ja-20230720]中随机抽取的50,000条记录,包含curid、title和text三个特征。数据集分为train分割,下载大小为78354971字节,数据集大小为134082445.03326812字节。
Hugging Face
2023-09-25 更新
18
0
smi_newscrawl_2011
萨米文化
新闻语料库
Sami news corpus based on material crawled in 2011
corpora.uni-leipzig.de
11
0
HuggingFaceFW/clean-wikipedia
维基百科
自然语言处理
这是一个包含多种语言文本数据的数据集,每个配置包含文本、标题、URL、维基代码、ISO 639-3代码和脚本等特征。数据集包含多个语言配置,每个配置都有对应的训练集和下载大小信息。
Hugging Face
2025-10-21 更新
8
0
Symato/KB_wikimedia
维基百科
文本处理
该数据集包含越南语的维基百科和维基文库内容,数据格式为parquet,可以通过提供的链接下载。数据集经过转换处理,最终以jsonl和xz格式存储,每个文件大小控制在50MB以下,便于上传和处理。
Hugging Face
2024-09-27 更新
12
0
Data from: Robust clustering of languages across Wikipedia growth
维基百科
语言集群
Wikipedia is the largest existing knowledge repository that is growing on a genuine crowdsourcing support. While the English Wikipedia is the most extensive and the most researched one with over five
DataONE
2017-09-19 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广