登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Wiki train - 34 categories
Wiki train - 34 categories
收藏
B2FIND
2026-04-29 收录
维基百科文本
多类别文档归类
数据链接:
https://b2find.eudat.eu/dataset/716378f6-05b7-56a9-8890-af12847c3123
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Wikipedia, 34 kategorie - zbiór do uczenia klasyfikatora
维基百科(Wikipedia)34类别数据集——用于分类器训练
应用场景:
相关数据集
agentlans/wikipedia-paragraphs-complete
维基百科文本
文本生成
该数据集包含了长度在1,000到8,000字符之间的英文维基百科段落。数据集经过清理和标准化,并使用Snowflake的snowflake-arctic-embed-xs嵌入进行了聚类处理,提供了多种不同数量的聚类配置。
Hugging Face
2025-08-21 更新
14
0
lucadiliello/english_wikipedia
维基百科文本
自然语言处理
--- dataset_info: features: - name: filename dtype: string - name: maintext dtype: string - name: source_domain dtype: string - name: title dtype: string - name: url dt
Hugging Face
2022-12-04 更新
10
0
Sifal/KabyleWikipedia
低资源自然语言处理
维基百科文本
--- license: cc ---
Hugging Face
2023-05-30 更新
8
0
AMead10/lvl_5_vital_wikipedia_articles_split
维基百科文本
文本分割
该数据集是[level 5 vital wikipedia articles](https://huggingface.co/datasets/AMead10/lvl_5_vital_wikipedia_articles)的文本分割版本。文本在` `处被分割,并且移除了长度小于10个单词的实例以避免标题。
Hugging Face
2024-04-10 更新
13
0
anhtn/wiki_vn
越南语语料库
维基百科文本
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 847557340 num_examples: 578603 - name: test num_bytes: 2133617 num_examples: 1454
Hugging Face
2026-03-20 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广