登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Gargaz/Wikipedia
Gargaz/Wikipedia
收藏
Hugging Face
2025-01-29 更新
2025-02-15 收录
维基百科数据
数据链接:
https://hf-mirror.com/datasets/Gargaz/Wikipedia
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
Gargaz
相关数据集
KILT Wikipedia
自然语言处理
维基百科数据
该数据集是通过将维基百科文章分割成100个单词的片段(对于非空白分隔的语言,则是100个Unicode字符),并在每个片段前加上文章标题来构建的。这种方法特别适用于多语言环境下的检索增强生成任务,该数据集已被用于多项语言的检索实验研究中。
arXiv
15
0
sdananya/wiki_data_with_label_chunk_26
维基百科数据
文本分类
该数据集包含文章的标题(title)、正文(text)、链接(url)、维基百科ID(wiki_id)、浏览量(views)、段落数(paragraph_id)、语言类型(langs)、嵌入向量(emb)、关键词(keywords)和标签(labels)等信息。数据集分为训练集,共有1000个示例,大小为4511738字节。
Hugging Face
2025-02-13 更新
12
0
Gargaz/llama_2
--- license: apache-2.0 ---
Hugging Face
2024-03-30 更新
9
0
Yusser/m_sae_wiki_tokenized
自然语言处理
维基百科数据
该数据集包含整数序列特征,适用于训练任务。它有一个训练集,包含超过560万个示例,总大小约为23.1GB。数据集提供了一个默认配置文件,用于指定训练数据的文件路径。
Hugging Face
2025-02-17 更新
14
0
rajeshradhakrishnan/malayalam_2020_wiki
自然语言处理
维基百科数据
��T h i s d a t a s e t i s f r o m t h e c o m m o n - c r a w l - m a l a y a l a m r e p o : h t t p s : / / g i t h u b . c o m / q b u r s t / c o m m o n - c r a w l - m a l a y a
Hugging Face
2022-07-04 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广