登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Random Bulgarian paragraphs
Random Bulgarian paragraphs
收藏
kaggle
2023-04-09 更新
2024-03-08 收录
保加利亚语
Wikipedia
数据链接:
https://www.kaggle.com/datasets/nikitricky/random-bulgarian-paragraphs
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
100K Paragraphs in Bulgarian from Wikipedia
源自维基百科(Wikipedia)的10万个保加利亚语段落
应用场景:
创建时间:
2023-04-09
相关数据集
pinzhenchen/alpaca-cleaned-bg
语言模型调优
保加利亚语
该HF数据仓库包含了用于单语与多语指令调优研究的保加利亚Alpaca数据集。数据集是通过机器翻译从[yahma/alpaca-cleaned](https://huggingface.co/datasets/yahma/alpaca-cleaned)转换而来,主要用于保加利亚语的指令调优。数据集大约包含52K个实例,每个实例包含指令、输出和可选的输入字段。已知问题是机器翻译过程可能损坏了包含代码、
Hugging Face
2024-03-06 更新
86
0
Ti-Ma/wikipedia_2018
Wikipedia
时间序列分析
该数据集是基于截至2018年12月31日的Wikipedia数据构建的。通过选择每年12月31日的最新修订版本,确保数据集反映了每年年底Wikipedia上最新的信息。数据集经过清理,去除了文件链接、强调、注释、缩进、HTML、引用等不需要的特征和属性。数据集适用于历时研究、历史LLM预训练以及需要严格时间划分数据的任务。
Hugging Face
2024-04-26 更新
30
0
Indonesia Wikipedia Pages
Wikipedia
印度尼西亚语
Preprocessed Wikipedia Pages From Wikipedia Database Dump.
kaggle
2023-01-07 更新
12
0
Ti-Ma/wikipedia_2017
Wikipedia
历史数据
这是一个基于Wikipedia的数据集,截止日期为2017年12月31日。数据集包含了每年12月31日的最新修订版本,即使某些页面的修订日期早于目标日期,这些页面在截止日期时被认为是当前版本。数据集经过清理,去除了文件链接、强调、评论、缩进、HTML、引用等不需要的特征和属性。数据集适用于历时研究、历史LLM预训练以及需要严格时间分区数据的任务。
Hugging Face
2024-04-26 更新
69
0
wikilite
Wikipedia
离线搜索
该数据集提供了预处理的SQLite数据库,用于Wikilite工具,支持离线搜索和访问Wikipedia内容。支持的语言包括撒丁语、意大利语、西班牙语和英语。数据集结构为每种语言存储为一个单独的压缩文件。使用方法包括下载、解压缩数据库、安装Wikilite、运行Wikilite以及访问Web界面。Wikilite工具具有快速灵活的词汇搜索、增强的语义搜索、离线访问、命令行界面和Web界面等功能。
Hugging Face
2024-12-30 更新
23
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广