登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Haradi Coding Model — Pretraining Data
Haradi Coding Model — Pretraining Data
收藏
kaggle
2026-08-04 更新
2026-08-19 收录
自然语言模型预训练
英文语料库
数据链接:
https://www.kaggle.com/datasets/haradibots/haradi-coding-model-pretraining-data
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
This dataset contains a cleaned English natural-language corpus prepared for pre
应用场景:
创建时间:
2026-08-04
相关数据集
sohey1024/miracl-en-corpus
自然语言处理
英文语料库
该数据集包含文档的标识符(doc_id)、标题(title)和文本内容(text),共分为训练集一个部分,包含33689个示例。数据集的总大小为26308521字节,下载大小为16401738字节。具体的数据集内容描述在README文件中未提供。
Hugging Face
2025-10-14 更新
13
0
英文励志语录
励志
英文语料库
随机返回励志英文语录
腾讯云市场
8
0
HizkiaJ/qed_sermon_100k
宗教布道文本
英文语料库
--- license: apache-2.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data
Hugging Face
2026-03-27 更新
2
0
ameykaran/english-text-corpus
英文语料库
自然语言处理
这是一个英文文本语料库,通过从IndicCorpV2英文语料库中收集和清洗数据而形成。数据集包含验证集、测试集和训练集,分别存储在不同的JSON Lines文件中。
Hugging Face
2025-09-16 更新
10
0
Lexora NLP Training Dataset
语言模型预训练
英文语料库
8.3M cleaned English sentences for NLP and GPT model training.
kaggle
2026-03-15 更新
2
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广