登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
The Pile Small
The Pile Small
收藏
kaggle
2023-11-27 更新
2024-03-07 收录
模型预训练
通用数据集
数据链接:
https://www.kaggle.com/datasets/thedevastator/text-and-meta-data-analysis
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
A dataset for pretraining general models
用于预训练通用模型的数据集
应用场景:
创建时间:
2023-11-27
相关数据集
c2
自然语言处理
模型预训练
Common Crawl WET数据集 - c2是一个从Common Crawl项目的WET文件派生出来的大规模过滤数据集。数据经过清洗和汇总,以支持大规模的自然语言处理任务,尤其是大型语言模型(LLM)的预训练。数据集来源于2025年9月的Common Crawl CC-MAIN-2025-38抓取。数据类型是从网络抓取的WET文件中提取的纯文本,经过了激进的元数据和模板内容的过滤。每个组合文件
Hugging Face
2025-10-24 更新
26
0
EfficientNetV2
深度学习
模型预训练
Pretrained EfficientNetV2 Checkpoints
kaggle
2021-05-15 更新
12
0
AbstractPhil/diffusion-pretrain-set-ft1
模型预训练
图像-文本结构化标注
diffusion-pretrain-set-ft1 是一个多源图像-文本预训练数据集,从十个上游来源(big_liminal、deepfashion、ffhq、flux_assorted_bulk、flux_assorted_bulk_2、imagenet_synthetic、imdb、mannequins_v7、mannequins_v10、synth_chars)通过统一的数据处理流程整合而
Hugging Face
2026-05-27 更新
10
0
Pyramid Feature Attention Net Pre-trained Weights
计算机视觉
模型预训练
Pre-trained Model Checkpoints for Feature Pyramid Feature Attention Network
kaggle
2020-11-06 更新
16
0
deberta
自然语言处理
模型预训练
pretrain_deberta_large
kaggle
2022-02-09 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广