官方服务:
资源简介:
Polish RoBERTa model pre-trained on KGR10 corpora.
应用场景:
相关数据集
PTMTorrent
PTMTorrent数据集是由普渡大学和洛约拉大学芝加哥分校的研究团队创建,旨在帮助研究者评估和理解预训练模型(PTMs)包。该数据集包含来自5个不同PTM注册中心的15,913个PTM包,总数据量约61TB。数据集通过统一的数据模式进行标准化,便于跨注册中心的数据挖掘。创建过程中,研究团队从多个开放和受限的模型注册中心收集数据,并提供了完整的git克隆,确保数据的完整性和可访问性。PTMTorr
arXiv2023-03-16 更新190
fineweb-edu-10BT-shuffled-for-gpt2
Tokenized Fineweb-edu (10BT, shuffled version) for pre-training GPT2 model.
kaggle2024-07-26 更新100
seungone/ablation1_math_gpt4o_mini
该数据集包含两个主要特征:instruction(指令)和response(响应),均为字符串类型。数据集包含一个训练集(train),其中包含5561个样本,总大小为7702223字节。数据集的下载大小为3515007字节。数据集的配置信息显示,训练集数据文件位于路径data/train-*。
Hugging Face2024-11-25 更新80
PeaTMOSS
PeaTMOSS数据集由普渡大学等研究机构创建,包含281,638个预训练模型(PTMs)的元数据,以及28,575个使用这些模型的开源软件仓库。数据集不仅记录了模型的元数据,还包括了模型在下游应用中的使用情况。通过自动提取模型元数据,如训练数据集、参数和评估指标,增强了数据集的全面性。该数据集为研究PTM供应链提供了基础,有助于理解PTM的开发趋势和文档中的常见不足,以及在软件许可方面的不一致性
arXiv2024-02-01 更新170
medical-mae-pretrained
数据集文件元信息以及数据文件,请浏览“数据集文件”页面获取。 当前数据集卡片使用的是默认模版,数据集的贡献者未提供更加详细的数据集介绍,但是您可以通过如下GIT Clone命令,或者ModelScope SDK来下载数据集 #### 下载方法 :modelscope-code[]{type="sdk"} :modelscope-code[]{type="git"}
魔搭社区2025-06-10 更新100



