官方服务:
资源简介:
Bolesław Prus
博莱斯瓦夫·普鲁斯
应用场景:
相关数据集
FalconX80/bhoomillama-5.5k
该数据集包含5500个样本,每个样本包含Prompt、Answer和text三个字段,数据类型均为字符串。数据集分为一个训练集,大小为2206576字节。
Hugging Face2024-07-08 更新180
skymizer/fineweb-edu-dedup-45B-4-of-4
该数据集包含文本内容、唯一标识符和元数据等信息。文本内容是数据集的主要部分,每个文本都有一个唯一标识符。元数据提供了关于文本的额外信息,如来源URL、创建日期、文件路径、文本语言及其评分、token数量、分数和整型分数。数据集分为训练集,其大小为55.93GB,共有约1084.21万个示例。数据集的下载大小为32.43GB。
Hugging Face2025-01-11 更新120
catallama/Catalan-Raw-Text
加泰罗尼亚语原始文本数据集是projecte-aina/catalan_general_crawling数据集的一个子集。该数据集包含404k个样本,总计331M个token,使用Llama-3 Tokenizer进行分词。数据集的语言为加泰罗尼亚语(ca-ES),包含两个数据分割:train和test。数据字段为text(字符串类型)。数据集遵循Creative Commons Attribut
Hugging Face2024-05-25 更新220
KaiNylund/arxiv-year-splits
--- dataset_info: features: - name: text dtype: string splits: - name: 2006_2008_train num_bytes: 100484371 num_examples: 120937 - name: 2006_2008_test num_bytes: 10050474
Hugging Face2023-12-04 更新170



