官方服务:
资源简介:
<p>x美术馆人文图书馆书目文化数据集,可应用在自然语言处理(NLP)、文本分类、信息检索、知识图谱构建等方面。</p>
应用场景:
创建时间:
2023-11-16
相关数据集
RylanSchaeffer/collapse_gemma-2-9b_hs2_accumulate_iter2_sftsd0_temp1_max_seq_len512
该数据集包含两个主要特征:prompt(提示)和response(响应),均为字符串类型。数据集包含一个训练集(train),其中包含12531个样本,总大小为15358934字节。下载大小为904870字节,数据集总大小为15358934字节。数据集的配置文件指定了默认配置,数据文件路径为data/train-*。
Hugging Face2024-11-24 更新60
The Finnish Sub-corpus of the JRC-Acquis Multilingual Parallel Corpus, Downloadable Version
This is the legal subcorpus of the [Helsinki Korp Version of the Finnish TreeBank 3](http://urn.fi/urn:nbn:fi:lb-2016042602). The corpus is available for online browsing through the concordancer Korp
SSH Open MarketPlace2025-07-04 更新20
ManySstubs-Synth
该数据集包含用于训练和评估模型的特征,包括标签和多个输入序列及其注意力掩码。数据集分为训练集、测试集和验证集,每个集都有相应的样本数量和字节大小。数据集的配置文件指定了数据文件的路径。
Hugging Face2024-11-27 更新10
mlfoundations-dev/instruction_filtering_fasttext_seed_data_code
该数据集包含了对话指令种子(instruction_seed)、来源(source)、以及对应的70B蒸馏模型响应(r1_distill_70b_response)等字段。此外,每个样本还有一个原始行索引(__original_row_idx)和会话信息(conversations),其中会话信息包含发送者(from)和消息内容(value)。数据集被拆分为训练集(train),包含2500个示例
Hugging Face2025-02-14 更新50
sjleslie/random_agreement_7_bins_long_31
这是一个包含句子和标签的文本数据集,用于训练模型。数据集分为训练集,共有209个示例,大小为6084字节。
Hugging Face2025-10-20 更新20



