相关数据集
stackexchange_biology
该数据集包含三个主要特征:指令(instruction)、完成(completion)和对话(conversations)。对话特征是一个列表,包含来源(from)和值(value)两个子特征。数据集分为一个训练集,包含50000个样本。数据集的下载大小为153568975字节,总大小为281944222字节。
Hugging Face2024-12-22 更新170
andreaparker/wiki-ss-nq-train-overlap-sm
该数据集包含用于训练的信息检索模型的数据,主要包括查询ID、查询内容、正面和负面相关文档以及答案。每个查询都有对应的正面和负面文档列表,每个文档包含文档ID、文本内容和标题。数据集被分割为训练集,包含1000个样本,总大小为139483047.95236582字节。
Hugging Face2024-12-06 更新100
deepapaikar/alpaca_katz_data
--- license: apache-2.0 dataset_info: features: - name: questions dtype: string - name: answers dtype: string - name: text dtype: string splits: - name: train n
Hugging Face2024-04-30 更新80
davidfant/natural-questions-chunk-13
--- dataset_info: features: - name: id dtype: string - name: document struct: - name: html dtype: string - name: title dtype: string - name: tokens sequence
Hugging Face2023-10-22 更新130
boun-tabilab/TQuad-2
TQuad2最初由Erdem Metin发布,是一个土耳其语的问答数据集。原始数据集只有训练集和验证集,通过特定的分割方法生成了测试集。数据集的结构包括上下文(context)、问题(question)和答案(answers),其中答案是一个列表,每个答案包含起始位置(answer_start)和文本内容(text)。
Hugging Face2025-12-14 更新80



