相关数据集
hpprc/auto-wiki-nli
该数据集主要包含日语文本数据,用于自然语言处理任务。数据集包含三个主要特征:id(唯一标识符)、premise(前提句子)、entailment(蕴含句子)和contradiction(矛盾句子)。数据集分为训练集,包含475,990个例子,总大小为216,134,947字节。
Hugging Face2024-07-18 更新60
pkanithi/medcalc
MedCalc数据集是一个包含医疗计算相关信息的数据集,其中包括患者注释、问题、相关实体、正确答案和解释等字段。数据集经过转换,现在以ChatML格式存储,每个示例包含系统消息、用户消息和包含分步思考和答案的助手消息。
Hugging Face2025-10-09 更新30
VoidZeroe/llama56train
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 9014997 num_examples: 10065 download_size: 828485 dataset_size: 9014997 configs: - confi
Hugging Face2023-12-20 更新20
marcomaccarini/28_ral_6
该数据集包含了上下文字符串、问题字符串和答案字符串。它被设计用于训练机器学习模型,能够理解和回答给定上下文中的问题。
Hugging Face2025-08-18 更新40
felixZzz/np_4b_len16k_custom_teacher_custom_student_onlyacc_rolloutY_v2_mix
该数据集包含提示(prompt)、回应(response)、来源(source)和平均正确性(average_correctness)等字段。数据集分为训练集,其中包含33420个示例,文件大小为694,939,757字节。数据集的总下载大小为280,178,716字节。
Hugging Face2025-11-13 更新20



