相关数据集
legal-data-embedding-finetune
该数据集包含三个特征:查询(query)、正例(pos)和负例(neg)。数据集分为三个训练集:train_hust_hackathon、train_zalo_sythentic和train_crawled_hf,每个训练集都有对应的字节数和样本数。数据集的总下载大小为140,975,703字节,总数据集大小为666,497,233字节。配置部分指定了每个训练集的数据文件路径。
Hugging Face2024-12-08 更新190
AlphaCausal/finetuning_llama3b_new
--- dataset_info: features: - name: prompt dtype: string splits: - name: train num_bytes: 145969 num_examples: 200 download_size: 39998 dataset_size: 145969 configs: - config_n
Hugging Face2024-05-28 更新110
Mozilla/alt-text-validation
该数据集包含来自不同来源的图像和替代文本。它用于通过checkvite应用程序控制Mozilla的distilvit模型的质量。该应用程序允许用户在图像上测试模型并进行分类。数据集会根据用户反馈进行更新,特别是标记为需要训练的图像将用于微调模型以修正其不准确性。
Hugging Face2024-08-07 更新320
UniLLMer/proverbstest
该数据集是一个基于人类谚语生成对话的小型库,主要用于微调模型。作者使用Claude生成的对话库,并尝试在Colab中微调TinyLlama模型,但遇到了一些保存问题。
Hugging Face2024-05-25 更新120



