2etatg/Uncensored-SFT-v2
收藏资源简介:
High Quality Uncensored Instruction Dataset V2 是一个语义去重的高质量未审查指令数据集,旨在通过去除近义重复提示来提高指令的多样性和信息密度。该数据集基于V1版本,进一步处理了大规模合并数据集中的重复生成、公共数据集重复、改写指令、模板生成提示、越狱风格重复、近义QA样本和对话模式复制等问题。处理流程包括格式标准化、OCR和文本清理、英语过滤、精确去重、问题提取、提示嵌入生成、语义相似性过滤以及恢复原始输入/输出对,使用相似度阈值0.90进行语义去重,以保留不同交互风格。数据集为JSONL格式,包含输入和输出字段,主要用于监督微调、指令调优、QLoRA、蒸馏、对齐研究、未审查助手训练、能力恢复、小模型改进、合成数据研究和消融实验。它特别适用于LLaMA、Mistral、Qwen、Gemma等模型的微调,强调多样性优先于数据集大小,以减少重复监督信号并提高训练效率。
High Quality Uncensored Instruction Dataset V2 is a semantically deduplicated high-quality uncensored instruction dataset designed to improve instruction diversity and information density by removing near-duplicate prompts. Based on V1, it addresses issues in large-scale merged datasets such as repeated synthetic generations, duplicated public datasets, paraphrased instructions, template-generated prompts, repeated jailbreak styles, near-identical QA samples, and replicated conversational patterns. The processing pipeline includes format normalization, OCR and text cleaning, English filtering, exact deduplication, question extraction, prompt embedding generation, semantic similarity filtering with a threshold of 0.90, and restoration of original input/output pairs, preserving different interaction styles. The dataset is in JSONL format with input and output fields, primarily intended for supervised fine-tuning, instruction tuning, QLoRA, distillation, alignment research, uncensored assistant training, capability recovery, small model improvement, synthetic data research, and ablation experiments. It is particularly useful for fine-tuning models like LLaMA, Mistral, Qwen, and Gemma, prioritizing diversity over dataset size to reduce repeated supervision signals and enhance training efficiency.



