遇见数据集

budianultra-sft

收藏
魔搭社区2026-08-02 更新2026-08-02 收录
官方服务:

资源简介:

# budianultra-sft budianultra 系列模型的 **SFT 训练数据集**(最终融合版),共 **12,157 条**多轮对话。 ## 文件 | 文件 | 格式 | 说明 | |------|------|------| | `sharegpt_combined.jsonl` | ShareGPT(`conversations` / `from`,`value`) | 原始融合数据,适配 LLaMA-Factory 等框架 | | `sft_messages.jsonl` | OpenAI messages(`messages` / `role`,`content`) | 12,053 条(经角色交替校验过滤),可直接喂 SFTTrainer | ## 数据构成 | 来源 | 条数 | 说明 | |------|------|------| | zero_budian_sft | 9,923 | 自有数据集清洗去重 | | deepseek 蒸馏 | 1,433 | DeepSeek V4 Flash,spec 组合驱动(44 领域 × 38 画像 × 16 任务) | | step-3.7-flash 蒸馏 | 685 | 单调用整段对话生成 | | step-3.7-flash 精标批 | 116 | 含诚实性陷阱题(虚构书籍/时事/施压测试) | ## 风格目标 - 诚实校准:不确定明说、拒绝编造事实/引用/书名、纠正错误前提、抗施压不改口 - 结构化深度回答:结论先行、多视角后给明确立场 - 全部为 3 轮多轮对话(部分 1-2 轮),中英混合(中文为主),上下文 8k 内 ## 去重与质控 - 首轮问题 SimHash(64-bit,汉明距离 ≤6)跨源去重 - 格式校验:角色交替、首轮 user、末轮 assistant - 蒸馏样本含主题一致性过滤 ## License Apache License 2.0。数据由大模型蒸馏生成,可能残留教师模型的知识性错误,研究用途。

提供机构:
maas
创建时间:
2026-07-28
二维码
社区交流群
二维码
科研交流群
商业服务