遇见数据集

Sec-CoT-sft

收藏
魔搭社区2026-07-13 更新2026-07-15 收录
官方服务:

资源简介:

# sec-distill-cot-dataset-v1:基于 DeepSeek-R1 的网络安全思维链蒸馏数据集 <p align="center"> <img src="https://img.shields.io/badge/Dataset-Cybersecurity%20CoT%20Distilled-blue" alt="Dataset Type"> <img src="https://img.shields.io/badge/Samples-~380k-lightgrey" alt="Size"> <img src="https://img.shields.io/badge/Teacher-DeepSeek--R1-green" alt="Teacher Model"> <img src="https://img.shields.io/badge/Domain-Cybersecurity%20%26%20Cybermetric-orange" alt="Domain"> </p> > 📘 **sec-distill-cot-dataset-v1** 是一个专为**网络安全领域语言模型微调**设计的高质量指令数据集。本数据集通过以 **DeepSeek-R1** 作为教师模型(Teacher Model),对原始安全语料进行**思维链推理增强蒸馏**(Chain-of-Thought Distillation),生成具有逻辑推导路径的结构化问答样本,可用于训练小型学生模型(如 Qwen-1.5B 系列)掌握复杂安全任务的分析能力。 此数据集已成功用于训练 [security-serch/sec-sft-AT-1.5B](https://modelscope.cn/models/security-serch/sec-sft-AT-1.5B) 模型,在漏洞归因、日志解析和威胁建模等任务中显著提升小模型的推理表现。 --- ## 📌 数据集概览 | 属性 | 描述 | |------|------| | **名称** | sec-cot-sft dataset | | **总样本数** | 15000+条 | | **语言支持** | 英文输入输出 | | **数据类型** | 指令式问答(Instruction-following)+ 思维链(CoT)推理过程 | | **构建方式** | 基于 DeepSeek-R1 的零样本推理 + 人工校验过滤 | | **适用任务** | SFT 微调、RLHF 偏好训练、领域适应 | | **兼容架构** | Qwen、LLaMA、ChatGLM 等主流开源底座 | --- ## 🧠 构建方法 我们采用“**教师引导 + 自动蒸馏 + 多轮清洗**”三阶段流程构建本数据集: 数据源来自以下两种高价值安全数据作为种子输入: - **Cybersecurity Data** 包括 CVE/CNNVD 描述、CTF writeups、攻击战术分析报告、MITRE ATT&CK 映射案例。 - **Cybermetric Data** 来自企业级 SIEM 系统的日志摘要、告警事件描述、EDR 行为链记录等脱敏文本。

提供机构:
maas
创建时间:
2026-02-04
二维码
社区交流群
二维码
科研交流群
商业服务