遇见数据集

yasirchemmakh/sft-dataset

收藏
Hugging Face2024-05-23 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: Flow ID dtype: string - name: event_types dtype: string - name: log_text dtype: string - name: alerted dtype: bool - name: Label dtype: string - name: truth dtype: bool - name: Day dtype: string - name: num_tokens dtype: int64 - name: row dtype: int64 - name: classification dtype: string - name: justification dtype: string - name: response dtype: string splits: - name: train num_bytes: 40139196 num_examples: 10000 download_size: 5343192 dataset_size: 40139196 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
yasirchemmakh
原始信息汇总

数据集概述

数据集特征

  • Flow ID: 数据类型为字符串。
  • event_types: 数据类型为字符串。
  • log_text: 数据类型为字符串。
  • alerted: 数据类型为布尔值。
  • Label: 数据类型为字符串。
  • truth: 数据类型为布尔值。
  • Day: 数据类型为字符串。
  • num_tokens: 数据类型为整数(int64)。
  • row: 数据类型为整数(int64)。
  • classification: 数据类型为字符串。
  • justification: 数据类型为字符串。
  • response: 数据类型为字符串。

数据集划分

  • 训练集(train):
    • 数据量: 10000个样本
    • 存储大小: 40139196字节

数据集大小

  • 下载大小: 5343192字节
  • 数据集总大小: 40139196字节
搜集汇总
数据集介绍
yasirchemmakh/sft-dataset 数据集图片
构建方式
该数据集名为yasirchemmakh/sft-dataset,主要面向安全事件分析领域,旨在为网络安全日志的监督式微调提供结构化训练样本。其构建方式基于对网络流量日志的多维度标注,每条样本包含Flow ID、event_types、log_text等原始字段,以及人工或规则生成的alerted、Label、truth等标签信息。数据集还引入了classification、justification和response字段,用于记录分类结果、推理依据及模型应生成的输出,从而形成完整的输入-输出对。整体上,该数据集通过将日志数据与专家标注相结合,构建了适用于安全领域大语言模型微调的高质量语料库。
特点
该数据集具有显著的结构化与多层次标注特点。每条记录不仅包含原始的日志文本和事件类型,还提供了布尔型的alerted与truth字段,便于区分真实告警与误报。更为关键的是,数据集引入了classification、justification与response三个字段,分别对应分类标签、推理过程和最终应答,这种设计使得模型能够学习从日志到结论的完整推理链路。此外,数据集包含10000条训练样本,规模适中,适合作为小样本微调或模型评估的基准。其字段覆盖了从原始数据到高层语义的完整转换过程,为安全日志分析任务提供了丰富的监督信号。
使用方法
该数据集的使用方法主要围绕监督式微调展开。用户可将其加载为HuggingFace Dataset对象,利用train split中的10000条样本进行模型训练。具体而言,可将log_text作为输入,response作为目标输出,构建序列到序列的学习任务。classification和justification字段可用于辅助训练,增强模型对分类结果和推理依据的理解。此外,该数据集也可用于评估模型在安全日志分析任务上的表现,例如通过truth字段验证告警判断的准确性。建议结合分词器对日志文本进行预处理,并利用num_tokens字段控制输入长度,以适应不同模型的上下文窗口限制。
背景与挑战
背景概述
该数据集由研究者yasirchemmakh创建,聚焦于网络安全领域的日志分析与威胁检测。随着网络攻击手段日益复杂,传统基于规则的入侵检测系统难以应对未知威胁,而基于日志的异常检测成为研究热点。数据集包含Flow ID、事件类型、日志文本、警报标签及分类依据等字段,旨在为监督学习模型提供结构化的训练样本。其核心研究问题在于如何通过日志语义理解,自动识别恶意事件并生成可解释的检测依据。该数据集的出现为安全领域的大语言模型微调提供了基础资源,推动了从特征工程到端到端推理的技术演进。
当前挑战
数据集面临的核心挑战包括:1) 日志数据的高度不平衡性,正常事件远多于攻击事件,导致模型易产生偏差;2) 日志文本的异构性与噪声,不同系统生成的日志格式差异大,且存在冗余信息,需设计鲁棒的特征提取方法;3) 可解释性需求,安全领域要求模型不仅检测威胁,还需提供合理化的分类依据,这对模型推理能力提出更高要求;4) 构建过程中,人工标注成本高昂且依赖专家知识,标签一致性难以保证,可能引入主观偏差影响模型泛化性能。
常用场景
经典使用场景
该数据集聚焦于网络安全日志分析领域,为安全事件检测与分类提供了结构化的训练样本。其经典使用场景在于利用事件类型、日志文本与警报标签等字段,训练有监督学习模型以区分正常流量与恶意活动。通过引入多源特征(如流标识符、时间戳与令牌数量),研究者能够构建高精度异常检测系统,从而提升对复杂网络攻击的识别能力。
解决学术问题
数据集有效解决了网络安全研究中标注数据稀缺与标签噪声的困境,为日志驱动的入侵检测提供了基准测试平台。它支持从二元分类到多类威胁识别的学术探索,推动了可解释人工智能在安全领域的应用——例如通过理由字段(justification)挖掘模型决策逻辑,从而弥合黑箱算法与安全分析师之间的认知鸿沟。
衍生相关工作
基于该数据衍生的经典工作包括多任务学习框架,用于联合优化事件分类与解释生成;以及基于大语言模型的微调流水线,利用日志文本与理由字段提升零样本攻击检测能力。此外,研究者还提出了时序注意力网络,结合流标识符与日字段捕捉攻击模式的演化规律,为动态防御策略奠定方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务