遇见数据集

nl2logsq-syslog-train7

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集为 theykk/nl2logsq-syslog-train7,用于训练将自然语言查询转换为 VictoriaLogs LogsQL 查询的工具调用模型,目标模型为 45M 参数的 Cactus Needle。数据集包含 59,405 条训练样本,存储为 Parquet 格式(train9.parquet,约 4.1 MB,zstd 压缩)。每条样本包括系统提示(system)、自然语言问题(query)、序列化的工具卡片(tools)、LogsQL 目标查询(answer_logs,可能为空表示拒绝回答)、拒绝标志(declined,1 表示训练拒绝)以及拒绝理由或依据(reasoning)。数据覆盖 21 种过滤类型、44 种管道操作和 17 种统计形式,所有能力矩阵均经过 VictoriaLogs v1.52 实体验证。此外,包含多种接近失败的拒绝类型(如预测、动作、工单、关联、单位指标和闲聊),使模型学会正确拒绝无关问题。数据来源包括多个上游数据集(如 vulcansiem/synthetic-syslog-1B、smithclay/otel-demo-telemetry 等),许可证各异(MIT、Apache-2.0、研究用途等),使用时需注意合规性。个人身份信息(PII)均为合成数据,包括虚构用户名、主机名和私有 IP 地址,仅约 172 个公开 IP 来自 MIT 许可的上游合成数据,且一个 AWS 密钥 ID 已被编辑为示例字符串。该数据集适用于文本生成任务,特别针对日志查询领域的自然语言到查询语言转换。

This dataset is theykk/nl2logsq-syslog-train7, used for training a tool-calling model to convert natural language queries into VictoriaLogs LogsQL queries, targeting a 45M parameter Cactus Needle model. It contains 59,405 training samples stored in Parquet format (train9.parquet, approximately 4.1 MB, zstd compressed). Each sample includes a system prompt, natural language query, serialized tool card, target LogsQL answer (may be empty indicating refusal), refusal flag (1 for training refusal), and refusal reasoning. The data covers 21 filter types, 44 pipeline operations, and 17 statistical forms, all capability matrices validated with VictoriaLogs v1.52. Additionally, it includes various near-failure refusal types (e.g., prediction, action, ticket, correlation, unit metrics, and chit-chat) to teach the model to correctly reject irrelevant questions. Data sources include multiple upstream datasets (e.g., vulcansiem/synthetic-syslog-1B, smithclay/otel-demo-telemetry) with various licenses (MIT, Apache-2.0, research use), requiring compliance attention. All PII is synthetic, including fictional usernames, hostnames, and private IP addresses; only about 172 public IPs come from MIT-licensed upstream synthetic data, and one AWS key ID has been redacted to an example string. This dataset is suitable for text generation tasks, specifically for natural language to query language conversion in the log query domain.

创建时间:
2026-09-04
原始信息汇总

数据集概述

theykk/nl2logsq-syslog-train7 是一个用于训练自然语言到 VictoriaLogs LogsQL 查询转换模型的数据集,目标是支持一个 45M 参数的 Cactus Needle 模型进行工具调用。

数据集规模与文件

  • 当前最终训练集为 train9.parquet(4.1 MB,zstd 压缩),包含 59,405 行数据。
  • 该文件由原始 train7 快照(26,717 行)加上约 20.5k 条 qwen-bulk 数据、能力矩阵来源数据及多轮拒绝样本合并而成。
  • 另有 data/train.parquet 作为原始 26,717 行 train7 快照(旧版 schema,使用 answers JSON 字段)。

数据字段(Schema)

列名 类型 说明
system string 规范的日志 schema 提示词(跨行字节统一)
query string 自然语言问题
tools string JSON 序列化的 vlquery 工具卡片(规范性)
answer_logs string? LogsQL 目标查询;拒绝回答时为 NULL
declined int8 标记是否为训练性拒绝(1 = 问题无法从日志回答)
reasoning string 拒绝类型或基础依据

内容覆盖

  • 仅包含 LogsQL,不含 PromQL(上游来源已按政策移除)。
  • 覆盖 21 种过滤类型、44 种管道操作、17 种统计形式,全部经 VictoriaLogs v1.52 实况验证。
  • 包含拒绝训练轮次:针对近似但不匹配的查询类型(如预测、操作、工单、关联分析、p99/rps 等单元指标、闲聊),将正确拒绝视为一项训练技能。

数据来源与许可证

来源 许可证 备注
vulcansiem/synthetic-syslog-1B MIT
smithclay/otel-demo-telemetry Apache-2.0
logpai/loghub 研究用途 许可证未完全验证,商业使用前需核实
witfoo/syslog-to-artifact TBD 需检查上游卡片
varun17291729/cloudtraillogs TBD 需检查上游卡片

PII 处理

  • 使用合成用户名(如 alice/bob/admin)、主机名 host*.example.com 以及私有 RFC1918 和 IANA 文档范围的 IP 地址。
  • 上游 MIT 许可的合成数据中继承了约 172 个公开风格的 IP(非真实用户)。
  • 来自公共合成测试样例的一个 AWS key ID 字符串已被替换为 AKIAEXAMPLEKEYID

关联模型

  • 模型权重位于 theykk/nl2logsq-model(45M 参数,LoRA r16),在分布内数据上可达 100% 正确执行、95% 结构化输出、0 退化解。
搜集汇总
数据集介绍
nl2logsq-syslog-train7 数据集图片
构建方式
面向日志查询自然语言转译任务,该数据集立足于将非结构化的自然语言问题映射为VictoriaLogs生态下的LogsQL查询语句,并借助工具调用范式实现结构化交互。构建过程以合成日志与公开遥测数据为基底,融合多源语料,包括MIT许可的合成syslog、Apache-2.0的OTel演示遥测及研究用途的Loghub等,通过能力矩阵覆盖21类过滤算子、44种管道操作与17种统计形式,并引入拒绝回合以训练模型判别不可应答问题。最终训练集在7轮迭代基础上扩充至59,405行,形成兼顾查询生成与拒答能力的工具调用监督数据。
特点
该数据集的核心特征在于其任务边界清晰且能力覆盖系统化,仅聚焦LogsQL而排除PromQL等无关查询语言,从而避免语义干扰。数据模式统一,系统提示与工具卡片字段在行间保持字节级一致,为模型提供稳定的上下文先验。拒绝样本的设计尤为突出,涵盖预测、动作、工单、关联分析、单位指标及闲聊等近邻类型,使拒答本身成为可训练技能而非简单过滤。所有能力项均经VictoriaLogs v1.52实测校验,保障查询语法的可执行性与时效性。
使用方法
使用时可依托HuggingFace数据集接口加载train9.parquet,按system、query、tools、answer_logs、declined与reasoning字段组织监督信号。模型输入由统一的系统提示、自然语言问题与JSON序列化的vlquery工具卡构成,输出侧以answer_logs提供目标LogsQL,若declined为1则对应拒绝理由。训练阶段可将拒绝样本与查询生成样本混合采样,以提升模型对可答与不可答问题的判别力。推理阶段直接复用system与tools字段构造提示,即可驱动45M参数Cactus Needle模型生成查询或执行拒绝。
背景与挑战
背景概述
随着云原生架构与分布式系统的广泛部署,海量异构日志的高效检索成为可观测性领域的核心命题。VictoriaLogs 所采用的 LogsQL 查询语言凭借其管道式语法与统计能力,为结构化日志分析提供了强表达力,然而其学习曲线陡峭,非专业运维人员难以将自然语言意图精准映射为合法查询。nl2logsq-syslog-train7 数据集由 theykk 团队构建,旨在训练一个 45M 参数的 Cactus Needle 模型,实现系统日志场景下自然语言到 LogsQL 的工具调用式生成。该数据集覆盖 21 种过滤类型、44 个管道与 17 种统计形式,并引入拒答轮次以抑制幻觉,为文本到查询(text2query)任务提供了经过实时验证的监督信号,对推动可观测性领域的自然语言接口研究具有参考价值。
当前挑战
该数据集所应对的领域挑战在于自然语言到日志查询语言的语义鸿沟:日志模式高度依赖具体系统上下文,同一自然语言问题在不同日志结构下可能对应截然不同的过滤与聚合管道,而模型必须同时保证语法合法性与语义等价性。构建过程中的挑战则体现为多源异构日志的许可与隐私约束,vulcansiem 等合成源与 loghub 等研究源许可条款不一,商用前需逐一核验;同时需从公开合成数据中剔除看似真实的 IP 与密钥标识,并对拒答样本进行近义混淆设计,使模型学会在预测、工单、关联分析及单元指标等不可回答场景下正确拒绝,而非强行生成查询。
常用场景
经典使用场景
在日志分析与可观测性领域,自然语言到查询语言的自动转化长期依赖人工规则或大参数量模型,而该数据集以LogsQL为核心,构建了面向VictoriaLogs的指令微调语料。其经典使用场景在于训练中小规模模型执行工具调用式查询生成:给定系统提示与自然语言问题,模型需输出符合LogsQL语法的查询语句,或对无法从日志中回答的问题进行拒答。数据集中涵盖21类过滤器、44种管道操作与17种统计形式,并以能力矩阵方式确保语法覆盖的均衡性,使模型在有限参数下仍能掌握结构化查询的生成范式。
实际应用
在实际运维与安全分析场景中,该数据集支撑的模型可嵌入日志查询助手、可观测性平台或安全信息与事件管理系统,将运维人员的自然语言描述即时转化为VictoriaLogs可执行的LogsQL语句,显著降低查询语言的学习成本与排障时间。其拒答能力亦可避免对预测、工单、指标类问题生成无效查询,提升交互可靠性。此外,数据集对私有地址与合成身份信息的处理方式,为构建符合隐私规范的企业级日志查询工具提供了可借鉴的数据治理实践。
衍生相关工作
围绕该数据集已衍生出若干相关工作:其配套模型theykk/nl2logsq-model以45M参数与LoRA微调实现了完全的分布内触发与高比例结构化输出,验证了轻量模型在日志查询生成上的可行性;训练集本身亦由初始快照扩展为包含qwen批量合成、能力矩阵来源与拒答轮次的迭代版本,反映了数据-centric的持续优化路径。这些工作共同推动了LogsQL生态中自然语言接口的研究,并为VictoriaLogs社区的工具调用实践提供了开源范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务