nl2logsq-syslog-train7
收藏资源简介:
该数据集为 theykk/nl2logsq-syslog-train7,用于训练将自然语言查询转换为 VictoriaLogs LogsQL 查询的工具调用模型,目标模型为 45M 参数的 Cactus Needle。数据集包含 59,405 条训练样本,存储为 Parquet 格式(train9.parquet,约 4.1 MB,zstd 压缩)。每条样本包括系统提示(system)、自然语言问题(query)、序列化的工具卡片(tools)、LogsQL 目标查询(answer_logs,可能为空表示拒绝回答)、拒绝标志(declined,1 表示训练拒绝)以及拒绝理由或依据(reasoning)。数据覆盖 21 种过滤类型、44 种管道操作和 17 种统计形式,所有能力矩阵均经过 VictoriaLogs v1.52 实体验证。此外,包含多种接近失败的拒绝类型(如预测、动作、工单、关联、单位指标和闲聊),使模型学会正确拒绝无关问题。数据来源包括多个上游数据集(如 vulcansiem/synthetic-syslog-1B、smithclay/otel-demo-telemetry 等),许可证各异(MIT、Apache-2.0、研究用途等),使用时需注意合规性。个人身份信息(PII)均为合成数据,包括虚构用户名、主机名和私有 IP 地址,仅约 172 个公开 IP 来自 MIT 许可的上游合成数据,且一个 AWS 密钥 ID 已被编辑为示例字符串。该数据集适用于文本生成任务,特别针对日志查询领域的自然语言到查询语言转换。
This dataset is theykk/nl2logsq-syslog-train7, used for training a tool-calling model to convert natural language queries into VictoriaLogs LogsQL queries, targeting a 45M parameter Cactus Needle model. It contains 59,405 training samples stored in Parquet format (train9.parquet, approximately 4.1 MB, zstd compressed). Each sample includes a system prompt, natural language query, serialized tool card, target LogsQL answer (may be empty indicating refusal), refusal flag (1 for training refusal), and refusal reasoning. The data covers 21 filter types, 44 pipeline operations, and 17 statistical forms, all capability matrices validated with VictoriaLogs v1.52. Additionally, it includes various near-failure refusal types (e.g., prediction, action, ticket, correlation, unit metrics, and chit-chat) to teach the model to correctly reject irrelevant questions. Data sources include multiple upstream datasets (e.g., vulcansiem/synthetic-syslog-1B, smithclay/otel-demo-telemetry) with various licenses (MIT, Apache-2.0, research use), requiring compliance attention. All PII is synthetic, including fictional usernames, hostnames, and private IP addresses; only about 172 public IPs come from MIT-licensed upstream synthetic data, and one AWS key ID has been redacted to an example string. This dataset is suitable for text generation tasks, specifically for natural language to query language conversion in the log query domain.
数据集概述
theykk/nl2logsq-syslog-train7 是一个用于训练自然语言到 VictoriaLogs LogsQL 查询转换模型的数据集,目标是支持一个 45M 参数的 Cactus Needle 模型进行工具调用。
数据集规模与文件
- 当前最终训练集为
train9.parquet(4.1 MB,zstd 压缩),包含 59,405 行数据。 - 该文件由原始 train7 快照(26,717 行)加上约 20.5k 条 qwen-bulk 数据、能力矩阵来源数据及多轮拒绝样本合并而成。
- 另有
data/train.parquet作为原始 26,717 行 train7 快照(旧版 schema,使用answersJSON 字段)。
数据字段(Schema)
| 列名 | 类型 | 说明 |
|---|---|---|
system |
string | 规范的日志 schema 提示词(跨行字节统一) |
query |
string | 自然语言问题 |
tools |
string | JSON 序列化的 vlquery 工具卡片(规范性) |
answer_logs |
string? | LogsQL 目标查询;拒绝回答时为 NULL |
declined |
int8 | 标记是否为训练性拒绝(1 = 问题无法从日志回答) |
reasoning |
string | 拒绝类型或基础依据 |
内容覆盖
- 仅包含 LogsQL,不含 PromQL(上游来源已按政策移除)。
- 覆盖 21 种过滤类型、44 种管道操作、17 种统计形式,全部经 VictoriaLogs v1.52 实况验证。
- 包含拒绝训练轮次:针对近似但不匹配的查询类型(如预测、操作、工单、关联分析、p99/rps 等单元指标、闲聊),将正确拒绝视为一项训练技能。
数据来源与许可证
| 来源 | 许可证 | 备注 |
|---|---|---|
| vulcansiem/synthetic-syslog-1B | MIT | |
| smithclay/otel-demo-telemetry | Apache-2.0 | |
| logpai/loghub | 研究用途 | 许可证未完全验证,商业使用前需核实 |
| witfoo/syslog-to-artifact | TBD | 需检查上游卡片 |
| varun17291729/cloudtraillogs | TBD | 需检查上游卡片 |
PII 处理
- 使用合成用户名(如 alice/bob/admin)、主机名
host*.example.com以及私有 RFC1918 和 IANA 文档范围的 IP 地址。 - 上游 MIT 许可的合成数据中继承了约 172 个公开风格的 IP(非真实用户)。
- 来自公共合成测试样例的一个 AWS key ID 字符串已被替换为
AKIAEXAMPLEKEYID。
关联模型
- 模型权重位于 theykk/nl2logsq-model(45M 参数,LoRA r16),在分布内数据上可达 100% 正确执行、95% 结构化输出、0 退化解。





