遇见数据集

omeryentur/grok-parser-vrl-940k

收藏
Hugging Face2026-05-06 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含940,257个经过验证的(log, grok_pattern)对,用于训练从原始日志行生成Vector.dev VRL parse_grok!模式的模型。数据通过4个Gemini模型在约10,000个日志类别和7种提示模式下生成,与一个历史项目的647K行语料库合并,并通过sha1(log+parser)进行去重。每个数据行都通过pygrok重新验证,确保模式编译、匹配日志并产生与目标一致的键/值字典。数据集在构建时经过端到端确认,保证质量。

940,257 validated (log, grok_pattern) pairs for training models that generate Vector.dev VRL parse_grok! patterns from raw log lines. The data was generated by 4 Gemini models across approximately 10K log categories and 7 prompt modes, merged with a legacy 647K-row corpus, deduped by sha1(log+parser), and re-validated through pygrok to ensure pattern compilation, log matching, and key/value equality with the target. Every row was confirmed end-to-end at build time.

提供机构:
omeryentur
二维码
社区交流群
二维码
科研交流群
商业服务