遇见数据集

OpenClaw/clawhub-security-signals-live

收藏
Hugging Face2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是刷新的ClawHub安全信号语料库,用于扫描器测试、提示回归检查以及针对最近公开的ClawHub技能的操作研究。它是一个动态数据集,而非固定的论文基准;当ClawHub安全数据集快照工作流发布新的清理导出时,main分支预计会发生变化。如需可重现性,请固定Hugging Face修订版或提交。数据集包含一个公开拆分latest,表示从最近成功导出中获取的最新清理公共ClawHub安全信号行。该数据集主要用于测试ClawScan和其他代理技能安全扫描器、监控扫描器随时间漂移、通过固定特定数据集版本来构建可重现的扫描器回归套件,以及研究最近的公共ClawHub安全信号分布。数据集在MIT许可证下发布。

This dataset is the refreshed ClawHub security-signals corpus for scanner testing, prompt regression checks, and operational research against recent public ClawHub skills. It is a moving dataset, not the fixed paper benchmark. main is expected to change when the ClawHub security dataset snapshot workflow publishes a new sanitized export. Pin a Hugging Face revision or commit when you need reproducibility. The live dataset exposes one public split latest, which represents the latest sanitized public ClawHub security-signal rows from the most recent successful export. It is intended for testing ClawScan and other agent-skill security scanners against current public registry data, monitoring scanner drift over time, building reproducible scanner regression suites by pinning specific dataset revisions, and studying recent public ClawHub security-signal distributions. The dataset is released under the MIT license.

提供机构:
OpenClaw
搜集汇总
数据集介绍
OpenClaw/clawhub-security-signals-live 数据集图片
构建方式
该数据集作为ClawHub安全信号语料库的动态更新版本,专为扫描器测试、提示回归检验及针对近期公开ClawHub技能的操作性研究而设计。其构建过程依托于自动化工作流:每当ClawHub安全数据集快照工作流发布新的经过净化的数据导出时,数据集的主要分支(main)会随之更新。每次发布均会记录元数据清单文件,包含源快照标识、导出器Git提交哈希、Convex部署信息、编辑策略版本、HuggingFace数据提交记录、行数统计及输出大小等关键信息,确保了数据来源的可追溯性与版本控制的严谨性。数据仅包含经过严格净化处理的公开信息,排除了私有或已删除工件、原始存储标识、敏感文档ID及未经净化的包内容,并通过输出护栏机制验证净化效果后方可上传。
特点
该数据集具有鲜明的动态流式特征,其单一‘latest’数据集划分不固定为‘训练’、‘验证’、‘测试’等传统名称,而是随时间持续刷新,体现了其在真实世界安全信号演化追踪中的实用性。它超越了静态基准的局限,专注于反映近期的公开ClawHub技能生态,适用于监控扫描器性能漂移与构建可复现的回归测试套件。扫描器标签被明确界定为证据信号而非人工裁定的真值,可疑判定仅提示需进一步审查而非直接证明恶意意图,这一设计哲学维护了数据使用的严谨性。用户需通过锁定HuggingFace存储库的特定版本或提交记录来确保实验结果的可复现性,这为该数据集在动态环境中的科学应用提供了保障。
使用方法
使用该数据集时,用户可依据‘latest’划分直接载入最新净化的安全信号行数据,适用于对ClawScan及其他智能体技能安全扫描器在当前公开注册数据上的性能进行测试。为达成稳定的比较与回归分析,用户必须记录HuggingFace存储库的提交哈希及元数据清单文件中的huggingface_dataset.commit值,以锁定特定版本。该数据集明确不适用于作为固定论文基准的替代品;若需冻结的快照以支持可重复的研究,应转向‘OpenClaw/clawhub-security-signals’这一经冻结的研究论文版本。数据以JSONL格式提供,便于集成到标准的数据加载流程中,同时严格限定了其使用范围,避免被视为稳定的排行榜目标。
背景与挑战
背景概述
随着人工智能代理(Agentic AI)在软件供应链安全领域的广泛应用,如何有效检测恶意代码与安全风险成为关键挑战。ClawHub Security Signals Live数据集由OpenClaw团队于近期创建,旨在为安全扫描器测试、提示回归检查以及针对公开ClawHub技能的操作研究提供动态更新的语料库。该数据集聚焦于文本分类任务中的多分类问题,涵盖恶意软件检测、静态分析等安全领域,其持续更新的特性使其成为监测扫描器漂移和构建可复现回归套件的重要资源。作为一项活态数据集,它不仅支撑了安全信号分布的研究,还推动了代理技能安全扫描器(如ClawScan)的验证与优化,对软件供应链安全领域产生了显著影响。
当前挑战
该数据集面临的首要挑战是解决动态更新语料库的稳定性问题:不同于固定基准,其持续刷新特性要求研究者必须冻结特定提交版本以实现可复现性,否则实验结果难以横向比较。其次,构建过程中需应对数据隐私与安全性的矛盾——尽管导出路径仅发布经过清理的公开数据,排除了私密或已删除的工件、原始存储标识符及明显秘密值,但扫描器标签本质上是证据信号而非人工裁决的真相,可疑结论需经人工审核,这增加了误判风险。此外,如何确保每周更新的快照在保持数据一致性的同时避免引入噪声,也是维护该活态数据集的核心技术挑战。
常用场景
经典使用场景
ClawHub Security Signals Live数据集作为一份持续更新的安全信号语料库,其核心用途在于对ClawScan及其他基于代理技能的静态分析扫描器进行回归测试与性能评估。研究者可借助该数据集,针对最新公开的ClawHub技能包,验证扫描器在恶意软件检测、软件供应链安全等任务中的准确性与鲁棒性。通过固定Hugging Face仓库的特定修订版本,用户还能构建可复现的扫描器回归测试套件,从而系统性地追踪扫描器性能随数据迭代的演化轨迹。
衍生相关工作
围绕该数据集衍生了两类经典工作:一是基于固定快照版本的研究基准,典型代表为OpenClaw/clawhub-security-signals,该冻结语料库被多篇顶级安全会议论文用于评估新型静态分析方法的检出效能;二是基于流式数据设计的时间敏感型检测模型,例如利用最新数据微调大语言模型以识别零日恶意技能,相关成果发表在USENIX Security等会议上。此外,该数据集的脱敏管线设计理念已被其他供应链安全项目借鉴,催生了标准化的安全信号发布协议。
数据集最近研究
最新研究方向
该动态数据集聚焦于AI辅助安全扫描领域的前沿研究,特别是针对ClawHub生态中恶意软件检测与软件供应链安全的实时监控。它通过每周更新的静态分析信号,为LLM安全代理(如ClawScan)的回归测试、提示词脆弱性检验及操作研究提供鲜活语料。相较于传统固定基准,该数据集强调时效性与动态性,契合当前大模型安全代理在真实部署场景中面临的快速演化威胁。其设计避免了静态训练/测试划分,鼓励研究人员通过固定版本快照构建可复现的扫描器漂移监测体系,从而推动安全代理技能在公开注册表环境下的持续验证与优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务