遇见数据集

evoom-guard-eval

收藏
github2026-07-15 更新2026-07-17 收录
官方服务:

资源简介:

这是一个可复现的真实世界评估语料库,用于评估EvoOM Guard工具。它包含一个冻结的数据集,涵盖合法更改、模糊/策略敏感案例和对抗性案例,主要针对Python和Node生态系统。标签在工具执行前已冻结,并映射到合同词汇中,确保评估的独立性和可重复性。

This is a reproducible real-world evaluation corpus for assessing the EvoOM Guard tool. It contains a frozen dataset covering legitimate changes, ambiguous/policy-sensitive cases, and adversarial cases, mainly targeting the Python and Node ecosystems. Labels are frozen prior to tool execution and mapped to a controlled vocabulary, ensuring the independence and reproducibility of the evaluation.

创建时间:
2026-07-15
原始信息汇总

数据集详情:evoom-guard-eval — 可重现的现实世界评估语料库

数据集概述

这是一个用于评估代码审查工具(EvoOM Guard)在真实世界变更中判决策略质量的、可重现的预注册评估语料库。语料库的标签在工具执行前已冻结并哈希,原始判决结果公开出版,但并非第三方验证。

协议版本

  • 当前协议:v0.2,已冻结于标签 protocol-v0.2
  • v0.1 协议:不可变,覆盖了最初的试点实验,但未包含完整的标注、评估器或清单工具。
  • 现有标签和轮次输出不会被移动或覆盖。

数据集内容与大小

  • 目标语料库规模(v1 目标):50–100 个案例。
  • 组成分布
    • 合法变更(~45%):错误修复、重构、依赖更新、测试添加、打包、CI 加固、配置迁移等,来自真实 OSS 仓库的历史合并 PR。
    • 模糊/策略敏感(~35%):规范驱动的测试编辑、删除过时测试、运行器配置更新、锁文件、快照、生成文件、合法生命周期脚本、单体仓库工具。
    • 对抗性(~20%):新外部创作的尝试(变异、红队贡献);不重复工具自有的 14 案例回归语料库。
  • 生态系统:v1 版本涵盖 Python(25–40 个案例)和 Node(25–40 个案例)。

标签系统

数据集包含五个标签,每个映射到预期(判决、原因代码)集合:

  • accept → 预期 PASS/tests_passed
  • reject → 预期 REJECTEDFAIL 并附带命名原因代码
  • requires_review → 预期 REJECTED/protected_harness_edit
  • requires_policy_exception → 预期拒绝,除非应用了已记录的 --allow 基线
  • unsupported → 预期 ERROR 并附带命名原因代码

评估真理独立于 Guard:每个案例包含两个独立层面:

  1. truth(人类判断):human_decision(允许/阻止/升级)、policy_expectation、理由、标注者信息及是否在 Guard 运行前标注。
  2. guard_expectation(合约映射):将标签映射到预期(判决、原因代码)集合。

数据格式

每个案例存储在一个独立目录中:

cases/<ecosystem>/<id>/ case.json # 包含源引用与摘要、变更类别、真理、标签、Guard 期望、固定策略、许可证/出处 candidate.txt # 精确的历史变更(FILE/PATCH 块)或 candidate.diff(差异模式)

评估指标

每轮、每个生态系统、每个变更类别发布以下指标(无单一准确率数值):

  • 合法接受率、错误拒绝率
  • 策略审查率、白名单要求率
  • 已知攻击拦截率、遗漏攻击率
  • 不支持率、基础设施错误率
  • 判决中位时间

另附:语料库哈希、引擎摘要、policy_sha256、原始记录、精确结果清单、每次调用时间、以及标注者/运行者分离声明。

评估流程

  1. 标注者(非运行者)提交标签和理由,并在首次 Guard 执行前发布语料库哈希。
  2. 运行者检查案例在轮次不可变清单中逐字节存在,下载固定基版本,应用候选变更,写入原始记录。
  3. 评估者独立重复记录验证,推导规范候选摘要,检查预期结果文件集,并检查真理/标签一致性,不单独信任记录的 verdict 字段。

轮次计划

  • 试点轮:10 个案例(5 Python、5 Node),在 v0.1 程序下执行,存在标注者 == 运行者的已知例外。
  • 第 1 轮:50–100 个案例,在 v0.2 下执行,必须在命名了独立盲标注者且清单已公开冻结后才能开始。
  • 第 2 轮及以上:新案例积累,每轮固定其引擎/策略,轮次不会被追溯重新评分。

单独 OSS 兼容性研究

studies/oss-compat-v1/ 是一个同所有者的工程兼容性研究,而非独立审计。它固定了来自 6 个无关项目的 12 个历史合并变更,覆盖 Python、Node、Go、Rust、C++ 和 C 语言。该研究拥有自己的清单、容器、工作流和保护标签,其文件不会进入第 1 轮语料库。

许可证

  • 仓库自有的容器和文档:MIT 许可证。
  • 候选变更:保留其上游项目的许可证。
  • EvoOM Guard 记录:受工具自身条款约束。
搜集汇总
数据集介绍
evoom-guard-eval 数据集图片
构建方式
evoom-guard-eval数据集是一个用于评估代码变更审查工具的可复现真实世界评估语料库。它从多个真实开源项目的历史合并拉取请求中,抽取了涵盖错误修复、重构、依赖更新、测试添加、打包、CI加固、配置迁移等合法变更,以及具有策略敏感性的模糊案例和对抗性变更。每个案例被组织成一个独立的目录,包含描述案例元数据、标签、预期结果以及候选变更的文本文件,并通过哈希冻结确保不可篡改。标签体系与工具的契约词汇严格对齐,包含接受、拒绝、需要审查、需要策略例外和不支持五个类别,且人工判断标签在工具运行前即被独立标注和提交,避免了评估循环。
特点
该数据集的核心特点在于其严谨的防污染设计。所有标签在Guard执行前即被冻结并通过哈希公开,标注者与运行者分离,确保了评估的公正性。语料库在构建上偏向于缺乏证据的合法变更一侧,占比约45%,同时包含35%的策略敏感案例和20%的对抗性案例,覆盖了Python和Node.js两个生态系统。评估指标不依赖单一的准确率数字,而是按轮次、生态系统和变更类别报告合法接受率、误拒率、策略审查率等多维指标,并发布完整的引擎摘要、策略哈希和原始记录,支持他人独立复现和验证。
使用方法
使用该数据集时,用户需首先通过Git克隆仓库并安装依赖。核心执行命令包括:使用`python harness/make_manifest.py`生成清单并检查完整性,通过`python harness/evaluate.py`对指定轮次进行评估,以及利用`python harness/freeze_oss_cases.py`等工具管理OSS兼容性研究。系统要求运行于支持Python 3.11-3.13的Windows或Linux环境,且必须从指定的信任源下载与冻结哈希匹配的Guard引擎。评估结果生成后,可通过验证记录的工具检查候选摘要和结果文件集合的完整性,以确保评估过程的可靠性和可复现性。
背景与挑战
背景概述
在软件工程与人工智能的交叉领域中,代码变更审查是保障软件质量与安全的关键环节,然而传统人工审查面临效率瓶颈与主观偏差。EvoOM Guard Eval数据集应运而生,由同一组织于2024年构建并迭代至v0.2协议,旨在为自动化代码变更审查工具提供可复现、预注册的真实世界评估语料库。其核心研究问题聚焦于衡量防护系统对多样化实际变更(如合法修复、对抗性攻击)的判决质量,涵盖接受、拒绝及敏感策略场景的分类能力。通过冻结引擎版本、策略哈希与标签,该数据集实现了评估过程的透明性与可验证性,对推动代码审查自动化领域的标准化评估具有里程碑式意义。
当前挑战
该数据集面临的首要挑战是领域问题的复杂性:自动化审查需在缺乏明确证据的真实变更中区分合法操作与作弊行为,尤其是策略敏感边界(如测试编辑、锁文件更新)的模糊性可能导致高误报率。构建过程中,标签冻结与执行分离的协议要求标注者与运行者独立,但实际中标注者可能无法完全规避工具影响,引入潜在偏差。此外,语料库涵盖Python与Node两大生态,跨项目历史PR的采样需平衡代表性(45%合法、35%敏感、20%对抗),而初始规模(50–100案例)限制了统计功效。最终,工程兼容性研究揭示了基础设施故障与产品结果区分的挑战,确保评估不被偶发错误污染仍需严格的故障隔离与校验机制。
常用场景
经典使用场景
evoom-guard-eval 数据集专为评估自动化代码审查工具在真实世界变更上的决策质量而设计,其经典使用场景在于构建一个可复现的、预注册的评估流水线。研究者可借此将历史合并的PR变更(如Bug修复、重构、依赖更新)与对抗性样本、策略敏感案例混合,通过冻结的引擎版本与策略哈希,量化工具对合法工作的接纳率、对作弊的拒绝率以及对灰色地带案例的分类诚实性。该场景尤其强调标签与执行的时序分离——由独立标注者在工具运行前完成标注并锁定哈希,从而避免评估污染,确保结论的统计可信度。
衍生相关工作
该数据集衍生了多个方向的前沿探索:其一,围绕‘标签冻结与执行分离’协议,诞生了多种盲标激励机制与哈希链验证方案,例如基于Git标签的不可变评估轮次设计,已被后续研究借鉴为‘评估即证据’的基线。其二,其分项指标(如伪阳性率按变更类别的分布)催生了‘细粒度策略对齐评估框架’,推动了多篇关于‘代码治理策略与自动化审查一致性分析’的论文。其三,开源兼容性研究中的‘权限安全沙箱’尝试(如root-owned命名空间与uid隔离)为后续CI安全评估工作提供了可复现的工程范式,尤其在‘边界进程检测’与‘凭证污染预防’方向上成为重要参考实现。
数据集最近研究
最新研究方向
在人工智能安全治理的前沿阵地,evoom-guard-eval数据集聚焦于代码变更审查中防护策略的精准性评估,开创性地构建了可复现、预注册的评估协议。该研究直击当前生成式AI工具在判断代码合规性时的痛点——既要防止敏感变更被错误放行,又要避免合法工作遭到误拒,尤其针对依赖升级、锁文件更新等策略模糊地带。通过将人类标注的独立真实标签与其防护工具的预期输出严格解耦,数据集实现了对审查质量的客观衡量,有效回应了行业内对AI安全评估工具透明度和可审计性的迫切需求,为确立可信的基准评估范式提供了关键方法论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务