evoom-guard-eval
收藏资源简介:
这是一个可复现的真实世界评估语料库,用于评估EvoOM Guard工具。它包含一个冻结的数据集,涵盖合法更改、模糊/策略敏感案例和对抗性案例,主要针对Python和Node生态系统。标签在工具执行前已冻结,并映射到合同词汇中,确保评估的独立性和可重复性。
This is a reproducible real-world evaluation corpus for assessing the EvoOM Guard tool. It contains a frozen dataset covering legitimate changes, ambiguous/policy-sensitive cases, and adversarial cases, mainly targeting the Python and Node ecosystems. Labels are frozen prior to tool execution and mapped to a controlled vocabulary, ensuring the independence and reproducibility of the evaluation.
数据集详情:evoom-guard-eval — 可重现的现实世界评估语料库
数据集概述
这是一个用于评估代码审查工具(EvoOM Guard)在真实世界变更中判决策略质量的、可重现的预注册评估语料库。语料库的标签在工具执行前已冻结并哈希,原始判决结果公开出版,但并非第三方验证。
协议版本
- 当前协议:v0.2,已冻结于标签
protocol-v0.2。 - v0.1 协议:不可变,覆盖了最初的试点实验,但未包含完整的标注、评估器或清单工具。
- 现有标签和轮次输出不会被移动或覆盖。
数据集内容与大小
- 目标语料库规模(v1 目标):50–100 个案例。
- 组成分布:
- 合法变更(~45%):错误修复、重构、依赖更新、测试添加、打包、CI 加固、配置迁移等,来自真实 OSS 仓库的历史合并 PR。
- 模糊/策略敏感(~35%):规范驱动的测试编辑、删除过时测试、运行器配置更新、锁文件、快照、生成文件、合法生命周期脚本、单体仓库工具。
- 对抗性(~20%):新外部创作的尝试(变异、红队贡献);不重复工具自有的 14 案例回归语料库。
- 生态系统:v1 版本涵盖 Python(25–40 个案例)和 Node(25–40 个案例)。
标签系统
数据集包含五个标签,每个映射到预期(判决、原因代码)集合:
accept→ 预期PASS/tests_passedreject→ 预期REJECTED或FAIL并附带命名原因代码requires_review→ 预期REJECTED/protected_harness_editrequires_policy_exception→ 预期拒绝,除非应用了已记录的--allow基线unsupported→ 预期ERROR并附带命名原因代码
评估真理独立于 Guard:每个案例包含两个独立层面:
truth(人类判断):human_decision(允许/阻止/升级)、policy_expectation、理由、标注者信息及是否在 Guard 运行前标注。guard_expectation(合约映射):将标签映射到预期(判决、原因代码)集合。
数据格式
每个案例存储在一个独立目录中:
cases/<ecosystem>/<id>/ case.json # 包含源引用与摘要、变更类别、真理、标签、Guard 期望、固定策略、许可证/出处 candidate.txt # 精确的历史变更(FILE/PATCH 块)或 candidate.diff(差异模式)
评估指标
每轮、每个生态系统、每个变更类别发布以下指标(无单一准确率数值):
- 合法接受率、错误拒绝率
- 策略审查率、白名单要求率
- 已知攻击拦截率、遗漏攻击率
- 不支持率、基础设施错误率
- 判决中位时间
另附:语料库哈希、引擎摘要、policy_sha256、原始记录、精确结果清单、每次调用时间、以及标注者/运行者分离声明。
评估流程
- 标注者(非运行者)提交标签和理由,并在首次 Guard 执行前发布语料库哈希。
- 运行者检查案例在轮次不可变清单中逐字节存在,下载固定基版本,应用候选变更,写入原始记录。
- 评估者独立重复记录验证,推导规范候选摘要,检查预期结果文件集,并检查真理/标签一致性,不单独信任记录的
verdict字段。
轮次计划
- 试点轮:10 个案例(5 Python、5 Node),在 v0.1 程序下执行,存在标注者 == 运行者的已知例外。
- 第 1 轮:50–100 个案例,在 v0.2 下执行,必须在命名了独立盲标注者且清单已公开冻结后才能开始。
- 第 2 轮及以上:新案例积累,每轮固定其引擎/策略,轮次不会被追溯重新评分。
单独 OSS 兼容性研究
studies/oss-compat-v1/ 是一个同所有者的工程兼容性研究,而非独立审计。它固定了来自 6 个无关项目的 12 个历史合并变更,覆盖 Python、Node、Go、Rust、C++ 和 C 语言。该研究拥有自己的清单、容器、工作流和保护标签,其文件不会进入第 1 轮语料库。
许可证
- 仓库自有的容器和文档:MIT 许可证。
- 候选变更:保留其上游项目的许可证。
- EvoOM Guard 记录:受工具自身条款约束。




