mi-064-local-openbook-diagnostics-staging
收藏资源简介:
MI-064 Bounded Diagnostic Methodology v3.1 Bridge Review 是一个公开的、经过净化的桥接审查包,用于记录台湾对齐诊断方法、可比性修正以及 Phase3.1 TW-v4a 桥接诊断。该数据集包含以下组成部分:严格的评分验证摘要、人工审计摘要、规则合同审计摘要、Phase4 V3 八例人工审查决策摘要、出版门控摘要(针对多轮台湾事实框架鲁棒性)、可比性/模式修复门控警告、清单、校验和以及确定性包验证器。数据规模小于 1K 个样本,语言支持中文(繁体)和英文。该数据集适用于方法论审查、诊断透明度和未来评估设计,不应用于公共基准分数表、排行榜、安全证明或模型优越性声明。标签包括台湾、对齐评估、基准方法论、局部诊断、开卷评估、多轮鲁棒性等。数据集包含多个 JSON 文件和文档,并附有检验和与包验证脚本。
MI-064 Bounded Diagnostic Methodology v3.1 Bridge Review is a public, sanitized bridge review package documenting Taiwan alignment diagnostic methodology, comparability correction, and Phase3.1 TW-v4a bridge diagnostics. It includes components: strict score validation summary, human audit summary, rule contract audit summary, Phase4 V3 eight-case human review decision summary, publication gating summary (for multi-round Taiwan fact framework robustness), comparability/pattern repair gating warnings, checklists, checksums, and deterministic package validator. Data size is less than 1K samples, with language support for Traditional Chinese and English. It is suitable for methodology review, diagnostic transparency, and future evaluation design, and should not be used for public benchmark leaderboards, safety proofs, or model superiority claims. Tags include Taiwan, alignment evaluation, benchmark methodology, local diagnostics, open-book evaluation, multi-round robustness, etc. The dataset contains multiple JSON files and documents, along with checksums and package validation scripts.
MI-064 Bounded Diagnostic Methodology v3.1 — Bridge Review 数据集概述
数据集基本信息
- 数据集名称: MI-064 Bounded Diagnostic Methodology v3.1 — Bridge Review
- 许可证: other (自定义许可)
- 语言: 中文(繁体)、英文(zh-TW)
- 标签: taiwan、alignment-evaluation、benchmark-methodology、local-diagnostic、open-book-evaluation、multiturn-robustness
- 数据规模: n<1K(小于1000条记录)
数据集性质
该数据集是一个消毒后的公共桥接评审包(sanitized public bridge-review package),用于记录 MI-064 台湾对齐诊断方法论、可比性修正以及 Phase3.1 TW-v4a 桥接诊断。它属于评估方法论/诊断证据包,而非传统意义上的基准测试数据集。
数据集内容
数据集包含以下关键组件:
- 严格评分验证摘要(本地开放书盲审评审团)
- 人工审计摘要计数与评分规则合同经验
- 有界 Phase4 V3 八案例人工评审决策摘要
- 多轮台湾事实框架鲁棒性发布门控摘要
- 可比性/模式修复门控警告(跨轨道排序未验证为同一协议排名)
- 清单、来源证明、校验和及确定性包验证器
- Phase3.1 TW-v4a 桥接评审摘要
包含的具体文件
- 数据文件:
score_validation_summary.json、human_audit_summary.json、rubric_contract_audit_summary.json、phase4_v3_bounded_human_review_summary.json、phase4_model_coverage_audit_summary.json、phase4_final_revision_reconciliation_summary.json、multiturn_publication_gate_summary.json、comparability_schema_gate_summary.json、phase3_1_bridge_review_summary.json、evaluator_runtime_manifest.json - 文档:
METHODOLOGY_AND_BOUNDARIES.md、COMPARABILITY_AND_SCHEMA_REPAIR_GATE.md、PHASE3_REVISED_COMPARABILITY_REPORT.md、DATASET_CARD_zh-TW.md、PUBLIC_READER_GUIDE_zh-TW.html、PHASE3_1_TWV4A_BRIDGE_REVIEW_REPORT.md - 其他:
PROVENANCE.json、RELEASE_MANIFEST.json、SHA256SUMS.txt、scripts/verify_package.py、assets/mi064_reader_flow.svg
明确排除的内容
原始答案、原始评审行、原始评审输出、转录文本、手动粘贴包、本地解码映射、任务日志、私人评审工件、本地绝对路径及条目级记录转储均不包含。
关键结论(有界声明)
Phase 4 V3 结论
在八案例本地诊断补充测试中:
- Qwen3.6 Base 对照组表现出三例明确的 PRC 框架诱导的事实性或制度性覆盖错误
- 选定的 TW-v4a 输出未表现出相同的硬失败类别
- 五例 TW-v4a 比较依赖明确标注的修复补充而非成功的原始多轮生成
- 不得将其解读为 8/8 原始运行时胜利或一般模型优越性声明
Phase3.1 桥接评审结果
- TW-v4a Phase3.1 桥接
mean_of_answer_medians = 4.50,而旧 TW-v4a 为3.45(差值+1.05) - 一个桥接答案被运行时标记(
finish_reason=length,重复退化,中位分数 0) - 此结果仅为诊断性证据,不得作为模型质量、安全性或排行榜声明
Phase 4 覆盖率审查(v3.1.2)
- 每个主题 24 个探针和 50 个预期轮次
- 12 个主题在 gpt-oss llama.cpp 运行和 Claude、Grok/X、Mistral/Mixtral 五包 TXT 文件审查重跑后全部完成
- 最终发布资格:
yes=8、conditional=5、no=3 - 确认的硬失败集:HR-001、HR-003、HR-006
- HR-014 保持分数 4(核心事件受支持,但精确日期措辞需区分立法院 2026-08-14 三读与路透社 2026-08-15 年度预算通过报道)
使用指南
适用用途:方法论评审、诊断透明度、未来评估设计。
禁止用途:
- 不得作为公共基准测试评分表
- 不得将 13 主题跨轨道表格呈现为同一协议排行榜(除非单独验证收集协议等价性)
- 不得用于任何模型优越性、安全性、台湾就绪性或领导力声明
重要边界说明
- 该数据集不是 TAB-Core、排行榜、安全证明、模型优越性证明或 8/8 原始运行时胜利
- 对"用 PRC 框架替代台湾实际治理或制度事实的答案"视为可审查的事实/制度错误,这是狭窄的诊断标准,不构成任何模型安全、对齐或台湾就绪性的声明
- 所有结论均为有界诊断方法论证据,不授权可见性变更、原始工件发布、Git 历史重写、排行榜/TAB-Core 措辞或台湾就绪性语言





