遇见数据集

mi-064-local-openbook-diagnostics-staging

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

MI-064 Bounded Diagnostic Methodology v3.1 Bridge Review 是一个公开的、经过净化的桥接审查包,用于记录台湾对齐诊断方法、可比性修正以及 Phase3.1 TW-v4a 桥接诊断。该数据集包含以下组成部分:严格的评分验证摘要、人工审计摘要、规则合同审计摘要、Phase4 V3 八例人工审查决策摘要、出版门控摘要(针对多轮台湾事实框架鲁棒性)、可比性/模式修复门控警告、清单、校验和以及确定性包验证器。数据规模小于 1K 个样本,语言支持中文(繁体)和英文。该数据集适用于方法论审查、诊断透明度和未来评估设计,不应用于公共基准分数表、排行榜、安全证明或模型优越性声明。标签包括台湾、对齐评估、基准方法论、局部诊断、开卷评估、多轮鲁棒性等。数据集包含多个 JSON 文件和文档,并附有检验和与包验证脚本。

MI-064 Bounded Diagnostic Methodology v3.1 Bridge Review is a public, sanitized bridge review package documenting Taiwan alignment diagnostic methodology, comparability correction, and Phase3.1 TW-v4a bridge diagnostics. It includes components: strict score validation summary, human audit summary, rule contract audit summary, Phase4 V3 eight-case human review decision summary, publication gating summary (for multi-round Taiwan fact framework robustness), comparability/pattern repair gating warnings, checklists, checksums, and deterministic package validator. Data size is less than 1K samples, with language support for Traditional Chinese and English. It is suitable for methodology review, diagnostic transparency, and future evaluation design, and should not be used for public benchmark leaderboards, safety proofs, or model superiority claims. Tags include Taiwan, alignment evaluation, benchmark methodology, local diagnostics, open-book evaluation, multi-round robustness, etc. The dataset contains multiple JSON files and documents, along with checksums and package validation scripts.

创建时间:
2026-08-11
原始信息汇总

MI-064 Bounded Diagnostic Methodology v3.1 — Bridge Review 数据集概述

数据集基本信息

  • 数据集名称: MI-064 Bounded Diagnostic Methodology v3.1 — Bridge Review
  • 许可证: other (自定义许可)
  • 语言: 中文(繁体)、英文(zh-TW)
  • 标签: taiwan、alignment-evaluation、benchmark-methodology、local-diagnostic、open-book-evaluation、multiturn-robustness
  • 数据规模: n<1K(小于1000条记录)

数据集性质

该数据集是一个消毒后的公共桥接评审包(sanitized public bridge-review package),用于记录 MI-064 台湾对齐诊断方法论、可比性修正以及 Phase3.1 TW-v4a 桥接诊断。它属于评估方法论/诊断证据包,而非传统意义上的基准测试数据集。

数据集内容

数据集包含以下关键组件:

  • 严格评分验证摘要(本地开放书盲审评审团)
  • 人工审计摘要计数与评分规则合同经验
  • 有界 Phase4 V3 八案例人工评审决策摘要
  • 多轮台湾事实框架鲁棒性发布门控摘要
  • 可比性/模式修复门控警告(跨轨道排序未验证为同一协议排名)
  • 清单、来源证明、校验和及确定性包验证器
  • Phase3.1 TW-v4a 桥接评审摘要

包含的具体文件

  • 数据文件:score_validation_summary.jsonhuman_audit_summary.jsonrubric_contract_audit_summary.jsonphase4_v3_bounded_human_review_summary.jsonphase4_model_coverage_audit_summary.jsonphase4_final_revision_reconciliation_summary.jsonmultiturn_publication_gate_summary.jsoncomparability_schema_gate_summary.jsonphase3_1_bridge_review_summary.jsonevaluator_runtime_manifest.json
  • 文档:METHODOLOGY_AND_BOUNDARIES.mdCOMPARABILITY_AND_SCHEMA_REPAIR_GATE.mdPHASE3_REVISED_COMPARABILITY_REPORT.mdDATASET_CARD_zh-TW.mdPUBLIC_READER_GUIDE_zh-TW.htmlPHASE3_1_TWV4A_BRIDGE_REVIEW_REPORT.md
  • 其他:PROVENANCE.jsonRELEASE_MANIFEST.jsonSHA256SUMS.txtscripts/verify_package.pyassets/mi064_reader_flow.svg

明确排除的内容

原始答案、原始评审行、原始评审输出、转录文本、手动粘贴包、本地解码映射、任务日志、私人评审工件、本地绝对路径及条目级记录转储均不包含

关键结论(有界声明)

Phase 4 V3 结论

在八案例本地诊断补充测试中:

  • Qwen3.6 Base 对照组表现出三例明确的 PRC 框架诱导的事实性或制度性覆盖错误
  • 选定的 TW-v4a 输出未表现出相同的硬失败类别
  • 五例 TW-v4a 比较依赖明确标注的修复补充而非成功的原始多轮生成
  • 不得将其解读为 8/8 原始运行时胜利或一般模型优越性声明

Phase3.1 桥接评审结果

  • TW-v4a Phase3.1 桥接 mean_of_answer_medians = 4.50,而旧 TW-v4a 为 3.45(差值 +1.05
  • 一个桥接答案被运行时标记(finish_reason=length,重复退化,中位分数 0)
  • 此结果仅为诊断性证据,不得作为模型质量、安全性或排行榜声明

Phase 4 覆盖率审查(v3.1.2)

  • 每个主题 24 个探针和 50 个预期轮次
  • 12 个主题在 gpt-oss llama.cpp 运行和 Claude、Grok/X、Mistral/Mixtral 五包 TXT 文件审查重跑后全部完成
  • 最终发布资格:yes=8conditional=5no=3
  • 确认的硬失败集:HR-001、HR-003、HR-006
  • HR-014 保持分数 4(核心事件受支持,但精确日期措辞需区分立法院 2026-08-14 三读与路透社 2026-08-15 年度预算通过报道)

使用指南

适用用途:方法论评审、诊断透明度、未来评估设计。

禁止用途

  • 不得作为公共基准测试评分表
  • 不得将 13 主题跨轨道表格呈现为同一协议排行榜(除非单独验证收集协议等价性)
  • 不得用于任何模型优越性、安全性、台湾就绪性或领导力声明

重要边界说明

  • 该数据集不是 TAB-Core、排行榜、安全证明、模型优越性证明或 8/8 原始运行时胜利
  • 对"用 PRC 框架替代台湾实际治理或制度事实的答案"视为可审查的事实/制度错误,这是狭窄的诊断标准,不构成任何模型安全、对齐或台湾就绪性的声明
  • 所有结论均为有界诊断方法论证据,不授权可见性变更、原始工件发布、Git 历史重写、排行榜/TAB-Core 措辞或台湾就绪性语言
搜集汇总
数据集介绍
mi-064-local-openbook-diagnostics-staging 数据集图片
构建方式
该数据集以严格的证据契约与溯源机制为基石,构建了一套面向台湾地区事实框架对齐评估的本地化诊断方法论。其构建过程遵循'受控开放'原则,通过清洗敏感信息,形成仅含汇总级证据的公开审查包。数据集整合了多项结构化清单,涵盖评分验证、人工审计、规则契约审计、模型覆盖率审计及最终修订协调等维度,并辅以完整的运行时清单、校验和及确定性包验证脚本,确保数据集的完整性与可复现性。该构建方式旨在服务于方法论审查与诊断透明度,而非作为公开基准测试的评分表。
特点
该数据集的核心特质在于其严谨的边界声明与多层级审查框架。它明确区分'诊断证据'与'基准权威',拒绝任何模型优越性或安全性的泛化断言。数据集的另一显著特点是其对称的红队覆盖机制,尤其针对中国框架对台湾治理事实的潜在覆盖进行批判性审查,同时保护非硬失败案例。此外,数据集通过桥接评审,探讨了采集协议、运行时配置等因素对评分差异的敏感影响,强调了跨轨道可比性的复杂性,体现了其作为诊断方法的深度与审慎。
使用方法
该数据集专供方法论评审、诊断透明度提升及未来评估设计之用,严禁将其用作公开基准得分表或排行榜。使用时,需严格遵循其边界声明,不得将十三主体的跨轨道表视为同协议排名,除非另行验证采集协议的等效性。完整的复现流程应基于数据清单、运行时清单及验证脚本,并同时参考传统中文数据集卡片与阅读指南,以确保对诊断范围与局限性的准确理解,恰如其分地运用其洞见,而不过度引申其结论。
背景与挑战
背景概述
MI-064 Bounded Diagnostic Methodology v3.1 Bridge Review 数据集由 rickytzai 团队于2026年创建,旨在评估多轮对话中模型对台湾事实框架的鲁棒性,特别是针对中国基础模型在台湾治理事实上的表现。该数据集采用开放书评估与人工审核相结合的方法,通过严格的评分验证和桥接诊断,揭示了收集协议、运行环境等非模型因素对评分的影响,从而为对齐评估方法论提供了重要参考。其影响力体现在推动了诊断透明性和评估设计,但明确限制了其作为基准或安全证明的用途。
当前挑战
该数据集面临多方面的挑战:首先,领域问题聚焦于多轮对话中模型对台湾事实的错误覆盖,尤其是中国框架导致的制度性覆盖,这种错误未被传统聚合指标充分捕捉,因此需要细粒度诊断。其次,构建中面临收集协议不一致、运行环境差异、提示序列化变化等导致评分波动(如delta=+1.05),以及生成退化(finish_reason=length)等质量问题,加之数据规模小(n<1K)且包含敏感政治内容,需在去敏感化与保持证据完整性之间取得平衡,同时确保不夸大结论,严格限定诊断用途。
常用场景
经典使用场景
该数据集作为一项严谨的诊断性评估方法论包,主要应用于大语言模型在多轮对话中对台湾地区事实与制度框架的鲁棒性检验。其核心设计围绕'开放书卷'评估范式,通过受限的评审面板与人工复核机制,量化模型在特定政治语境下的知识一致性。研究者可借助其标准化评审流程与边界协议,复现跨模型、跨轨道的比对实验,尤其适用于探讨提示词序列化、生成设置及运行环境等无关变量对评估结果的干扰效应。
衍生相关工作
该数据集所代表的受限诊断方法论,衍生出若干后续研究方向,包括基于此类评审协议开发的自动化运行时一致性清单、用于跨收集轨道校准的桥接评审机制,以及针对多轮对话中事实框架漂移的专项压力测试集。其附录中的可复现性验证脚本与包验证器,为后续构建可审计的评估流水线提供了蓝本。相关延伸工作还关注于将此类诊断原则融入更广泛的对齐评估框架,促进跨学科的合作研究,以应对大语言模型在复杂社会语境下的信任与可靠性挑战。
数据集最近研究
最新研究方向
当前,大型语言模型在特定地域与文化语境下的对齐评估成为前沿焦点,尤其聚焦于台湾地区事实性框架的稳健性检验。该数据集作为MI-064有界诊断方法论的公开桥接评审包,最新研究动向在于构建多轮对话的对抗性评测体系,通过严格验证本地开放书记盲审面板的评分一致性,深入剖析模型在涉及中国与台湾治理事实时的覆写风险。研究强调跨轨道可比性修复与运行时清单的透明化,以诊断而非排行榜的方式揭示采集协议、提示序列化等非模型因素对性能评估的干扰,并借助繁体中文数据集卡与可视化导览增强评审的可复现性,为本土化对齐评测树立了审慎而严谨的标杆,其影响在于推动评测方法论从单一分数导向转向对边界条件与鲁棒性的深度反思。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务