Meta-HCH-Bench
收藏资源简介:
Meta-HCH-Bench是一个非饱和的元认知基准数据集,用于评估前沿大型语言模型。它通过构建隔离元认知与能力的方法,揭示了模型家族在元认知上的不同定性专业化。数据集包含210个程序生成的实例,涵盖7个类别×2个难度×种子,每个实例都有已知的CP-SAT/ILP/tree-DP黄金求解器。
Meta-HCH-Bench is a non-saturated metacognitive benchmark dataset for evaluating state-of-the-art large language models. By establishing a methodology that isolates metacognition from task capability, it reveals distinct qualitative specializations in metacognition across model families. The dataset contains 210 programmatically generated instances, covering 7 categories × 2 difficulty levels × seed settings, with each instance paired with a known gold standard solver based on CP-SAT, ILP, or tree-DP.
数据集概述:Meta-HCH-Bench (Capability-Controlled Metacognition Benchmark)
基本信息
- 数据集名称: Meta-HCH-Bench
- 团队: Voicetree (Manu Masson, Lochlan Hill)
- 赛道: 元认知 (Metacognition)
- 数据集地址: https://github.com/voicetreelab/meta-hch-bench
- DOI: https://doi.org/10.5281/zenodo.19619282
问题背景
现有元认知基准测试将自我认知与能力混为一谈,无法单独解释原始置信度分数。该基准测试通过构造方式将元认知与能力分离,揭示不同模型家族发展出质性不同的元认知专长——元认知不是标量,而是分解为正交轴(监测 vs. 控制)。
核心创新
- 连续值优化问题:由OR-Tools/ILP求解器验证,无需LLM作为裁判
- 墙钟时间惩罚:每次停止都是可证伪的经济承诺
- 反事实分叉 (Counterfactual Forking):每次干净停止时强制多执行一轮,为每次停止提供有价判决
- 能力控制指标 (M5, M6):通过测量模型自身观察到的天花板差距来消除平面悲观主义
任务构造
- 会话设定: 每轮30分钟墙钟预算,经济目标为
score = max(0, 100 − gap_pct) − 0.01 × wall_seconds - 执行流程: 第一轮为计划,后续轮次执行并输出最佳猜测、质量预测、继续预测和决策
- 解析方式: 模型输出原始文本,由后处理的Gemini-Flash提取器解析结构化字段,实时循环永不解析,避免了解析器脆弱性问题
六项元认知技能 (M1–M6)
| 指标 | 描述 |
|---|---|
| M1 | 子任务可解性预测的Brier分数 (p_solve) |
| M2 | 输出质量预测的Brier分数 (p_gap_le_X) |
| M3 | 反事实分叉的净收益分布 |
| M4 | 预期增量与真实增量的平均绝对误差 |
| M5 | 能力控制下的AUC比率 (AUC_model / AUC_own_ceiling) |
| M6 | 最优组合与观察到的组合分数之差 |
Brier分数通过Murphy (1973)分解为可靠性/分辨率/不确定性,并报告Brier技能分数 (BSS)。
数据集构成
- 实例数量: 210个程序化生成的实例
- 类别与难度: 7个类别 × 2个难度级别 × 多个种子
- 问题类型: 耦合作业车间调度、Steiner × 着色、图着色、旅行商问题、树宽最大加权独立集、贝叶斯变量消除、掩码块作业车间调度
- 附加实例: 投资组合分配实例 (3-of-6 和 4-of-6,两个难度段)
- 过滤条件: 基线-金标准差距 ≥ 15%,金标准求解时间 < 60秒
- 可复现性: 每个实例由 (class, difficulty, seed) 确定性可复现
- 验证方式: 纯Python验证器模块,从提交工件重新计算目标值,无需LLM作为裁判
技术细节
- 实现协议:
harness/protocol.py(原始字符串循环) - 后处理提取器: 已在所有目标输出形状上验证
- 验证器:
verifiers/{class}.py - 日志格式: 完整转录,评审者可独立重新运行提取和验证
- 输出格式: JSONL输入 → JSONL输出,包含
{run_id, transcript, final_score, metacog_fields}
评估结果与洞察
6模型扫描结果 (每家族2个模型 × 3个家族)
| 指标 | Anthropic (Sonnet / Opus) | Google (Flash / G-3-Pro) | OpenAI (mini / GPT-5.4) |
|---|---|---|---|
| M1 BSS ↑ | +0.19 / −0.01 | −0.79 / — | −0.35 / +0.14 |
| M2 BSS ↑ | +0.53 / +0.18 | −0.44 / +0.50 | −2.14 / −3.17 |
| M2 分辨率 ↑ | 0.12 / 0.07 | 0.03 / 0.11 | 0.00 / 0.01 |
| M4 MAE ↓ | 1.85 / 1.82 | 5.94 / 0.35 | 2.08 / 7.99 |
| 可行性 ↑ | 33% / 82% | 49% / 100% | 54% / 86% |
家族一致性结论
- Anthropic — 监测轴确认: Sonnet和Opus均取得正向M2 BSS (+0.53 / +0.18)和低M4 MAE (~1.8);Opus修复了Sonnet的执行崩溃问题
- OpenAI — 尖锐且错误的M2确认: GPT-5.4-mini和GPT-5.4均在M2 BSS上表现灾难性 (−2.14 / −3.17),分辨率接近零,且前沿模型表现更差
- Google — 平面预测者在前沿被拒绝: Gemini 3 Pro (56/56完整,100%可行性) 逆转了Flash的表现模式
干预实验证据
在HLE试点 (n=100) 中,三级递归反思指导将准确率从18%提升至24%,Brier分数从0.305降至0.271,表明元认知技能是可训练的。
隶属机构
Voicetree — AI智能体编排平台,研究独立进行。
参考文献
完整参考文献列表见: https://github.com/voicetree-ai/metabench-evals/blob/main/references.md




