遇见数据集

ComBench

收藏
github2026-06-10 更新2026-06-12 收录
官方服务:

资源简介:

ComBench是一个奥林匹克级别的组合数学基准测试,用于评估大语言模型在严谨证明推理和构造实现方面的互补能力。它包含100个人工标注的竞赛级组合数学问题:50个分析中心记录和50个构造中心记录。每个记录包含问题元数据、参考答案和问题特定的评分指南。构造中心记录还需要通过确定性Python验证器检查的显式见证载荷。该基准测试旨在诊断证明质量和构造有效性分离的情况,模型可能产生流畅的高分证明,但无法以可检查的形式实现所需的组合对象。

ComBench is an Olympic-level combinatorial mathematics benchmark designed to evaluate the complementary capabilities of large language models (LLMs) in rigorous proof-based reasoning and constructive implementation. It comprises 100 manually annotated competition-level combinatorial mathematics problems, including 50 analysis-focused entries and 50 construction-focused entries. Each entry contains problem metadata, a reference solution, and a problem-specific scoring guideline. Construction-focused entries additionally require explicit witness payloads that can be verified by a deterministic Python validator. This benchmark is designed to diagnose cases where proof quality and construction validity are decoupled: models may generate fluent, high-scoring proofs yet fail to implement the required combinatorial objects in a verifiable form.

创建时间:
2026-05-28
原始信息汇总

ComBench 数据集概述

ComBench 是一个面向奥林匹克级别组合数学的基准测试,旨在评估大语言模型在严格证明推理构造性实现两种互补能力上的表现。该基准结合了基于评分细则的证明评判机制与确定性验证器门控的评分体系,用于评估构造类任务。

数据集构成

  • 总量:100个人工标注的竞赛级组合数学问题。
  • 类别
    • 分析类记录(Analysis-centric):50个,侧重于证明推理。
    • 构造类记录(Construction-centric):50个,除了证明外,还需要提供明确的构造对象,并由确定性的 Python 验证器进行校验。
  • 记录格式:每个问题包含问题元数据、参考答案、问题特定的评分指南。构造类记录额外包含构造指令、参考构造和验证代码。

数据集设计目标

该基准旨在诊断模型在证明质量与构造有效性之间可能出现的偏差。例如,模型可能生成流畅且得分较高的证明,但未能以可验证的形式实现所需的组合对象。

排行榜(截至论文发布)

模型 分析类平均分 分析类最佳@4 构造类平均分 构造类最佳@4 总分平均分 总分最佳@4
GPT-5.5 62.4 72.9 68.4 77.7 65.4 75.3
Gemini-3.1-Pro 56.1 69.7 64.5 78.3 60.3 74.0
Kimi-K2.6 43.5 60.6 63.4 83.7 53.5 72.1
DeepSeek-V4-Pro 37.8 56.6 52.6 67.7 45.2 62.1
Qwen3.6-Max 21.4 32.9 28.4 39.1 24.9 36.0
SU-01 20.9 30.3 28.8 41.1 24.8 35.7
GLM-5.1 21.6 36.0 25.6 37.1 23.6 36.6
Qwen3.6-35B 17.9 26.6 22.7 32.0 20.3 29.3
Nemotron-Cascade 21.8 32.9 17.4 28.0 19.6 30.4
Gemma-4-31B-IT 16.1 24.3 17.5 30.9 16.8 27.6

所有数值均为百分比。构造类分数采用论文中描述的验证器门控规则。

数据格式

每条 JSONL 记录包含类似 IMO 风格的问题和可选的构造元数据。

  • 纯证明记录字段:idqueryref_answergrading_guidelinesref_solution
  • 构造类记录额外字段:instructionref_constructionverify_code。当 instructionverify_code 都存在时,评估器期望模型输出两部分响应,并使用验证器检查构造部分。

仓库内容

  • src/:生成、解析、评判、评分和验证器执行代码。
  • pipeline/:构建 ComBench 格式 JSONL 记录的工具和提示模板。
  • data_process/:检查 JSONL 记录和参考构造的工具。
  • profiles/:模型配置文件示例(通过环境变量引用 API 密钥)。
  • examples/:用于本地冒烟测试的小型 JSONL 记录。
  • tests/:评估框架的单元测试。
  • docs/:项目页面。

相关资源

  • 论文:https://arxiv.org/abs/2606.10479
  • 项目页面:https://simplified-reasoning.github.io/ComBench/docs/
  • 代码仓库:https://github.com/Simplified-Reasoning/ComBench
  • 数据集:Hugging Face 数据集链接待发布。
搜集汇总
数据集介绍
ComBench 数据集图片
构建方式
ComBench数据集的构建源于对奥林匹克级别组合学问题中严谨证明推理与构造实现双重能力的评估需求。研究团队精心筛选了100道经过人工标注的竞赛级组合学问题,将其均衡划分为两类:50道分析型记录与50道构造型记录。每条记录均包含完备的问题元数据、标准参考答案以及针对特定问题的评分准则。尤为关键的是,构造型记录额外要求提供明确的见证载荷,这些载荷需通过确定性Python验证器的严格检查。构建过程采用了基于评分细则的证明评判与验证器门控评分相结合的策略,确保对构造类问题的评估既严谨又具有可复现性。
特点
该数据集的显著特征在于其双轨评估架构,能够精准诊断大语言模型在证明质量与构造有效性之间的潜在分歧。分析型记录侧重于评估模型生成流畅且高得分证明的能力,而构造型记录则通过可检查的形式化手段,检验模型能否实际实现所需的组合学对象。这种设计使得即使模型能够撰写看似完美的证明,若无法生成符合规范的具体构造,其得分仍将受到限制。此外,数据集采用了确定性验证器门控评分机制,为构造类问题提供了客观、无歧义的评估基准,有效避免了纯文本评分的主观性偏差。
使用方法
使用ComBench时,研究者需遵循清晰的操作流程。首先,通过配置模型配置文件(YAML格式),设定API接口信息并利用环境变量安全传递密钥。随后,运行主评估脚本(src/main.py),指定数据集路径(JSONL格式)与模型配置文件,即可启动自动化评估流程。对于构造型记录,系统会自动执行嵌入的Python验证代码,对模型生成的构造载荷进行确定性检验。为便于调试,项目提供了本地验证器(data_process/check_ref_construction.py)用于独立测试特定记录。最终的评估结果将以结构化形式输出,支持后续性能分析与排名计算。
背景与挑战
背景概述
ComBench是由张顺凯等学者于2026年构建的奥林匹克级别组合学基准数据集,旨在系统评估大语言模型在严谨推理与构造实现两个互补维度上的能力。该数据集包含100道经人工标注的高难度组合问题,其中50道聚焦于分析型推理,另50道则强调构造型实现,要求模型不仅能生成流畅的证明,还需通过确定性Python验证器产出可检查的组合对象。ComBench的提出填补了现有基准仅关注形式推理而忽视构造验证的空白,为诊断大语言模型在数学推理中的深层局限提供了关键测试平台,其影响力迅速辐射至AI数学推理与自动化定理证明领域。
当前挑战
ComBench所面对的挑战首先源于组合学问题的固有复杂性:这类问题常需要非构造性的存在性证明与显式构造之间的双向贯通,而现有大模型往往在生成高质量证明后却无法完成可验证的实物构造,导致推理与实现之间的严重脱节。此外,该基准在构建过程中需解决“构造验证”这一核心难题,即如何设计兼具严格性与可扩展性的验证器来确保构造结果的正确性,同时避免因评分标准的主观性而引入偏差。由于组合学问题的答案形式多样(如图、排列、子集等),统一验证框架的设计与大规模人工标注的质量控制也成为构建过程中的关键挑战。
常用场景
经典使用场景
ComBench是一个面向奥林匹克级别组合学问题的基准测试,专门用于评估大语言模型在严格证明推理与构造实现这两项互补能力上的表现。数据集包含100个经过人工精标注的竞赛级组合学问题,其中50个为分析型记录,侧重证明推理的细致评分;另50个为构造型记录,强调通过确定性Python验证器对构造物进行门控评分。典型使用场景是同时衡量模型生成流畅、高分证明的能力,以及将证明转化为可验证组合对象的能力,从而揭示证明质量与构造有效性之间可能存在的脱节现象。
解决学术问题
ComBench解决了当前大语言模型评估中一个关键但常被忽视的问题:在复杂数学推理任务中,模型可能生成语义流畅、得分较高的证明,却无法实际构造出满足约束的组合学对象。这种证明与构造的分裂状态,在传统仅依赖文本评分或输出匹配的评估体系中难以被有效捕捉。ComBench通过引入构造验证器门控机制与细粒度评分准则,为学界提供了一套能够独立测量模型证明严谨性与构造可执行性的诊断工具,推动了数学推理评估从表面正确性向深层可信性的进化。
衍生相关工作
ComBench的发布催生了一系列围绕数学推理验证与构造可执行性的后续工作。研究者基于其双轨评估架构,衍生出面向组合优化问题的形式化证明验证基准、多模态组合推理数据集,以及融入构造器反馈的强化学习微调方法。部分工作将ComBench的验证器门控思想迁移至概率图构造与算法设计任务中,拓展了可验证推理的应用边界。此外,基于该基准的排行榜机制也推动了模型层面的对比研究,常用作评估新一代大规模语言模型在数学逻辑任务上知识固化与推理泛化能力的参考标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务