遇见数据集

JingweiNi/ocr2_hardest10k_k2_lowmed_gpt55pos_qwen35neg_seed20260529

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为OCR2 hardest10k K2 low/medium aggregated labels,是一个文本生成任务数据集,基于OCR2最难问题的10k个样本,采用K2低/中等推理努力混合生成。数据遵循行级聚合格式,每行代表一个生成的K2-Think轨迹,包含对齐的步骤标签数组:qwen35_verified(原始Qwen3.5-122B-A10B-FP8模型标注的步骤标签)、gpt55_verified(GPT-5.5模型对Qwen3.5正例步骤的重新注释,其他位置为NaN)、verified(最终聚合标签,其中Qwen3.5负例标记为0,GPT-5.5确认的正例标记为1,GPT-5.5过滤的Qwen正例标记为0,未重新注释的Qwen正例保持NaN)以及新增的k2_reasoning_effort列(指示每行的K2生成推理模式,值为low或medium)。聚合规则是:GPT-5.5确认的错误视为错误,所有Qwen3.5负例和GPT-5.5拒绝的Qwen正例视为正确。数据集包含19936行,其中低推理努力9968行,中等推理努力9968行;Qwen3.5正例步骤5110个,负例步骤14867个;有效GPT-5.5重新注释1191个,GPT-5.5确认正例步骤763个;最终验证负例步骤15295个,NaN步骤4349885个。数据已验证与源混合数据集和GPT-5.5注释记录一致,确保列对齐和完整性。

This dataset, named OCR2 hardest10k K2 low/medium aggregated labels, is a text-generation task dataset based on 10k hardest OCR2 questions, using a mix of low and medium K2 reasoning efforts. It follows a row-level aggregated format, where each row represents one generated K2-Think trace, with aligned step label arrays: qwen35_verified (original step labels from Qwen3.5-122B-A10B-FP8), gpt55_verified (GPT-5.5 medium re-annotations for completed Qwen3.5-positive steps, with NaN elsewhere), verified (final aggregated labels, where Qwen3.5 negatives are 0, GPT-5.5-confirmed positives are 1, GPT-5.5-filtered Qwen positives are 0, and unreannotated Qwen positives remain NaN), and an additional k2_reasoning_effort column (indicating the K2 generation reasoning mode per row, either low or medium). The aggregation rule is: GPT-5.5 confirmed errors are errors; all Qwen3.5 negatives and GPT-5.5 rejected Qwen positives are correct. The dataset contains 19,936 rows, with low reasoning effort rows = 9,968 and medium = 9,968; Qwen3.5 positive steps = 5,110, negative steps = 14,867; valid GPT-5.5 reannotations = 1,191; GPT-5.5 confirmed positive steps = 763; final verified negative steps = 15,295; and NaN steps = 4,349,885. It has been validated against the source mixed dataset and GPT-5.5 annotation records to ensure column alignment and integrity.

提供机构:
JingweiNi
原始信息汇总
  • 数据集名称: ocr2_hardest10k_k2_lowmed_gpt55pos_qwen35neg_seed20260529
  • 发布者: JingweiNi
  • 任务: 文本生成(Text Generation)
  • 模态: 表格数据(Tabular)、文本(Text)
  • 格式: parquet、optimized-parquet
  • 语言: 英语(English)
  • 规模: 10K - 100K 行
  • 许可证: Apache-2.0
  • 数据集大小: 总文件大小 1.1 GB,共 19,936 行
  • 数据集描述: 该数据集遵循 JingweiNi/ocr2_cf1900_k2_qwen35_gpt55_aggregated_10k_seed20260513 的行级聚合标签格式,并包含了额外的 K2 生成元数据。每一行对应从最难的 OCR2 问题中,以 50% low + 50% medium 混合模式生成的一个 K2-Think 轨迹。
  • 提示列 (Prompt Columns):
    • question: 用于生成的精确 K2 补全前缀,根据 k2_reasoning_effortraw_question 渲染而来。
    • raw_question: 原始的未格式化 OCR2 问题陈述。
    • k2_reasoning_effort: K2 生成推理模式,值为 lowmedium
  • 标签列 (Label Columns): 步骤标签以对齐数组形式存储。
    • qwen35_verified: 原始的 Qwen3.5-122B-A10B-FP8 步骤标签。
    • gpt55_verified: 对已完成的 Qwen3.5 阳性步骤进行的 GPT-5.5 medium 重新标注,其余位置为 NaN
    • verified: 最终聚合标签。Qwen3.5 阴性为 0;GPT-5.5 确认的阳性为 1;GPT-5.5 过滤后的 Qwen 阳性为 0;未重新标注的 Qwen 阳性保持 NaN
  • 聚合规则: GPT-5.5 确认的错误即为错误;所有 Qwen3.5 阴性以及 GPT-5.5 拒绝的 Qwen 阳性均为正确。
  • 数据摘要:
    • 行数:19,936
    • K2 推理模式计数:low 模式 9,968 行,medium 模式 9,968 行
    • Qwen3.5 阳性步骤数:5,110
    • Qwen3.5 阴性步骤数:14,867
    • 此混合数据集中有效的 GPT-5.5 重新标注数:1,191
    • GPT-5.5 确认的阳性步骤数:763
    • 最终确认的阴性步骤数:15,295
    • 最终的 NaN 步骤数:4,349,885
  • 验证信息: 数据集已与源混合数据集、K2 分词器和 GPT-5.5 标注记录进行校验。solutionqwq_critique 列为空字符串,因其是参考模式所需但源数据集缺失的字段。
搜集汇总
数据集介绍
JingweiNi/ocr2_hardest10k_k2_lowmed_gpt55pos_qwen35neg_seed20260529 数据集图片
构建方式
该数据集基于OCR2领域最困难的10K问题集,选取了中等与低推理难度各半的K2生成轨迹,并融合了Qwen3.5与GPT-5.5的标注结果。每一行数据对应一条K2-Think轨迹,其问题前缀依据设定的推理模式(low或medium)从原始问题中渲染生成。数据集沿用了聚合标签格式,所有Qwen3.5负例直接保留为0,GPT-5.5确认的正例标注为1,GPT-5.5判定错误的Qwen正例则被修正为0,其余未经GPT-5.5重标注的Qwen正例保持NaN。最终样本量达19936条,包含大量判断步骤的细致对齐。
特点
该数据集最具特色的地方在于其多层级、跨模型的验证机制与高难度的选择性覆盖。仅对Qwen3.5判断为正的步骤再进行GPT-5.5的中等推理强度重标注,由此形成了1191条有效GPT重标注记录,其中763条被确认为真正例。经过聚合后,最终得到15295个已验证的负向步骤,而正向步骤数相对稀少,这种高度不平衡的标签分布真实反映了OCR2难题中推理偏差的普遍性。数据还提供了完整的K2生成元信息,如推理模式和精确的token化前缀,为细粒度分析提供了坚实基础。
使用方法
该数据集适用于文本生成任务的训练与评估,尤其适合用于模型的推理纠错与自我验证能力研究。用户可通过加载HuggingFace数据集接口直接访问,数据以行级聚合标签格式呈现,包含question、raw_question、k2_reasoning_effort等输入列,以及qwen35_verified、gpt55_verified、verified等标签列。使用时需注意NaN值的含义:未被GPT-5.5重标注的Qwen正例保持NaN,表示该步骤标签不确定。可结合K2分词器对question列进行分词以获取input_ids前缀,从而与K2生成轨迹对齐。
背景与挑战
背景概述
在大型语言模型推理能力评估领域,传统基准测试多聚焦于最终答案正确性,难以细粒度捕捉推理过程中的潜在错误。为此,研究人员构建了OCR2(Overcoming Cognitive Reasoning Obstacles)数据集,旨在通过结构化步骤标签揭示模型推理链中的缺陷。本数据集ocr2_hardest10k_k2_lowmed_gpt55pos_qwen35neg_seed20260529由Jingwei Ni团队于2025年创建,基于OCR2中最具挑战性的10,000道题目,采用K2推理框架生成低/中两种推理难度的中间步骤轨迹,并融合Qwen3.5-122B与GPT-5.5的多阶段标注。该数据集的核心研究问题在于如何通过集成强、弱模型的标注信号,提升对推理错误检测的可靠性与覆盖度,对推动语言模型推理能力评估方法论发展具有重要影响。
当前挑战
本数据集面临的首要挑战是解决领域内的根本问题:如何精准识别复杂推理任务中模型产生的错误步骤,尤其是那些表面正确但隐含逻辑缺陷的“硬错误”。传统单一模型标注往往存在偏差,而多模型融合又面临标注一致性难题。其次,在构建过程中,挑战体现在三个方面:一是K2推理轨迹生成时,需平衡低与中两种推理努力模式的覆盖范围,避免因难度选择偏差导致样本代表性不足;二是Qwen3.5与GPT-5.5标注结果的聚合规则设计,需处理正负标签不匹配、GPT-5.5仅重标注部分步骤所导致的大量NaN缺失值;三是验证阶段需确保跨模型、跨难度的数据对齐无误,包括token序列精确匹配与步骤身份稳定映射,这在大规模多源数据整合中技术复杂度极高。
常用场景
经典使用场景
在语言模型推理能力评估与对齐研究中,OCR2 hardest10k K2 low/medium aggregated labels 数据集被广泛用于衡量模型在多步推理任务中的准确性与一致性。该数据集聚焦于OCR2问题集中最困难的一万道题目,通过结合低(low)与中(medium)两种推理努力程度的K2生成轨迹,为研究者提供了丰富的多维度推理样本。其经典用法在于利用Qwen3.5和GPT-5.5的联合标注,对模型生成的每一步推理进行正误判定,从而构建出高质量的监督信号。这一场景特别适合用于训练和评估具有思维链(Chain-of-Thought)能力的语言模型,帮助揭示模型在复杂推理任务中的内在弱点与改进方向。
实际应用
在实际应用中,该数据集可直接服务于语言模型的推理能力优化与安全对齐。例如,在开发需要严谨推理的智能辅助系统时(如法律咨询、数学解题或代码调试),开发者可利用该数据集训练模型学会识别并修正自身推理步骤中的错误。数据集所附带的K2推理努力程度标记(low/medium)还能用于自适应推理引擎的构建,使模型在简单问题时采取轻量推理、复杂问题时投入更深入思考,从而平衡计算成本与回答质量。此外,该数据集中丰富的正负例样本也为强化学习中的奖励模型训练提供了宝贵素材,助力实现更细粒度的推理行为奖励塑造。
衍生相关工作
该数据集衍生了一系列关于推理过程监督与多模型协同标注的经典工作。首先,其采用的Qwen3.5初筛与GPT-5.5精校的两阶段标注范式,启发了后续在数学定理证明和科学问题解答等场景中的级联标注流程设计。其次,低与中推理努力程度的对比分析促使研究者深入探索推理深度与回答准确性之间的权衡关系,催生了动态推理路径规划的相关研究。此外,该数据集中最终标注结果为NaN的步骤(即Qwen3.5阳性但未经GPT-5.5复判的部分)引发了关于标注稀疏性对模型训练影响的理论探讨,推动了对部分监督信号有效利用的方法创新。这些衍生工作共同丰富了模型推理评估与对齐的工具箱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务