遇见数据集

MrZilinXiao/geometry3k_rel_with_reasoning

收藏
Hugging Face2025-12-19 更新2025-12-20 收录
官方服务:

资源简介:

该数据集包含几何问题的训练和验证数据,每个样本包括图像、问题、答案、问题类型图、问题类型目标、推理过程、模型准确率、索引和相关文档ID。训练集有2101个样本,验证集有300个样本。

This dataset contains training and validation data for geometry problems, each sample includes images, problem, answer, problem type graph, problem type goal, reasoning, model accuracy, index, and relevant document IDs. The training set has 2101 samples, and the validation set has 300 samples.

提供机构:
MrZilinXiao
搜集汇总
数据集介绍
构建方式
在几何智能推理领域,数据集的质量与结构化程度直接决定了模型对空间关系与逻辑链条的建模能力。MrZilinXiao/geometry3k_rel_with_reasoning 数据集基于经典Geometry3K语料库进行深度重构,通过引入大语言模型生成的高质量推理链,构建了一套包含图像、问题、答案、图类型、目标类型及推理过程的多元标注体系。数据集划分为训练集(2101例)、测试集(601例)与验证集(300例),并在训练子集中进一步衍生出融合ColBERT、Qwen3嵌入及Qwen3视觉语言模型相关性评分的增强版本,为检索增强生成(RAG)与多模态推理研究提供了结构化支撑。
特点
该数据集的核心特色在于其推理过程显式化与检索相关性多维标注的双重设计。每个样本均包含由GPT-o3生成的完整推理步骤,将几何问题的抽象逻辑转化为可追踪的符号序列,突破了传统数据集仅提供答案的局限。训练子集进一步集成了基于ColBERT、Qwen3文本嵌入及Qwen3视觉语言嵌入的多种相关性评分矩阵,使得模型能够在检索阶段同时利用语义相似度与视觉语义对齐信息,显著提升对复杂几何图形与文本问题的联合理解能力。此外,问题类型按图结构与求解目标双重分类,为细粒度评估模型在特定几何子任务上的表现提供了标准化依据。
使用方法
研究人员可通过HuggingFace Datasets库加载该数据集的多个配置版本。加载标准训练集、测试集或验证集时,直接指定对应config_name即可获得包含图像、问题、答案及推理链的基础数据。若需探索检索增强效果,可选择带有colbert_relevance、embedding_relevance或vl_embedding_relevance字段的增强训练子集,这些字段以浮点数矩阵形式存储了各问题与预定义文档集合之间的相关性得分,便于直接接入RAG管道或作为对比学习的监督信号。图像数据以列表形式存储,支持与视觉编码器无缝对接,适用于端到端的图文推理模型训练与评估。
背景与挑战
背景概述
几何推理作为人工智能领域的一项核心挑战,长期以来困扰着研究者,其难点在于需要将视觉感知与符号逻辑深度融合。在此背景下,MrZilinXiao团队于近期构建了geometry3k_rel_with_reasoning数据集,旨在为多模态大语言模型在平面几何问题上的推理能力提供系统性的评估与训练资源。该数据集以经典的Geometry3K为基础,通过引入详细的推理步骤和问题类型标注(如图形分类与目标分类),显著提升了数据在模型可解释性研究中的价值。数据集涵盖了训练、验证与测试多个子集,并创新性地融入了ColBERT、Qwen3Embedding及多模态嵌入等多种相关性度量方法,为研究不同嵌入策略对几何推理的影响提供了基准。其发布迅速引起了自然语言处理与计算机视觉交叉领域的广泛关注,为推动具备严谨逻辑推理能力的通用人工智能模型的发展奠定了重要数据基础。
当前挑战
该数据集所面临的核心挑战源于几何推理本身的复杂性,即如何让模型在理解图形结构的同时,完成从条件到结论的严密逻辑推导。具体而言,现有模型在处理需要多步推理的几何问题时,常因缺乏对图形空间关系的深层理解而出现逻辑断裂,这要求数据集必须提供足够丰富且结构化的推理路径作为监督信号。在构建过程中,团队遇到了标注一致性难题,即不同标注者对同一几何问题的推理步骤可能存在主观差异,如何确保推理链路的客观性与完备性成为一大挑战。此外,数据集中图像与文本的对齐、问题类型与图形属性的映射,以及多样化嵌入向量(如ColBERT与Qwen3VL)的合理融合,均需在保证数据质量的前提下实现高效扩展,这对数据构建的自动化流程与质量校验机制提出了严苛要求。
常用场景
经典使用场景
在人工智能与几何推理交叉领域,Geometry3K系列数据集常被用于训练和评估多模态大语言模型的数学推理能力。该数据集以平面几何问题为核心,每道题目均配有图像、问题文本、标准答案及推理过程,尤其适合构建检索增强生成(RAG)系统。研究者可借助其提供的多种嵌入表示(如ColBERT、Qwen3Embedding、Qwen3VLEmbedding),探索不同检索策略对模型推理准确率的影响,从而推动几何智能体在复杂图形理解与逻辑推导上的突破。
实际应用
在实际应用中,该数据集可赋能智能教育辅导系统,帮助开发能够自动解析几何题目、生成解题步骤并纠正学生错误的虚拟教师。例如,集成检索增强技术的作业批改工具,能依据学生上传的几何图形与问题描述,从数据集中匹配相似案例并给出针对性讲解。此外,在自动化试题生成与难度评估场景中,数据集中的问题类型标签与推理复杂度信息,可用于构建自适应学习系统,动态调整题目难度以匹配学习者水平,从而提升在线教育的个性化体验。
衍生相关工作
基于Geometry3K数据集,衍生出多项经典工作。其中,研究者利用其提供的ColBERT与Qwen3Embedding相关性分数,提出了混合检索策略,将稀疏检索与稠密嵌入结合,显著提升了几何问题的答案召回率。另有工作聚焦于多模态对齐,通过Qwen3VLEmbedding将视觉特征与语言推理联合编码,在测试集上刷新了模型准确率。此外,部分学者将数据集中的推理链作为监督信号,训练专门用于几何证明的序列生成模型,为数学推理的神经符号融合提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务