遇见数据集

多模态数学推理数据集MathV360K

收藏
官方服务:

资源简介:

MathV360K原始数据采用“图像(I)-问题(Q)-答案(A)”三元结构,专注于多模态数学推理任务,要求模型结合视觉感知与逻辑推理进行求解。基础精选层包含40K高质量问答对及对应图像,内容涵盖五大核心任务:图表问答涉及图表数据提取与计算,几何求解涉及几何图形的边角及面积计算,图像数学题结合商品价格表或场景进行运算,课本问答基于科学插图解释物理或生物现象,视觉问答包含物体计数与基础属性判断。扩展合成层包含320K问答对以增强数据的多样性、复杂性与鲁棒性。该层由200K个挖掘图像未覆盖信息的多样新问题、40K个增加求解步骤的复杂推理题、40K个同义改写的逻辑一致重述题,和40K个简化语言但保留视觉依赖性的模糊简化题组成。项目论文将原始数据作为多模态数学推理训练源数据,用更强的多模态模型基于原始数据生成链式推理CoT数据,再对推理结果进行自评价与级联式自评价,形成CoT、SEAT、Cas-SEAT等训练数据;同时提出Double-level Data Filtering(DDF)进行两级过滤。MathV360k原始数据训练样本为339k,经过模型推理/筛选后形成160k条CoT数据和167k条Cas-SEAT数据;DDF与Cas-SEAT-DDF数据集将训练时间从原始数据上的18h降到10h,约减少44.44%,同时仍能提升轻量多模态模型能力。

提供机构:
浙江大学
二维码
社区交流群
二维码
科研交流群
商业服务