相关数据集
We-Math 2.0
We-Math 2.0是一个统一的系统,旨在全面增强多模态大型语言模型(MLLMs)的数学推理能力。它集成了一个结构化的数学知识系统、以模型为中心的数据空间建模和基于强化学习(RL)的训练范式,以实现广泛的概念覆盖和在不同难度级别上的稳健推理性能。关键贡献包括:1. MathBook知识系统——一个五级层次结构,涵盖491个知识点和1,819个基本原理;2. MathBook-Standard和M
github2025-08-15 更新1350
VCBench
VCBench是一个用于评估多模态数学推理能力的综合基准数据集,专注于评估模型解决小学数学问题的能力,这些问题依赖于明确的视觉依赖关系。数据集包含1720个问题,跨越六个认知领域,并配以6697张图片,平均每个问题包含3.9张图片。该数据集的创建过程严格筛选并翻译了中国小学数学教科书中的问题,确保每个问题都具有独特且明确的答案。VCBench旨在解决当前基准测试中缺乏对视觉-数学推理能力的充分评估
arXiv2025-04-24 更新330
zhihz0535/X-SVAMP_en_zh_ko_it_es
X-SVAMP是一个用于评估多语言大语言模型(LLMs)的基准测试,包含五种语言(英语、中文、韩语、意大利语和西班牙语)的问题和答案,旨在评估LLMs的数学推理能力。数据集由GPT-4-turbo从原始英文版SVAMP翻译而来。每个问题都附有逐步思考的提示,并且每个示例由id、instruction和answer三个字段组成。
Hugging Face2024-01-27 更新370
mlfoundations-dev/a1_math_natural_reasoning
这是一个包含指令种子(instruction_seed)、参考答案(reference_answer)、多个响应(responses)、推理过程(reasoning)、deepseek解决方案(deepseek_solution)、原始行索引(__original_row_idx)、最终推理轨迹(final_reasoning_trace)和对话(conversations)等字段的数据集。数据集
Hugging Face2025-04-10 更新140



