登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
AndrewZeng/metamath_hardquery_infer_part_2
AndrewZeng/metamath_hardquery_infer_part_2
收藏
Hugging Face
2024-05-24 更新
2024-06-12 收录
数学推理
定理自动证明
数据链接:
https://hf-mirror.com/datasets/AndrewZeng/metamath_hardquery_infer_part_2
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
许可证:Apache 2.0
应用场景:
提供机构:
AndrewZeng
原始信息汇总
数据集许可证信息
许可证类型
: Apache-2.0
相关数据集
VCBench
数学推理
感知信息处理
VCBench是一个用于评估多模态数学推理能力的综合基准数据集,专注于评估模型解决小学数学问题的能力,这些问题依赖于明确的视觉依赖关系。数据集包含1720个问题,跨越六个认知领域,并配以6697张图片,平均每个问题包含3.9张图片。该数据集的创建过程严格筛选并翻译了中国小学数学教科书中的问题,确保每个问题都具有独特且明确的答案。VCBench旨在解决当前基准测试中缺乏对视觉-数学推理能力的充分评估
arXiv
2025-04-24 更新
33
0
math-reasoning-dataset
数学推理
机器学习
该数据集包含了三个字段:prompt(提示)、solution(解决方案)和gold_reasoning(黄金推理)。它被划分为训练集和测试集,训练集有50个示例,测试集有200个示例。
Hugging Face
2025-06-01 更新
11
0
Lixing-Li/MATH500-Qwen3.5-9B-SFT
数学问题求解
数学推理
--- dataset_info: features: - name: problem dtype: string - name: solution dtype: string - name: answer dtype: string - name: subject dtype: string - name: level dtype:
Hugging Face
2026-03-22 更新
9
0
MATH()
数学推理
语言模型评估
MATH()是由Consequent AI创建的一个数据集,旨在通过功能化的基准测试来评估语言模型的推理能力。该数据集包含5000个问题,目前已有41.2%的问题被转化为功能化形式,以测试模型在未见过的问题上的表现。数据集的访问地址为https://github.com/consequentai/fneval/,用户可以获取到最新的数据集快照和评估代码。MATH()数据集的应用领域主要集中在提高大
arXiv
2024-03-01 更新
11
0
AndrewZeng/train_ppo_1to5_mix_twice_syn
--- license: apache-2.0 ---
Hugging Face
2024-05-03 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广