相关数据集
uw-math-ai/theorem-search-dataset
--- license: cc-by-sa-4.0 task_categories: - question-answering - feature-extraction - sentence-similarity language: - en tags: - math - theorems - semantic-search - information-retrie
Hugging Face2026-02-20 更新60
uw-math-ai/APRIL
--- language: - en license: apache-2.0 size_categories: - 100K<n<1M task_categories: - text-generation pretty_name: 'APRIL: A Dataset of Lean 4 Proof Errors and Corrections' tags: - lean - formal-veri
Hugging Face2026-02-27 更新50
uw-math-ai/Math2Vec-embedding-dataset
Math2Vec嵌入数据集是一个用于数学嵌入模型训练的数据集,基于同一数学概念可以有多种表面形式(如非正式自然语言、重新表述、Lean 4类型签名和完整声明)的原则构建。该数据集旨在用于对比嵌入训练,以对齐这些不同视图。它包含三个配置:1) mathlib_views(默认配置),提供133,621个mathlib4概念的多视图表示,每个概念包含最多四个并行表示和三个LLM生成的困难负样本;2)
Hugging Face2026-05-29 更新30
uw-math-ai/theorem-search-dataset-permissive
--- license: cc-by-4.0 task_categories: - question-answering - feature-extraction - sentence-similarity language: - en tags: - math - theorems - semantic-search - information-retrieval
Hugging Face2026-02-13 更新60
uw-math-ai/MELD-dataset
MELD(数学语言多样性下的等价性)是一个小型、手动策划的评估基准数据集,用于测试数学感知文本嵌入模型是否能够识别描述相同数学事实但使用不同数学子领域(如向量空间与模块理论)词汇、符号和惯例的语句之间的等价性。数据集包含270个正面对,每个正面对由两个等价的数学语句组成,涵盖9个数学领域(代数、概率、基础数学、代数几何、代数拓扑、谱图论、离散数学、表示论和代数组合数学)和18种表述框架。此外,数据
Hugging Face2026-06-20 更新40



