遇见数据集

uw-math-ai/Math2Vec-embedding-dataset

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Math2Vec嵌入数据集是一个用于数学嵌入模型训练的数据集,基于同一数学概念可以有多种表面形式(如非正式自然语言、重新表述、Lean 4类型签名和完整声明)的原则构建。该数据集旨在用于对比嵌入训练,以对齐这些不同视图。它包含三个配置:1) mathlib_views(默认配置),提供133,621个mathlib4概念的多视图表示,每个概念包含最多四个并行表示和三个LLM生成的困难负样本;2) meld,包含270个数学等价但词汇不同的语句对,用于评估嵌入模型是否捕捉数学等价性而非表面相似性;3) meld_distractors,提供541个干扰语句,覆盖18个数学领域,用于增强MELD检索评估的难度。数据集基于mathlib v4.19.0构建,所有自然语言内容均为英语,部分内容由LLM生成并经过质量验证。

The Math2Vec Embedding Dataset is a training dataset for mathematical embedding models, built around the principle that the same mathematical concept can be expressed in many surface forms—informal natural language, alternative rephrasings, Lean 4 type signatures, and Lean 4 full declarations. It is designed for contrastive embedding training that aligns these views. The dataset includes three configs: 1) mathlib_views (default), which provides multi-view representations for 133,621 mathlib4 concepts, each with up to four parallel representations and three LLM-generated hard negatives; 2) meld, which consists of 270 mathematically equivalent but lexically different statement pairs for evaluating whether embedding models capture mathematical equivalence rather than surface similarity; and 3) meld_distractors, which offers 541 distractor statements across 18 mathematical domains to make MELD retrieval evaluation harder. The dataset is based on mathlib v4.19.0, with all natural-language content in English and some content generated by LLMs with quality validation.

提供机构:
uw-math-ai
搜集汇总
数据集介绍
uw-math-ai/Math2Vec-embedding-dataset 数据集图片
构建方式
该数据集以数学概念的多视角对齐为核心构建理念,源于一个深刻的观察:同一数学概念在非正式自然语言、多种语义改写、Lean 4类型签名以及完整声明中呈现出迥异的表层形态。首先,研究者从FrenzyMath/mathlib_informal_v4.19.0中提取了133,621个mathlib4概念,每个概念天然携带nl_informal、lean_type和lean_signature三种视图。随后,通过Qwen3.5-9B模型对自然语言表述进行结构化分解,拆解为假设、结论与规范化的‘若H1且H2则C’范式。在此基础上,利用gemma-4-E4B-it模型以分解结果为结构引导,生成替代性自然语言表述,在保持数学等价的条件下变换句式、语态、量词顺序与变量命名,覆盖约85%的概念。为增强训练难度,以Qwen3.5-9B对每个概念生成三个硬负样本,通过细微省略、交换操作或否定假设与结论的方式产生视觉相似但数学上错误的变体。最后,引入LLM裁判对改写与硬负样本进行等价性验证,确保数据质量。
特点
该数据集最显著的特征在于其多视图并行的结构设计与跨模态对齐能力。每个概念最多可包含四种平行表示:原始非正式自然语言、大型语言模型生成的语义改写、Lean 4类型签名以及完整定理声明,这为对比学习提供了天然的锚点—正样本对。数学领域涵盖定理、引理、定义、推论等多种命题类型,模块名称与概念标识符的保留使得细粒度检索成为可能。特别地,数据集内置的分解信息(输入语句、假设列表、结论列表及规范化形式)为模型理解数学结构提供了显式监督信号。作为补充,MELD基准包含270对跨域等价语句对,覆盖从向量空间与模论到对称函数与表理论的九组互补数学领域,每对语句在数学上等价但在述语框架上截然不同,专门用于测试嵌入模型对数学等价性而非表层词汇相似性的捕捉能力。配套的541条干扰语句进一步扩充了检索难度,考验模型在混淆分布中的鲁棒性。
使用方法
数据集的使用路径依配置而异。对于mathlib_views配置,推荐采用多视角对比学习策略:对每个概念随机采样一对视图作为锚点与正样本,批次内的其他概念充当负样本,这种方式隐式覆盖自然语言与Lean两大模态之间的六种检索方向,无需显式的方向监督。用户可以基于HuggingFace datasets库轻松加载与迭代数据,若需更严苛的训练信号,亦可依据LLM裁判提供的等价性指标自行筛选改写与硬负样本。对于MELD评估配置,需将270对语句的540条表述嵌入为向量,并令每条语句从其所属对池中检索其真正配对的另一半,由于配对的数学等价语句在述语框架上完全不同,而池中其他共享同一框架的语句会在词汇层面形成强烈干扰,标准检索指标如Recall@k与平均倒数排名恰当地反映了模型的语义理解深度。部分研究者还可通过加入meld_distractors中的541条域分布语句将检索语料库扩展至1,081条候选,以更严苛地测试嵌入模型在杂乱分布中的判别能力。
背景与挑战
背景概述
在人工智能与形式化数学的交叉领域中,如何有效地桥接非正式数学语言与形式化证明系统之间的语义鸿沟,已成为一个核心研究问题。Math2Vec Embedding Dataset于近期由相关研究团队构建,旨在为数学嵌入模型提供多视图对比学习训练数据。该数据集基于Mathlib4的133,621个概念,为每个概念生成非正式自然语言描述、Lean 4类型签名与完整声明,以及由大语言模型生成的等价改写与困难负例,从而对齐不同数学表达形式。MELD评估集的引入进一步推动了跨领域数学等价性检索的研究。该数据集在形式化数学信息检索、数学嵌入模型预训练及数学推理能力评估等领域具有重要影响力,为数学AI社区提供了标准化训练与评测资源。
当前挑战
数据集面临的核心挑战包括:一是解决数学表达形式多样性与语义一致性之间的冲突——同一数学概念可能以不同自然语言句式、形式化类型签名或完整代码声明呈现,模型需学习其内在等价关系而非表面词汇相似;二是构建过程中大语言模型生成数据的质量可控性难题,例如针对85%概念生成的等价改写中,近14%被判定为不等价,78%的困难负例中约12%实际与正例等价,凸显自动生成数据中噪声处理与质量筛选的复杂性。此外,当前数据集仅覆盖Mathlib 4.19.0版本的英文数学概念,领域局限性与语言单一性限制了其泛化能力,且跨领域MELD评测对检索模型的细粒度区分能力提出了更高要求。
常用场景
经典使用场景
Math2Vec嵌入数据集专为数学嵌入模型的对比学习训练而设计,其核心场景在于对齐数学概念的多视角表示——包括非正式自然语言、改写语句、Lean 4类型签名及完整声明。通过采样同一概念的视图对作为正样本,将批次内其他概念作为负样本,模型能够隐式地学习跨NL和Lean模态的六种检索方向,无需显式的方向监督。这种多视图对比框架使得嵌入空间能够捕捉数学内容的语义等价性,而非表面的词汇相似性。
实际应用
在实际应用中,Math2Vec数据集可用于训练数学嵌入模型,支撑数学文献的智能检索系统——例如在arXiv或数学知识库中根据自然语言描述检索对应的形式化定理。它也可服务于数学教育助手,帮助学生理解同一概念在不同教科书中的等价表述。此外,该数据集能够增强大语言模型在数学问题解答时的语义匹配能力,提高对数学式中歧义和变体的鲁棒性,并支持程序员在Lean 4等证明助手中快速搜索相关定理。
衍生相关工作
基于该数据集衍生的工作包括MathLeap-Qwen-8B和MathLeap-Octen-8B等数学嵌入模型,这些模型通过对比训练显著提升了跨模态数学检索的性能。MELD评估集提供了9个跨领域配对(如集合论与范畴论、代数学与拓扑学)的270个等价对,已成为衡量数学嵌入语义理解能力的标准基准。此外,数据集中的硬负样本生成与质量验证方法为后续合成数学数据管道的构建提供了参考框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务