遇见数据集

uw-math-ai/MELD-dataset

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

MELD(数学语言多样性下的等价性)是一个小型、手动策划的评估基准数据集,用于测试数学感知文本嵌入模型是否能够识别描述相同数学事实但使用不同数学子领域(如向量空间与模块理论)词汇、符号和惯例的语句之间的等价性。数据集包含270个正面对,每个正面对由两个等价的数学语句组成,涵盖9个数学领域(代数、概率、基础数学、代数几何、代数拓扑、谱图论、离散数学、表示论和代数组合数学)和18种表述框架。此外,数据集还提供541个干扰项(硬负样本),这些干扰项是表面词汇相似但数学错误的语句,用于增加评估的对抗性。数据集结构包括两个JSON文件:adversarial_theorem_pairs_2.json(包含正面对和干扰项字典)和distractors_all.json(仅干扰项)。数据集设计强调对抗性:正面对在表面词汇上差异大,而干扰项与正确语句表面相似,以迫使模型依赖深层语义而非词汇重叠。该数据集仅用于评估(如配对相似性、检索或三元组评估),不适用于训练,所有语句为英语和LaTeX格式,基于Apache-2.0许可证发布。

MELD (Mathematical Equivalence under Linguistic Diversity) is a small, hand-curated evaluation benchmark for math-aware text embedding models. It tests the capability of recognizing that two statements describing the same mathematical fact are equivalent even when written in the vocabulary, notation, and conventions of different mathematical subfields (e.g., vector spaces vs. module theory). The dataset consists of 270 positive pairs, each containing two equivalent mathematical statements, spanning 9 domains (algebra, probability, foundations, algebraic_geometry, algebraic_topology, spectral_graph_theory, discrete_math, representation_theory, algebraic_combinatorics) and 18 distinct framings. Additionally, it includes a pool of 541 distractor statements (hard negatives) that are superficially similar but mathematically incorrect, designed to create an adversarial evaluation setting. The dataset is structured as two JSON files: adversarial_theorem_pairs_2.json (containing positive pairs and a distractor dictionary) and distractors_all.json (distractors only). It is adversarial by design: positive pairs share underlying meaning but differ in surface tokens, while distractors are lexically close to true statements. MELD is intended for evaluation only (e.g., paired similarity, retrieval, or triplet evaluation), not for training, with all statements in English and LaTeX format, and is released under the Apache-2.0 license.

提供机构:
uw-math-ai
原始信息汇总

数据集概述

数据集名称:MELD — Mathematical Equivalence under Linguistic Diversity

发布者:University of Washington Math AI Lab (uw-math-ai)

许可证:Apache-2.0

语言:英语(含 LaTeX 数学公式)

数据集大小:总文件大小 343 kB

数据规模:样本数 < 1K

任务类型

  • 句子相似度 (Sentence Similarity)
  • 特征提取 (Feature Extraction)
  • 文本检索 (Text Retrieval)

标签

mathematics mathlib theorem-embedding retrieval contrastive-learning hard-negatives

数据集结构

MELD 是一个手动的、对抗性的评估基准,用于测试数学感知文本嵌入模型。其核心目标是检验模型能否识别出在不同数学子领域的词汇、符号和惯例下,描述同一数学事实的两个语句是等价的。

数据集包含两个 JSON 文件:

  1. adversarial_theorem_pairs_2.json

    • 包含 270 个正向对 (positive pairs)。
    • 每个正向对包含两个语句(entry_1entry_2),它们使用不同数学子领域的表述方式(framing)描述同一个数学概念(topic)。
    • 同时内嵌了一个与 distractors_all.json 相同的干扰项字典。
    • 示例条目字段
      • id:唯一ID (1-270)
      • domain:源领域(共9个)
      • topic:共享的概念主题
      • entry_1{ "framing": str, "statement": str }
      • entry_2{ "framing": str, "statement": str }
  2. distractors_all.json

    • 一个 JSON 对象,将每个表述框架 (framing) 映射到一个干扰项语句列表(硬负例)。
    • 干扰项是在词汇上接近真实语句但存在数学错误的描述(如符号翻转、量词减弱等)。

统计信息

指标 数值
正向对总数 270
领域数 (Domains) 9
不同表述框架数 (Framings) 18
每个领域的正向对 30
干扰项语句总数 541

9个领域algebra probability foundations algebraic_geometry algebraic_topology spectral_graph_theory discrete_math representation_theory algebraic_combinatorics

18个表述框架vector spaces module theory probability measure theory set theory category theory geometry commutative algebra topology algebra graph theory linear algebra discrete math complex analysis representation theory Fourier analysis symmetric functions tableaux

评估协议建议

  • 配对相似性 / AUC:嵌入正向对中的两个语句,判断其相似度得分是否高于(一条语句,干扰项)组合。
  • 检索:将正向对中的一个语句作为查询,从所有正例语句和干扰项池中召回匹配的另一个语句,报告 Recall@k 或 MRR。
  • 对比 / 三元组评估:使用(正例1,正例2,干扰项)三元组来衡量正负例之间的间隔。

限制与预期用途

  • 仅限评估:数据集很小(270对),适用于诊断性基准测试,不适用模型训练。
  • 语言与格式:语句为自然语言数学描述并包含 LaTeX,不含 Lean 或其它形式化表示。
  • 对抗性构造:旨在测试特定的失败模式,并非真实世界中定理文本的代表性样本。
  • 数据冗余:干扰项字典在 adversarial_theorem_pairs_2.json 文件和 distractors_all.json 文件中重复出现。
搜集汇总
数据集介绍
uw-math-ai/MELD-dataset 数据集图片
构建方式
MELD数据集的构建采用对抗性范式,专注于评估数学感知文本嵌入模型在语言多样性下的语义等价识别能力。正面配对通过将同一数学概念置于两种不同的学科子领域表述框架中构建,例如将“向量空间张成”与“模论生成”作为等价陈述,确保表面词汇重叠极小。负面样本池则包含与正确陈述在词汇上高度接近但数学上错误(如符号反转、量词弱化)的句子。数据集包含270个正面配对,覆盖9个数学领域(如代数、概率、代数几何等),18种不同的表述框架,以及541个干扰项,通过手工精修确保平衡性与诊断性。
特点
MELD的核心特点在于其对抗性设计,精准挑战模型对跨框架数学等价性的理解。正面配对中,两个等价陈述共享底层数学意义但采用截然不同的术语与符号体系,迫使模型超越词汇重叠进行语义推理。干扰项则特意模仿正确陈述的句式与词汇,但引入细微数学谬误,如将“单射”替换为“满射”或“封闭集”替换为“开集”。数据集小而精(仅270对),覆盖9个领域与18种框架,强调诊断而非训练,且所有陈述使用英语与LaTeX格式,摒弃形式化定理表述。
使用方法
MELD作为评估基准,支持多种灵活的使用协议。可直接加载JSON格式文件,通过HuggingFace Hub下载包含配对与干扰项的`adversarial_theorem_pairs_2.json`及`distractors_all.json`。推荐评估方法包括:配对相似度分析(计算每个配对中两个陈述的嵌入余弦相似度,并与干扰项对比,报告ROC-AUC或准确率);检索任务(将`entry_1`作为查询,从所有`entry_2`与干扰项池中检索匹配项,计算Recall@k或MRR);三元组对比评估(构造(`entry_1`,`entry_2`,干扰项)三元组,衡量正负样本间的嵌入间距)。
背景与挑战
背景概述
MELD(Mathematical Equivalence under Linguistic Diversity)数据集由华盛顿大学数学人工智能实验室于近期创建,旨在评估数学文本嵌入模型对跨子领域语言变体的语义等价识别能力。该数据集的核心研究问题是:模型能否忽略词汇、符号和惯例的差异,精准判断两个描述相同数学事实的陈述是否等价。MELD作为Math2Vec项目的衍生基准,专注于对抗性评估,通过精心设计的270个正例对和541个硬负例,检验嵌入模型在表示理论、代数拓扑等9个数学子领域间的泛化能力。其设计理念强调表面词汇重叠的误导性,为数学文本表示学习提供了独特的诊断工具。
当前挑战
MELD数据集所解决的领域挑战是数学文本嵌入模型在跨子语言环境下语义等价判别的脆弱性。传统模型依赖词汇重叠,往往将含义相同但措辞迥异的陈述视为不同,而对表面相似但数学错误的负例则难以区分。构建过程中,研究团队面临两大挑战:一是如何针对9个数学领域设计18种框架的等价陈述,确保语义精确且覆盖广泛;二是如何生成类似但错误的硬负例(如符号翻转、量词削弱),使误导性样本具备有效鉴别力。此外,数据集规模虽小但需平衡各领域,以实现诊断性而非训练性的评估目标。
常用场景
经典使用场景
MELD数据集作为数学感知文本嵌入模型的评估基准,其核心使用场景在于测试模型对跨领域数学等价表述的识别能力。该数据集精心构建了270组正例对,每组将同一数学概念分别置于两种不同数学子领域的语言体系中描述(如向量空间语言与模论语言),同时配备541条在词汇层面高度相似但数学上错误的干扰项。研究者可通过配对相似度评估、检索任务或三元组对比等协议,系统性地检验嵌入模型能否有效捕捉深层的数学语义等价关系,而非依赖表面词汇重叠。这一设计使得MELD成为诊断数学文本表征模型语义理解深度的关键工具。
衍生相关工作
MELD数据集作为Math2Vec项目的衍生成果,其对抗性构造方法论已激发多个后续研究方向。直接相关的工作包括基于MELD设计的新型对比学习框架,通过在该基准上的性能反哺训练目标优化,如引导模型在嵌入空间中显式分离数学语义维度与表层语言维度。研究者还借鉴其跨领域配对设计,扩展至定理证明器的前提选择任务,利用类似结构提升形式化语料中的语义检索精度。此外,MELD的困难负样本生成策略被应用于数学领域的弱监督预训练数据构建,通过合成难以区分的数学错误陈述来增强嵌入模型的判别边界。这些衍生工作共同推动了数学感知语言模型从浅层统计匹配向深层语义理解的演进。
数据集最近研究
最新研究方向
在当前人工智能与数学交叉的前沿领域,MELD-dataset作为一项精妙构建的对抗性评估基准,专为检测数学感知文本嵌入模型在跨子领域语言多样性下的语义等价识别能力而设计。该数据集的核心挑战在于迫使模型超越词汇层面的表面相似性:正向样本对将同一数学定理以不同子领域的专门术语和符号体系表述,而负样本池则精心准备了词汇近似但数学内涵错误的干扰项。这种对抗性构造精准对应了当前大语言模型在严谨科学推理中的脆弱环节,尤其是当面对概念表述的跨领域翻译时,模型往往被词汇重叠所误导。MELD的诞生为评估和推动数学嵌入模型的鲁棒性提供了不可或缺的标尺,促使研究者关注语义深度的真实对齐,其9大数学领域、18种子语言框架的设计更彰显了数学语言多样性带来的独特挑战与机遇。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务