遇见数据集

MaDI-Bench

收藏
github2026-07-02 更新2026-07-05 收录
官方服务:

资源简介:

MaDI-Bench是一个端到端的数据集成基准测试,用于评估关系表的完整集成过程。它覆盖了五个领域(游戏、公司、音乐、产品、科学论文),每个领域包含基础任务及简单、中等、困难变体。基准测试提供了每个集成步骤(模式匹配、值规范化、实体分块、实体匹配和数据融合)的真实标注数据,包括超过93,000个标注记录对、1,000个人工验证的融合记录以及近11,000个人工验证的属性值。所有数据以CSV、JSON、XML等常见格式提供,支持逐步和端到端的性能评估。

MaDI-Bench is an end-to-end data integration benchmark designed to evaluate the full integration workflow of relational tables. It covers five domains: games, companies, music, products, and scientific papers. Each domain includes a basic task alongside simple, moderate, and difficult variants. The benchmark provides ground-truth annotated data for each core data integration step, including schema matching, value normalization, entity blocking, entity matching, and data fusion. It contains over 93,000 annotated record pairs, 1,000 manually verified fused records, and nearly 11,000 manually verified attribute values. All data is provided in common formats such as CSV, JSON, XML and other standard formats, supporting both step-by-step and end-to-end performance evaluation.

创建时间:
2026-06-10
原始信息汇总

MaDI-Bench:端到端数据集成基准

概述

MaDI-Bench(Mannheim Data Integration Benchmark)是首个用于评估关系型表格完整端到端集成的公开基准。它填补了现有基准仅评估集成流程中孤立步骤或缺失特定环节的空白,旨在衡量数据集成系统处理整个流程的综合性能。

核心任务与流程

每个MaDI任务接收多个异构源表作为输入,要求系统输出一个符合给定目标模式、且每个真实世界实体仅包含一条记录的单张输出表。解决任务需要处理数据集成流程的所有步骤:

  • 模式匹配
  • 值归一化
  • 实体分块
  • 实体匹配
  • 数据融合

基准包含内容

  • 5个领域,20个集成任务:涵盖游戏、公司、音乐、产品和科学论文。每个领域包含一个基础任务及简单中等困难三个变体。
  • 全流程的标注数据(Ground Truth):包括黄金模式映射、带标签的实体匹配训练/验证/测试集,以及人工验证的数据融合验证集和测试集。
  • 变体生成方法:基于八个可控的难度旋钮(difficulty knobs),为基础任务派生出不同难度的变体,确保基准随系统进步持续有效。
  • 验证运行:提供三条参考管线的验证结果:人工构建管线、最佳组合管线以及基于LLM的管线。

数据规模与格式

五个基础任务的工件包含超过93,000个标注记录对(用于实体匹配)、1,000条人工验证的融合记录(携带近11,000个人工验证的属性值),以及每个任务的黄金模式映射。所有工件均以通用格式(CSV、JSON、XML)发布。

仓库结构

  • use cases/:基准本身,包含全部20个集成任务的输入、标注数据及参考输出。
  • results/:验证运行结果,包含最佳组合管线(results/best of breeds/)和LLM管线(results/llm pipeline/)。
  • knobs/:八个难度旋钮的规格说明。
  • difficulty_dimensions.md:旋钮所操作的分阶段难度维度说明。
  • usecases_synthetic/:变体生成管线的代码、配置和测试。

任务目录结构示例

每个任务(use cases/<领域>/<难度>/)包含:

  • input/data/:源表(CSV)及schema.org元数据文件(JSON)。
  • input/schemamatching/:目标模式(JSON Schema)、黄金模式映射、分类法CSV。
  • input/entitymatching/:标注的实体匹配训练/验证/测试集。
  • input/fusion/:标注的融合记录文件。
  • config/:难度配置文件(仅变体任务)。
  • output/:人工管线的参考输出。

如何开始

任何集成系统可直接消费任务文件:源表为CSV格式,每个表附有schema.org元数据;目标模式为JSON Schema格式,固定了输出列、属性值约束及分类层次。用户可使用PyDI数据集成框架复现参考管线或利用分阶段评估类进行自定义评估。

参考文献

如需引用MaDI-Bench,请引用:

@misc{steiner2026madibench, title = {MaDI-Bench: An End-to-End Data Integration Benchmark}, author = {Steiner, Aaron and Peeters, Ralph and Bizer, Christian}, year = {2026}, eprint = {2606.30371}, archivePrefix = {arXiv}, primaryClass = {cs.DB}, url = {https://arxiv.org/abs/2606.30371} }

搜集汇总
数据集介绍
MaDI-Bench 数据集图片
构建方式
MaDI-Bench以系统化的方式构建,覆盖了数据整合的完整流程,包括模式匹配、值归一化、实体阻塞、实体匹配与数据融合五个关键步骤。该基准涵盖了游戏、公司、音乐、产品和科学论文五个应用领域,并为每个领域构建了一个基础任务以及简单、中等、困难三种难度变体。变体生成基于八个可控的困难度旋钮,能够灵活调整任务复杂度。所有基准测试人工产物均包含超过93,000个标注的记录对、1,000个人工验证的融合记录以及近11,000个人工验证的属性值,并提供了每个步骤的黄金标准数据。
特点
MaDI-Bench在数据整合领域具备独特优势,它是首个为关系表格的全流程端到端整合而设计的公共基准。其核心特性在于提供了完整的流程覆盖和每个步骤的地面真值,使得系统能够在逐步和端到端两个层面被同时评估。这种设计能够有效捕捉误差在流水线中的传递效应,精准反映其对最终整合结果的影响。此外,通过预设的难度旋钮机制,该基准能够防止因系统进步而快速饱和,保持了长久的评测价值和挑战性。
使用方法
使用者可直接利用各任务文件夹中的CSV源表、JSON Schema目标模式以及黄金标准映射来驱动自己的整合系统。具体操作包括加载输入数据、应用模式匹配和实体匹配算法,并生成符合目标模式且每实体仅有一条记录的融合表。为便于复现和比较,基准提供了基于PyDI框架的参考流水线,包括人工构建、最佳组合和基于大语言模型三种基线。所有数据均以通用格式公开,便于直接加载和评估,同时提供了详细的分步评估器用于模块化性能分析。
背景与挑战
背景概述
数据集成作为将异构数据集融合为统一、连贯表示的关键技术,长期以来面临从模式匹配、值归一化到实体解析与数据融合等一系列相互依赖的子任务。然而,现有基准评测多聚焦于单一环节或仅覆盖不完整的集成管线,缺乏对端到端流程的整体评估。2026年,由德国曼海姆大学数据与网络科学组的Aaron Steiner、Ralph Peeters与Christian Bizer联合创建的曼海姆数据集成基准(MaDI-Bench)应运而生,旨在填补这一空白。该基准首次提供了涵盖全部集成步骤的端到端关系表集成评测框架,包含跨游戏、公司、音乐、产品与科学论文五个领域的20项集成任务,并设计了基于八种可控难度旋钮的任务变体生成方法,以延缓基准饱和。基准附有超过9.3万个标记实体对、约1000条人工验证的融合记录及完整的金标准映射,为数据集成领域提供了系统性的评测基石。
当前挑战
MaDI-Bench所应对的核心领域挑战在于数据集成流程中错误级联效应的量化难题:各子任务的误差会沿管线逐级传递并放大,最终严重损害融合结果质量,而现有孤立评测方法无法揭示这一全局影响。此外,基准构建面临多重实践挑战:其一,需为五大领域的20项任务手工标注完整的模式映射、实体匹配与数据融合金标准,确保标签一致性与领域覆盖度;其二,设计八种难度旋钮以衍生不同难度的任务变体,要求旋钮对每个集成环节(如源表重叠度、属性噪声水平、模式异构性)产生可控且可复现的影响;其三,需同时提供步骤级与端到端两套评价体系,既支持管线开发者诊断瓶颈,又能测量整体性能。最终,基准通过三种参考管线(人工工程管线、最佳组合管线与基于大语言模型的管线)的验证实验,证实了其作为评测工具的有效性与可持续性。
常用场景
经典使用场景
MaDI-Bench作为首个覆盖数据整合全流程的端到端基准测试,在关系型表格的异构数据源整合场景中发挥着关键作用。研究者可借助该基准,系统性地评估从模式匹配、数值标准化、实体分块、实体匹配到数据融合的完整管道性能。其提供的20项跨领域任务(涵盖游戏、公司、音乐、产品和科学论文五大领域)及简易、中等、困难三种变体,使得不同复杂度的整合方法能够在统一框架下进行公平比较。
解决学术问题
该基准有效解决了学术界长期存在的端到端数据整合评估缺失问题。传统基准多聚焦于单一环节,忽略了错误在管道中逐级传播的累积效应。MaDI-Bench通过提供每个步骤和最终输出的真实标注,使研究能够量化各环节错误对整体整合质量的影响。这一突破推动了基于整体优化的数据整合方法论发展,为探索模式匹配、实体解析与冲突消解之间的内在关联机制提供了关键实验支撑。
衍生相关工作
围绕MaDI-Bench已衍生出多项重要成果。基于其验证过程,研究者构建了三种典型参照管道:人工工程管道、最优组合管道以及基于大型语言模型(LLM)的智能管道。这些管道不仅展示了不同技术路线在端到端整合中的性能差异,更催生了后续关于LLM辅助模式发现、自适应实体分块策略以及可解释性数据融合机制的研究方向。此外,其所依赖的PyDI框架也因基准的推广而成为数据整合适配器研究的通用平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务