遇见数据集

GouDa

收藏
arXiv2026-07-22 更新2026-07-24 收录
数据链接:
官方服务:

资源简介:

GouDa是由哈根大学研究团队开发的一款综合性合成数据生成工具,旨在为数据质量基准测试提供灵活且可复现的数据集。该工具支持生成JSON格式的表格化和半结构化数据,无需依赖现有数据集,通过自定义属性值列表和多种生成函数实现高度真实的数据模拟,并允许以可控方式插入缺失值、语法违规等20余种错误类型。其创建过程基于GouDa模式定义(GSD)模板,结合图形用户界面实现交互式数据生成,同时自动生成干净数据版本和错误日志作为基准真值。该数据集主要应用于数据清洗算法评估、机器学习模型测试及数据质量研究领域,致力于解决合成数据在真实性、错误覆盖和多格式支持方面的核心挑战。

GouDa is a comprehensive synthetic data generation tool developed by the research team at the University of Hagen, designed to deliver flexible and reproducible datasets for data quality benchmarking. This tool supports the generation of tabular and semi-structured data in JSON format, without relying on pre-existing datasets. It enables highly realistic data simulation via custom attribute value lists and diverse generation functions, and allows controlled insertion of over 20 types of errors including missing values and syntax violations. Its development is grounded in GouDa Schema Definition (GSD) templates, and it supports interactive data generation through a graphical user interface (GUI), while automatically producing clean data versions and error logs as ground truth. This tool is primarily applied in the domains of data cleaning algorithm evaluation, machine learning model testing and data quality research, and is committed to addressing the core challenges of synthetic data in terms of authenticity, error coverage and multi-format support.

创建时间:
2026-07-22
原始信息汇总

GouDa - Generation of universal Datasets 数据集详情

  • 项目名称:GouDa
  • 项目ID:79781857
  • 创建时间:2026年2月25日
  • 项目描述:GouDa 是一个基于 Spring Boot 的数据生成框架,用于根据 GouDa JSON schema 定义(GSD)创建合成数据集。它提供灵活的系统和多种内置生成器,能生成包括姓名、日期、计算值、分布数据在内的真实测试数据,并支持可自定义的错误注入,用于数据质量测试。同时支持通过 CLI 和 REST API 接口管理项目并生成数据。

核心功能

  1. 数据生成

    • 支持通过输入文件(JSON 格式)定义数据生成规则。
    • 提供多种数据生成函数,包括:
      • 唯一值生成 (unique):确保属性值唯一,重复则标记为 "- DUPLICATE -"。
      • 轮流取值 (alternate):根据概率在两个值之间切换。
      • 计算 (calculate):对两个数值进行数学运算(加、减、乘、除、模、幂)。
      • 数组求和 (customArraySum):计算数组元素总和。
      • 类型转换 (toInt):将数值截断为整数。
      • 标识符生成 (customAsin):生成类似 ASIN 的10位随机数字标识符。
      • 统计分布生成 (customDistribution):根据指定分布类型(如正态、均匀)生成值。
      • 概率性别生成 (genderWithProbability):根据概率生成“male”或“female”。
      • 随机整数数组生成 (customRandomArray):生成可配置长度和范围的随机整数数组。
    • 提供基于字典的生成器(从预定义字典文件中读取数据):
      • customFirstNamecustomLastNamecustomBrandcustomProductcustomIndustrycustomPostcustomImgUrlcustomFeedbackcustomSetcustomDerivedValue
      • 大多数生成器支持可重复的随机种子设置。
  2. 错误生成

    • 支持在数据中可控地注入错误,生成三个文件:含错误的数据集、无错误的数据集(真实值)、列出所有错误的文本文件。
    • 错误生成按层级分类:
      • 层级1(单条记录单属性值):缺失值、语法错误、值域违规、集合违规、拼写错误、上下文不匹配值、值项超出上下文、无意义值、错误值。
      • 层级2(单属性所有值):属性内重复、统计分布异常值。
      • 层级3(单条记录内多属性值):半空元组、计算值错误、元组无关项、派生值错误。
      • 层级4(跨多条记录):实体重复、偏差与类不平衡。
    • 支持用户自定义新的错误类型,通过扩展 ErrorCommand.javaErrorGenerator.java 实现。
  3. 关系定义

    • 支持在输入文件中通过命令定义记录间的关系,包括:
      • 无关系 (None)
      • 1:1 关系 (OneToOne)
      • 1:n 关系 (OneToMany)
      • n:m 关系 (ManyToMany)

快速开始

  • 通过 docker compose up 命令启动应用程序。
  • Web UI 访问地址:http://localhost

技术架构

  • 框架:Spring Boot
  • 接口:提供 CLI 和 REST API 接口(含 Swagger UI 文档)。
  • 配置:支持 Spring 配置和对象模型定义。
  • 项目管理:可通过后端系统管理项目,支持 JSON 序列化与反序列化。
  • 部署:提供 Docker Compose 文件和 JAR 包。
搜集汇总
数据集介绍
GouDa 数据集图片
构建方式
在数据质量与数据清洗研究中,合成数据因能覆盖真实数据难以获取的边缘场景而备受青睐。GouDa通过基于JSON的GouDa Schema Definitions(GSD)模板驱动数据生成,用户可灵活定义数据结构与属性值,并利用三类生成器(普通生成器、字典生成器、错误生成器)指定数值范围、从自定义文本文件随机取值或按设定错误率注入异常。系统支持单实体与多实体类型,并通过GUI简化配置流程,最终同时输出含错误的脏数据版本与无错误的标准版本,确保地面真值可用。
特点
GouDa具有高度灵活性与现实性,其核心优势在于无需依赖既有数据集即可生成贴近真实场景的合成数据。它支持多种数据格式(如JSON),不仅涵盖关系型表格数据,还能生成面向NoSQL数据库的半结构化数据。丰富的错误类型库覆盖缺失值、语法违规、重复、异常值等16种错误,且错误率可自由调控。借助可扩展的自定义属性值列表与可复现的GSD文件,数据生成兼具可移植性与可重复性,特别适用于数据质量基准测试与清洗算法的公平对比。
使用方法
使用GouDa时,用户首先通过Docker容器快速启动前后端服务,随后在图形界面上依据需求选择实体类型、定义字段结构并调用生成器,亦可直接编辑JSON格式的GSD模板实现精细控制。对关系型数据,系统支持一对一、一对多及多对多关联,并允许设定数据量规模与分布模式。生成的JSON结果可被pandas直接解析为DataFrame,或直接导入MongoDB数据库,便于接入现有分析与评估流水线。用户还可通过共享GSD文件实现数据集的跨研究复现,显著提升数据质量研究的可重复性与公平性。
背景与挑战
背景概述
在数据科学与机器学习领域,合成数据的生成对于数据质量评估、数据清洗算法验证以及基准测试具有不可替代的价值。针对真实数据在隐私保护、场景覆盖度及公平比较等方面的局限性,德国哈根大学FernUniversität研究团队于2022年提出了GouDa数据集生成工具,并在2026年迭代至2.0版本。该研究由Valerie Restat、André Conrad、Kevin M. Kramer及Uta Störl主导,核心研究问题在于如何构建一个能够灵活生成多种格式(关系型与NoSQL)、可控注入广泛错误类型、同时提供无错版本的真实感合成数据生成器。GouDa通过JSON schema定义、自定义属性值列表、多元生成函数及图形化界面,显著提升了数据质量研究中的基准测试标准化与可复现性,对数据清洗与数据质量评价领域具有重要推动作用。
当前挑战
GouDa所应对的领域挑战主要源于数据质量研究中对高质量测试数据的迫切需求:现有真实数据集常存在隐私泄露风险、场景覆盖不全面、且已被大语言模型学习导致公平比较失效,亟需可灵活定制的合成数据。具体挑战包括:1)生成的数据必须在保持高度真实感的同时,覆盖边界与极端情况;2)需支持关系型表格数据及NoSQL半结构化数据的多格式输出;3)须实现多达十余种错误类型(如缺失值、格式违规、派生值错误、冗余、异常值等)的可控注入,并同步生成带错版本与无错真值版本;4)构建过程中需解决不同错误类型的随机分布与错误率灵活配置的平衡问题,确保数据既反映真实场景的误差分布又便于算法性能的归因分析。
常用场景
经典使用场景
在数据质量与数据清洗研究领域,GouDa数据集被广泛用于基准测试与算法评估。研究人员通过该工具生成包含可控错误的合成数据,并同时获得无错误的真实版本,从而在无需真实数据的前提下,系统地评估不同清洗算法的性能。其支持多种数据类型(如表格数据、NoSQL半结构化数据)及丰富的错误类型(如缺失值、拼写错误、单位错误、属性依赖违反等),为数据清洗、异常检测、数据修复等任务提供了标准化、可复现的测试平台。特别是当真实数据因隐私或稀缺性无法获取时,GouDa生成的逼真数据能够有效模拟实际场景,推动研究方法的公平比较和验证。
实际应用
在工业界,GouDa已被应用于制药与诊断企业的数据质量评估场景。通过模拟企业信息系统中常见的错误类型(如缺失值、冗余记录、属性不一致),企业能够在不暴露敏感生产数据的前提下,测试其数据管道对不同错误率的鲁棒性。例如,对于包含啤酒产品信息的数据集,GouDa可生成含有写入单位错误、拼写错误的版本,用于验证数据清洗规则的有效性。此外,其支持大规模数据伸缩(通过调整生成参数),使企业能够评估清洗工具在数据量激增时的扩展性。由于输出格式为通用JSON,该数据集可无缝接入MongoDB等NoSQL系统,符合现代微服务架构的数据处理需求。
衍生相关工作
GouDa的研究衍生了一系列重要工作。原始GouDa论文(RBCS22)奠定了数据生成与错误注入的核心框架,后续的GouDa 2.0版本(即当前论文)新增了图形化用户界面与抽象数据模型,极大降低了使用门槛。在此基础上,研究者将其与现有清洗算法(如Raha、Baran)集成,验证其生成的合成数据在错误检测任务中的有效性。此外,GouDa的架构设计启发了针对缺失值机制(如MAR、MNAR)的扩展研究,以及多数据源错误生成功能的规划。其可复现的GSD配置文件机制也为社区构建共享基准库(如用于数据质量的FAIR数据集)提供了标准化模板,推动了数据清洗领域的系统化评估范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务