FairGround
收藏资源简介:
FairGround 是一个统一的框架、数据语料库和 Python 包,旨在推进公平机器学习分类的可重复研究和关键数据研究。FairGround 目前包含 44 个表格数据集,每个数据集都带有丰富的与公平性相关的元数据注释。我们的配套 Python 包标准化了数据集加载、预处理、转换和分割,简化了实验工作流程。通过提供多样化的、记录良好的数据集语料库以及强大的工具,FairGround 使得开发更公平、更可靠、更可重复的 ML 模型成为可能。所有资源都是公开可用的,以支持开放和协作的研究。
FairGround is a unified framework, data corpus, and Python package designed to advance reproducible research and critical data studies in fair machine learning classification. Currently, FairGround includes 44 tabular datasets, each accompanied by rich fairness-related metadata annotations. Our accompanying Python package standardizes dataset loading, preprocessing, transformation, and splitting, streamlining experimental workflows. By providing a diverse, well-documented dataset corpus and robust tools, FairGround enables the development of fairer, more reliable, and more reproducible ML models. All resources are publicly available to support open and collaborative research.
FairML Datasets 数据集概述
数据集基本信息
- 数据集名称: FairML Datasets
- 数据集类型: 公平分类数据集集合
- 数据包名称: fairml-datasets
- 支持数据集数量: 44个数据集
核心功能
数据加载
- 轻松下载、加载和准备语料库中支持的44个数据集
- 通过数据集ID直接访问特定数据集
- 支持完整的机器学习训练数据拆分
数据集管理
- 提供预设的数据集集合
- 支持在单个场景、五个或四十个数据集上评估算法
- 自动计算丰富的数据集元数据特征
数据处理
- 自动应用数据集预处理
- 可配置的处理选项和默认值
- 处理敏感属性以促进公平感知的机器学习实验
技术特性
- 编程接口: Python包
- 命令行支持: 提供命令行界面访问常见操作
- 安装方式: 可通过pip或uv安装
使用示例
python from fairml_datasets import Dataset dataset = Dataset.from_id("folktables_acsincome_small") df = dataset.load() df_transformed, info = dataset.transform(df) df_train, df_test, df_val = dataset.train_test_val_split(df_transformed)
命令行功能
- 生成和导出元数据
- 在不同处理阶段导出数据集
- 以BibTeX格式导出数据集引用
许可信息
- 代码、注释和生成的元数据采用双重许可
- 主要许可: Creative Commons Attribution 4.0 International License
- 补充许可: GNU GENERAL PUBLIC LICENSE 3
- 注意: 单个数据集可能具有不同的许可证

- 1Bias Begins with Data: The FairGround Corpus for Robust and Reproducible Research on Algorithmic Fairness德国慕尼黑路德维希马克西米利安大学统计系、慕尼黑机器学习中心、意大利的里雅斯特大学 · 2025年



