遇见数据集

retainiq-data

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

本数据集是IBM HR Analytics Employee Attrition & Performance数据集,作为RetainIQ(员工流失预测)项目的训练数据使用。该数据集由IBM数据科学家创建,是完全合成的虚构数据,用于展示IBM Watson Analytics在人力资源流失分析方面的能力,并非从真实的人力资源运营中收集。数据集包含1,470行(每位虚构员工对应一行)和35列。预测目标为二元分类变量Attrition(流失与否),其中正例(Yes)占比16.1%,数据存在不平衡。数据集中无缺失值,但包含受保护属性,如年龄、性别和婚姻状况。数据字段涵盖多个维度:包括标识符(EmployeeNumber)、常量列(如EmployeeCount)、人口统计信息、教育背景(如教育程度、教育领域)、职位与组织信息(如部门、岗位、出差频率、加班情况)、薪酬(如月收入、时薪、加薪比例)、任期与工作历史(如总工作年限、在公司年限、晋升后年限)、参与度与满意度评分(如工作满意度、环境满意度、工作生活平衡,均为1-4或1-5的序数等级)以及其他信息(如通勤距离)。需注意,许多数值列(如满意度评分)本质上是编码的序数分类变量,而非连续量。该数据集主要用于AI治理课程中的端到端机器学习和公平性分析教学。由于数据是合成的,其模式是人为设计的,因此从中得出的任何结论都不应被视为对现实世界员工流失驱动因素的真实主张。数据集公开可用,但具体的许可证条款较为宽松。

This dataset is the IBM HR Analytics Employee Attrition & Performance dataset, used as training data for the RetainIQ (Employee Attrition Prediction) project. It was created by IBM data scientists and is entirely synthetic fictional data, designed to demonstrate the capabilities of IBM Watson Analytics in HR attrition analysis, and is not collected from real HR operations. The dataset contains 1,470 rows (one for each fictional employee) and 35 columns. The prediction target is the binary classification variable Attrition (whether attrition occurs or not), with the positive class (Yes) accounting for 16.1%, indicating data imbalance. There are no missing values in the dataset, but it includes protected attributes such as age, gender, and marital status. The data fields cover multiple dimensions: including identifiers (EmployeeNumber), constant columns (e.g., EmployeeCount), demographic information, educational background (e.g., education level, field of education), job and organizational information (e.g., department, job role, business travel frequency, overtime), compensation (e.g., monthly income, hourly rate, salary hike percentage), tenure and work history (e.g., total working years, years at the company, years since last promotion), engagement and satisfaction scores (e.g., job satisfaction, environment satisfaction, work-life balance, all on ordinal scales of 1-4 or 1-5), and other information (e.g., distance from home). Note that many numerical columns (e.g., satisfaction scores) are essentially encoded ordinal categorical variables rather than continuous quantities. This dataset is primarily used for teaching end-to-end machine learning and fairness analysis in AI governance courses. Since the data is synthetic and its patterns are artificially designed, any conclusions drawn from it should not be considered as real claims about real-world drivers of employee attrition. The dataset is publicly available, with relatively permissive licensing terms.

创建时间:
2026-06-27
原始信息汇总

数据集概述:RetainIQ Training Data (IBM HR Attrition, synthetic)

  • 数据集名称:IBM HR Analytics Employee Attrition & Performance
  • 用途:作为 RetainIQ(员工流失预测)模型的训练数据,用于教学和AI治理课程。
  • 规模:1,470 行 × 35 列,每行代表一名(虚构)员工。
  • 预测目标Attrition(流失),正样本占 16.1%(237 例 Yes / 1,233 例 No),类别不平衡。
  • 数据性质合成数据,由 IBM 数据科学家创建,并非真实员工记录。
  • 缺失值:无缺失值。
  • 敏感属性:包含年龄(Age)、性别(Gender)、婚姻状况(MaritalStatus)。
  • 许可:公开教育用途,具体条款松散(原始来源链接而非重新托管)。

数据构成

  • 每行:一个虚构员工,包含 35 个字段。
  • 字段分类
    • 目标变量Attrition(Yes/No)。
    • 标识符(非特征)EmployeeNumber(唯一,不连续)。
    • 常量/无信息EmployeeCount(=1)、StandardHours(=80)、Over18(=Y)。
    • 人口统计学/敏感属性Age(18–60)、Gender(Female/Male)、MaritalStatus(Single/Married/Divorced)。
    • 教育Education(1–5,有序)、EducationField(6 类)。
    • 角色与组织Department(3 类)、JobRole(9 类)、JobLevel(1–5)、BusinessTravel(3 类)、OverTime(Yes/No)。
    • 薪酬MonthlyIncome(1,009–19,999)、MonthlyRateDailyRateHourlyRatePercentSalaryHike(11–25)、StockOptionLevel(0–3)。
    • 任期与历史TotalWorkingYears(0–40)、YearsAtCompanyYearsInCurrentRoleYearsSinceLastPromotionYearsWithCurrManagerNumCompaniesWorked(0–9)、TrainingTimesLastYear(0–6)。
    • 敬业度/满意度(1–4 有序量表)JobSatisfactionEnvironmentSatisfactionJobInvolvementRelationshipSatisfactionWorkLifeBalancePerformanceRating(仅出现 3 或 4)。
    • 其他DistanceFromHome(1–29)。
  • 重要说明:许多“数值”列实际上是编码的有序类别(1–4/1–5 量表),而非连续数量。
  • 数据质量:无缺失值;PerformanceRating 缺乏低评级;整体过于干净,符合合成数据特征。

数据采集过程

  • 采集方式:非真实采集,由 IBM 生成(生成方法未记录)。
  • 时间范围/抽样/伦理审查:未记录(对合成数据来说基本无关)。

预处理/清洗/标注

  • 分发状态:已清洗,无缺失值,包含数值和类别字段。
  • 用于 RetainIQ 的处理:详见仓库中的 DATA_REMEDIATION_LOG.md(包含丢弃、编码、缩放、类别权重、偏差处理等记录)。
  • 原始数据保留:保留未修改的规范副本。

用途

  • 预期用途(本课程):通过 RetainIQ 教学生成式机器学习与AI治理(二分类),包括公平性分析。
  • 注意事项
    • 数据为合成数据,模式是设计的,不能代表真实世界情况。
    • 过度干净整洁可能滋生虚假信心。
    • 注意编码量表和 PerformanceRating 的异常。

分发与许可

  • 可用性:公开于 Kaggle 及多个镜像站点。
  • 版权策略:为避免许可模糊,本仓库不重新托管原始文件,仅提供链接。
  • 下载地址:https://www.kaggle.com/datasets/pavansubhasht/ibm-hr-analytics-attrition-dataset
  • 可复现性:课程保留验证过的本地副本;学习者从上述链接下载同一文件。

维护

  • 维护者:无活跃维护者,为静态数据集。
  • 本副本:为课程版本化管理,可进行校验和完整性检查。

RetainIQ 关联

该数据集被用作 RetainIQ 训练数据的替代品(代表单一雇主的员工数据)。教学简化说明:真实 RetainIQ 会基于经同意的、真实的、可能来自多个客户的员工数据进行训练,此处明确标注了这一差距而非假装数据集真实。

搜集汇总
数据集介绍
retainiq-data 数据集图片
构建方式
在人力资源分析领域,高质量的训练数据是构建预测模型的基础。RetainIQ训练数据基于IBM HR Analytics Employee Attrition数据集构建,该数据集由IBM数据科学家以合成方式生成,而非从真实员工中采集。数据包含1470条记录,每条对应一名虚构员工,涵盖35个特征列,包括人口统计学信息、教育背景、岗位角色、薪酬待遇、任职时长及工作满意度等维度。预测目标为员工离职状态(Attrition),正例占比16.1%,呈现类别不均衡特性。数据已预先清洗,无缺失值,但多数数值型列实为编码后的有序类别变量,需谨慎处理。
特点
该数据集的核心特点在于其合成属性与教学导向的精心设计。所有特征均呈现人为构造的规整性,例如PerformanceRating仅包含3和4两个等级,反映了理想化的数据分布。数据集中包含Age、Gender、MaritalStatus等受保护属性,为公平性分析提供了天然素材。虽然不存在真实隐私信息,但这一设计模拟了现实部署中可能面临的伦理挑战。数据集大小适中,兼具分类与数值特征,适合用于二元分类任务的标准化教学场景。
使用方法
使用RetainIQ数据集时,建议遵循规范的机器学习流程。首先,需注意目标变量Attrition的类别不均衡问题,可采用重采样或加权策略加以应对。接着,应正确处理编码序数特征,如将职业满意度1-4等级视为类别而非连续变量。对于受保护属性,建议在模型训练后进行公平性评估,检验是否存在歧视性模式。本数据集的官方版本可通过Kaggle获取,为保持可复现性,建议固定版本并记录数据预处理决策,同时参考配套的DATA_REMEDIATION_LOG.md文件以追踪所有数据准备工作。
背景与挑战
背景概述
RetainIQ数据集源于IBM数据科学家创建的IBM HR Analytics Employee Attrition & Performance合成样本数据,旨在模拟员工流失预测场景,用于展示IBM Watson Analytics的HR分析能力。该数据集于2018年前后发布,包含1470行、35列虚构员工信息,核心研究问题聚焦于二元分类任务——预测员工是否会离职。作为AI治理实验室课程的教学数据,它被重命名为RetainIQ,以模拟真实企业部署中的训练数据。尽管为合成数据,其在人力资源分析领域具有广泛影响力,常用于演示机器学习流程、公平性分析以及AI治理实践,尤其强调保护属性(如年龄、性别、婚姻状况)带来的伦理挑战。然而,数据集缺乏正式文档,促使研究团队遵循Datasheets for Datasets方法自建数据清单,以揭示真实世界中数据治理的常见漏洞。
当前挑战
该数据集面临的挑战主要体现在三个方面。首先,领域问题方面,它解决了员工流失预测的二元分类任务,但存在严重类别不平衡(正例仅占16.1%),且保护属性(年龄、性别、婚姻状况)可能引入公平性偏差,需在模型开发中兼顾准确性与伦理合规。其次,数据合成特性导致模式人为设计而非真实观测,削弱了结论的泛化性,训练结果无法直接应用于实际HR场景,易滋生虚假信心。构建过程中,原始来源的许可条款模糊不清,迫使团队仅能链接而不重新托管文件;同时,编码顺序量表(如1–4满意度的等级)与性能评级(仅出现3–4)等数据质量异常,需谨慎处理以避免误导性分析。
常用场景
经典使用场景
在人力资源分析领域,该数据集最经典的用途是构建员工离职预测的二元分类模型。研究者利用其中35个特征,包括人口统计学属性、工作角色、薪酬水平、任职年限以及员工满意度评分等,以'Attrition'为预测目标,通过逻辑回归、随机森林、梯度提升树等传统机器学习算法,或采用深度神经网络等先进技术,评估不同因素对员工离职倾向的预测效力。该数据集因其结构完整、无缺失值且包含真实标注,成为教学与入门研究的优选材料,广泛应用于特征工程、类别不平衡处理及模型评估等经典机器学习流程的示范。
实际应用
在实际应用场景中,该数据集为企业HR部门构建员工保留预警系统提供了原型基础。基于该数据训练的模型可嵌入人力资源仪表板,实时评估在职员工的离职概率,辅助管理者及早介入关键岗位人才的留存工作。此外,通过识别薪酬满意度、加班频率、晋升间隔等关键驱动因素,组织能够制定更具针对性的激励方案与职业发展路径,优化整体人力资本配置。尽管数据为合成性质,但其分析框架已迁移至真实世界,帮助零基础团队快速搭建从数据清洗到模型部署的完整工作流。
衍生相关工作
围绕该数据集,学术界与工业界衍生出一系列经典工作。在特征工程层面,研究者探索了对满意度等级变量的最优编码策略,并引入多模态融合方法提升预测精度。在公平性方向,多项工作基于该数据集开发了偏差检测工具包与后处理公平性修正算法。此外,该数据集被广泛用于对比研究,例如比较AutoML框架与传统手工调参的效能差异,以及评估生成式对抗网络在合成少数类离职样本以缓解类别不平衡上的效果。这些衍生工作共同丰富了人类对HR数据挖掘方法论的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务