遇见数据集

nbl-open-9076-2c50ec-customer-churn

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集包含一家区域电信运营商的客户流失记录,共7043个样本,21个字段,源自UCI机器学习库的Telco Customer Churn数据集。数据广泛用于客户保留与订阅行为建模,特别适用于开发客户流失预测模型。数据集采用CC-BY-4.0许可协议。

This dataset contains customer churn records from a regional telecom operator, with 7043 samples and 21 fields, sourced from the Telco Customer Churn dataset in the UCI Machine Learning Repository. The data is widely used for modeling customer retention and subscription behavior, particularly for developing customer churn prediction models. The dataset is licensed under CC-BY-4.0.

创建时间:
2026-08-22
原始信息汇总

数据集概述

名称: Telco Customer Churn(电信客户流失数据集)

描述: 该数据集包含一家区域电信运营商的客户流失记录,广泛应用于客户留存与订阅行为建模。

数据规模

  • 行数: 7,043 条
  • 字段数: 21 列

数据来源

  • 上游来源: UCI Machine Learning Repository - Telco Customer Churn
  • 原始链接: https://archive.ics.uci.edu/dataset/563/telco+customer+churn

用途

该数据集主要用于开发客户流失预测模型。

许可证

  • SPDX 许可证标识: cc-by-4.0
  • 该数据卡信息自初始注册发布之日起,符合项目许可政策要求。
搜集汇总
数据集介绍
nbl-open-9076-2c50ec-customer-churn 数据集图片
构建方式
该数据集源自UCI机器学习库中有关某区域电信服务商的客户流失记录,经整理与规范后以开放许可方式发布,共包含7,043条样本、21个字段。其构建以真实订阅行为与留存状态为基础,围绕客户账户、服务使用与合同信息等维度组织字段,并保留对应的流失标签,从而为监督学习提供结构清晰、来源可溯的数据基础,便于开展模型训练与验证。
使用方法
在使用时,可将该数据集用于构建客户流失预测模型,以客户属性、服务与合同信息等作为输入特征,以流失标签作为预测目标,完成分类任务的训练与测试。研究者可开展特征工程、类别不平衡处理与模型对比,并依据业务场景设定评估指标;同时应遵循开放许可要求,在学术或应用实践中注明来源并保持数据使用合规。
背景与挑战
背景概述
客户流失预测是电信行业客户关系管理的核心议题,其研究根植于数据挖掘与机器学习在商业分析中的广泛应用。该数据集源自UCI机器学习库,由区域电信提供商提供,记录了7,043条客户订阅行为与流失状态,涵盖21个字段,旨在为留存建模提供标准化基准。自发布以来,其被广泛用于分类算法比较与特征工程研究,推动了生存分析、集成学习等方法在客户生命周期管理中的落地,对提升客户保留策略的精准性与可解释性具有重要参考价值。
当前挑战
该数据集所应对的领域问题为不平衡二分类下的客户流失预测,即从多维异构特征中识别潜在流失者,其难点在于流失样本占比偏低导致模型偏向多数类,以及特征间存在多重共线性与缺失值干扰。构建过程中面临的挑战包括:原始数据源自单一区域运营商,样本代表性有限,可能引入地域偏差;字段语义需统一映射,类别变量编码方式影响模型泛化;此外,客户行为随时间动态演变,静态快照难以刻画时序依赖,对模型鲁棒性与可迁移性构成持续考验。
常用场景
经典使用场景
在客户关系管理与用户留存分析的领域中,该数据集凭借其涵盖人口统计特征、所订阅服务类型、合同期限以及计费方式等多维字段,成为构建客户流失预测模型的经典基准。研究者通常以是否为流失客户作为目标标签,将其他二十个变量作为输入特征,借助逻辑回归、随机森林、梯度提升树等分类算法训练二分类预测器,并通过准确率、召回率、F1值与AUC等指标评估模型表现,进而识别出对流失最具判别力的特征组合。
解决学术问题
该数据集有效缓解了客户流失研究中因缺乏公开、结构清晰且标注完整的真实业务数据而导致的实证困难。它为探究类别不平衡、特征重要性排序以及模型可解释性等核心学术议题提供了理想试验场,使研究者能够在统一数据基准上比较不同算法与采样策略的效能,从而推动预测建模方法论在服务行业的验证与迭代,其意义在于将抽象的机器学习理论锚定于具有明确商业语义的现实问题之上。
实际应用
在电信运营商的日常经营中,该数据集所承载的分析范式被广泛应用于客户流失预警系统的搭建。企业可依据模型输出的流失概率对高风险用户进行分层,并针对性地设计挽留策略,例如优化合约条款、调整资费结构或推送个性化增值服务。此类应用不仅有助于降低客户获取成本、延长用户生命周期价值,亦能为营销资源的精准投放提供数据支撑,进而提升整体运营效率与市场竞争力。
数据集最近研究
最新研究方向
电信客户流失预测作为客户关系管理中的关键议题,近年来在机器学习与商业智能交叉领域持续引发关注。围绕该数据集的前沿研究正从传统分类模型向集成学习、深度学习及可解释性人工智能方向演进,研究者致力于在非平衡数据条件下提升预测精度与泛化能力。与此同时,联邦学习与隐私保护技术的引入为跨运营商数据协作提供了新范式,而因果推断方法则被用于揭示流失行为背后的驱动机制。这些进展不仅推动了客户保留策略的精准化,也为电信行业在激烈竞争环境中优化用户生命周期管理提供了重要决策支持。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务