遇见数据集

property-pilot-tickets

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

PropertyPilot维护工单数据集是一个包含13,798条住宅维护工单的合成数据集,模拟真实租户撰写的工单文本,涵盖礼貌、恐慌、被动攻击或困惑等多种语气风格。每条工单包含租户的原始文本消息以及丰富的操作元数据,如维护类别、紧急性级别、分配的承包商、维修成本和解决时间等。数据集包含20个字段,核心字段包括ticket_id(唯一标识符)、raw_text(租户原始文本,作为主要模型输入)、category(10个平衡的维护类别,如管道、电气、暖通空调等)、urgency(4个紧急性级别,从P1紧急到P4计划性)、tenant_tone(6种租户沟通语气)以及resolution_hours、cost_usd等运营指标。数据集经过严格的数据清洗和质量验证,包括移除重复模板、语义去重、时间戳修复等,确保100%的raw_text唯一性。该数据集专为端到端自然语言处理管道设计,支持三项核心任务:工单分类(预测类别和紧急性)、相似案例检索(基于嵌入和FAISS索引)以及工单/回复生成(匹配租户语气)。数据集包含详细的探索性数据分析,验证了数据质量、类别平衡性以及语义可分性,同时指出了已知限制,如2025年数据量下降、合成数据性质等。

创建时间:
2026-06-16
原始信息汇总

PropertyPilot Maintenance Tickets 数据集概览

基本信息

  • 数据集名称:PropertyPilot Maintenance Tickets
  • 语言:英语
  • 许可证:MIT
  • 数据集大小:13,798 条记录
  • 任务类型:文本分类、文本生成、特征提取(多标签分类、文本到文本生成)
  • 标签:物业管理、维护、合成数据、自然语言处理、分类、推荐、嵌入

数据规模与结构

指标 数值
工单总数 13,798
唯一 raw_text 13,798 (100%)
楼宇数量 40
单元数量 136
承包商数量 55
类别数量 10(均衡分布,各占 9.8–10.1%)
紧急程度等级 4 级(P1–P4)
租户语气类型 6 种
日期范围 2022-01-01 → 2025-12-31(93.6% 集中在 2022–2024)
缺失值 0
平均消息长度 314 字符(约 52 词)

数据列 Schema

列名 类型 描述
ticket_id string 唯一标识符(TKT-XXXXX)
building_id string 楼宇代码(BLD-XXX)
unit string 公寓编号
raw_text string 租户自由文本消息——主要模型输入
category string 10 种维护类别之一
urgency string 紧急程度:P1 Emergency (4h)/P2 Urgent (24h)/P3 Standard (3-5d)/P4 Scheduled (7-14d)
tenant_tone string 6 种沟通语气之一
contractor_id string 分配的承包商
resolution_hours float 解决时长(1.2–599.9 小时)
resolution_notes string 简短的结果描述
cost_usd float 维修成本(6–11,151 美元)
created_at datetime 创建时间戳(ISO 8601,含小时)
status string 状态:open/scheduled/closed
building_age string 楼宇年代:pre-war 或 new
recurring_flag bool 标记该单元是否为重复问题单元
contractor_specialty string 承包商专业领域(10 种)
contractor_avg_resolution_hours float 承包商历史平均解决时长
contractor_avg_cost float 承包商历史平均成本
contractor_success_rate float 承包商成功率(0–1)
contractor_buildings_serviced int 承包商服务的楼宇数量

类别和语气类型

10 种类别:Plumbing · Electrical · HVAC · Appliances · Elevator · Structural · Pests · Common Areas · Security · Noise

6 种租户语气:polite-formal · frustrated-repeat · panicked-caps · passive-aggressive · vague-confused · multi-issue

紧急程度 SLA 目标

等级 SLA 目标 含义
P1 Emergency 4 小时 生命安全隐患
P2 Urgent 24 小时 影响居住适宜性
P3 Standard 3–5 天 生活质量问题
P4 Scheduled 7–14 天 预防性维护

数据来源与清洗

  • 第一批次 (Batch A):14,000 行,其中 8,704 行存在模板重复问题
  • 第二批次 (Batch B):10,500 行,独立生成,无重复问题
  • 清洗流程:移除大规模模板 → 统一紧急程度编码 → 合并并精确去重 → 修复时间戳 → 清理编码 → 语义去重(余弦相似度 > 0.95) → 重新编号

最终结果:13,798 行,100% 唯一 raw_text,0 缺失值。

合成数据质量验证

  • 中位数成对余弦相似度:0.23(健康值 < 0.4)
  • 词汇多样性:词汇-类型比曲线持续上升,无早期平台期
  • 提示模板指纹:相同 bucket(类别×紧急程度×语气)内的工单相似度(0.672)高于 bucket 间(0.257),比例约 2.6
  • 人工审核(200 条样本):0 条模板文本 / AI 拒绝语句 / 长度异常;类别关键词不匹配约 15%(属于关键词语义启发式的误报)
  • 统计验证:P1 与非 P1 解决时长、文本长度与语气、成本与类别均通过显著性检验

探索性数据分析要点

分布特征

  • 类别分布近均匀(9.83%–10.11%)
  • 紧急程度偏向日常维护:P3 28.0% > P2 25.4% > P4 24.1% > P1 22.6%
  • 语气均匀分布(16.1%–17.5%)
  • 状态:70% closed, 16% open, 14% scheduled
  • 楼宇年代:58% new, 42% pre-war

关键发现:语气 ≠ 紧急程度

panicked-caps 语气的租户描述非紧急问题(P3/P4)的比例高达 51.6%,超过紧急问题(48.4%)。仅凭大写文字判断紧急程度会误判约一半的恐慌消息。

类别 × 紧急程度

  • 最高 P1 紧急率:Security (26.7%)、Elevator (26.1%)、Electrical (24.8%)
  • 最低 P1 紧急率:Structural (19.4%)、Noise (20.0%)、Common Areas (20.5%)

运营分析

  • 成本梯度:成本最低类别 Noise($188 中位数),最高 Structural($655 中位数);结构工程 + 电梯 + HVAC 占总花费 44.9%
  • 解决时间 vs SLA:所有等级实际中位数均略超过目标
  • 承包商:55 家供应商,成功率范围 0.74–0.99(均值 0.88)

季节性与时间结构

  • 各类别累计量随时间平行增长,类别平衡保持稳定
  • 季节效应温和,HVAC 在 1 月略有增加
  • 90 天内重复率:13.76%(1,899 条工单为同一单元同一类别 90 天内重复)
  • ⚠️ 2025 年数据量骤减

语义可分性

  • UMAP 降维显示 10 个清晰的类别聚类
  • 调整兰德指数(ARI):0.644(> 0.4 目标)
  • 平均聚类纯度:0.771(> 0.6 目标)

相关性结构

  • cost_usdresolution_hours:r = -0.33(紧急情况快但贵,计划维护慢但便宜)
  • ⚠️ 数据泄露警告resolution_hourscost_usd 及其衍生标志属于结果变量,不应输入分流模型

嵌入模型对比

模型 Precision@3 MRR 延迟
BAAI/bge-small-en-v1.5 0.337 0.453 9.2 ms
all-MiniLM-L6-v2 0.333 0.488 7.2 ms
intfloat/e5-small-v2 0.312 0.496 11.2 ms

获胜模型BAAI/bge-small-en-v1.5

预期用途与下游任务

  1. 分流分类器:从 raw_text 预测 category + urgency
  2. 相似案例检索:嵌入工单、构建 FAISS 索引、查找最相似的 3 个历史案例并排序承包商
  3. 语气匹配生成器:根据租户语气生成工单和回复草稿

不适用于:生产环境部署、实际物业管理决策、训练真实包含个人身份信息的租户数据。

已知限制

问题 严重程度 建议
2025 年数据量骤降(仅占 6.4%) 中等 时间建模时过滤到 created_at < 2025-01-01
承包商专业领域匹配较弱(仅 32.5% 匹配) 中等 不使用 contractor_specialty 作为类别强先验
相同 bucket 内同质性(相似度比 ≈ 2.6) 低-中 训练嵌入模型时加强去重或保留整个 bucket
合成数据(非真实租户数据) 不用于生产决策或替代真实数据
仅英语 不支持多语言

生成详情

  • 模型:Qwen2.5-7B-Instruct
  • 方法:基于 bucket 的提示生成(每个 category × urgency × tone 组合一个提示)
  • 承包商:55 个承包商,具有一致的专长和绩效统计
  • 后处理:合并 + 清洗流程
搜集汇总
数据集介绍
property-pilot-tickets 数据集图片
构建方式
该数据集通过两轮独立的LLM生成策略构建,首轮以Qwen2.5-7B-Instruct模型为基底,按照维修类别、紧急程度与租户语气三要素的组合桶进行分桶提示生成;次轮独立运行以增加样本多样性。生成完成后,系统性地移除了大规模重复模板,同步修复了时间戳编码异常,并借助FAISS进行语义级别的近重复剔除,最终将两批数据合并为13,798条完全唯一文本的记录,确保了数据的洁净度与语料的新颖性。
特点
数据集以高度平衡的类别分布为核心亮点,十大维修类别均匀分布于9.83%至10.11%之间,彻底规避了标签不均衡对分类器训练的干扰。其关键发现之一是语气与紧急程度不存在强关联——恐慌语气中仍有超过半数属于常规维修请求,这凸显了基于语义理解而非表面情绪进行分诊的必要性。数据涵盖40栋建筑、55家承包商及6种沟通风格,并附有维修耗时、成本与承包商绩效等运营元数据,为多任务建模提供了丰富维度。
使用方法
数据集可快捷加载于HuggingFace Datasets库或直接以Pandas读取CSV文件,适用于三类核心下游任务:首先,可利用文本列训练分诊分类模型,以预测维修类别与紧急等级;其次,可嵌入租户文本并构建FAISS索引,实现相似案例检索与承包商智能推荐;最后,可依据租户语气生成修理工单与回复文本,构建端到端的物业管理自然语言处理流水线。推荐使用BAAI/bge-small-en-v1.5模型进行嵌入生成以获得最优检索性能。
背景与挑战
背景概述
PropertyPilot Maintenance Tickets数据集由Matan Nechushtan和Itai Morag于2025年创建,旨在推动自然语言处理(NLP)在物业管理领域中的应用。该数据集包含13,798条合成生成的住宅维修工单,每条工单模拟真实租户的沟通风格(包括礼貌、恐慌、被动攻击等),并附带类别、紧急程度、承包商、成本及解决时间等元数据。其核心研究问题在于构建一个端到端的NLP流水线,涵盖工单分类(triage classification)、相似案例检索(similar-case retrieval)以及工单回复生成(work-order/reply generation)。该数据集通过平衡设计(10个类别各占约10%)和丰富的语义特征,为物业管理领域的智能运维提供了强有力的基准资源,对文本分类、特征提取及生成模型的开发具有重要影响。
当前挑战
该数据集所解决的领域挑战在于物业管理中工单处理的自动化和精准化,包括多标签分类(如同时预测类别和紧急程度)、语义相似检索以及顾及情绪的生成任务。构建过程中面临的主要挑战包括:早期版本存在严重的重复模板问题(62%的数据源于10个模板),因此团队通过合并两批独立生成数据、移除大量重复项、修复时间戳与编码问题,并利用FAISS进行语义去重(余弦相似度>0.95)等手段,最终实现100%的文本唯一性。此外,合成数据质量需接受多重验证,包括词汇多样性、类别与紧急程度的语义关联(如恐慌语气并不等同于高紧急程度),以及确保类别间无漂移和标签平衡。这些挑战的克服确保了数据集的真实性和可用性,为下游任务提供了可靠基础。
常用场景
经典使用场景
PropertyPilot Maintenance Tickets数据集在物业管理与自然语言处理交叉领域开辟了独特的实验场域,其经典使用场景聚焦于构建端到端的智能工单处理流水线。研究者可将租户提交的原始文本作为输入,同时开展多标签分类任务以预测工单类别与紧急程度,通过语义嵌入技术实现相似历史案例的快速检索,并利用生成式模型完成匹配租户语气的工单分派与回复起草。这一完整范式使得该数据集成为验证文本分类、向量检索与条件生成三大核心任务协同效果的理想基准,尤其在模拟真实物业管理环境中非结构化文本到结构化决策的转换过程。
衍生相关工作
围绕该数据集已催生出一系列具有典范意义的衍生研究工作。其中,配套发布的属性试点推荐系统使用BGE小模型预计算语义嵌入并构建FAISS检索索引,系统比较了三种句子嵌入模型在维修案例检索上的效果差异,为轻量化部署提供了实证依据。此外,该数据集在构建过程中的重复数据检测与清洗方法学——包括模板文本过滤、近语义重复剔除与时间戳修复——已成为合成数据生产领域的重要技术参考。值得关注的是,该语料库中类别与紧急性多维标注信息的交织特性,也驱动了多任务联合学习与元属性推理等前沿课题在垂直领域的深入探索。
数据集最近研究
最新研究方向
PropertyPilot Maintenance Tickets 数据集的最新研究聚焦于利用合成数据推动物业管理领域的自然语言处理全流程智能化,涵盖工单分类、语义检索与生成式响应。前沿方向包括基于嵌入向量的相似案例检索,通过FAISS索引实现高效匹配,并针对租户语气(如恐慌、礼貌)与紧急程度进行解耦分析,揭示语气不能直接等同于语义紧迫性这一关键洞察。该数据集通过严格去重与质量校验,克服了LLM生成数据中模板重复的常见缺陷,为构建鲁棒的分诊分类器和语气感知的回复生成模型提供了可靠基础。其影响在于为物业管理行业提供可复现的基准,推动从规则系统向语义理解驱动的智能运维转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务