property-pilot-tickets
收藏资源简介:
PropertyPilot维护工单数据集是一个包含13,798条住宅维护工单的合成数据集,模拟真实租户撰写的工单文本,涵盖礼貌、恐慌、被动攻击或困惑等多种语气风格。每条工单包含租户的原始文本消息以及丰富的操作元数据,如维护类别、紧急性级别、分配的承包商、维修成本和解决时间等。数据集包含20个字段,核心字段包括ticket_id(唯一标识符)、raw_text(租户原始文本,作为主要模型输入)、category(10个平衡的维护类别,如管道、电气、暖通空调等)、urgency(4个紧急性级别,从P1紧急到P4计划性)、tenant_tone(6种租户沟通语气)以及resolution_hours、cost_usd等运营指标。数据集经过严格的数据清洗和质量验证,包括移除重复模板、语义去重、时间戳修复等,确保100%的raw_text唯一性。该数据集专为端到端自然语言处理管道设计,支持三项核心任务:工单分类(预测类别和紧急性)、相似案例检索(基于嵌入和FAISS索引)以及工单/回复生成(匹配租户语气)。数据集包含详细的探索性数据分析,验证了数据质量、类别平衡性以及语义可分性,同时指出了已知限制,如2025年数据量下降、合成数据性质等。
PropertyPilot Maintenance Tickets 数据集概览
基本信息
- 数据集名称:PropertyPilot Maintenance Tickets
- 语言:英语
- 许可证:MIT
- 数据集大小:13,798 条记录
- 任务类型:文本分类、文本生成、特征提取(多标签分类、文本到文本生成)
- 标签:物业管理、维护、合成数据、自然语言处理、分类、推荐、嵌入
数据规模与结构
| 指标 | 数值 |
|---|---|
| 工单总数 | 13,798 |
唯一 raw_text |
13,798 (100%) |
| 楼宇数量 | 40 |
| 单元数量 | 136 |
| 承包商数量 | 55 |
| 类别数量 | 10(均衡分布,各占 9.8–10.1%) |
| 紧急程度等级 | 4 级(P1–P4) |
| 租户语气类型 | 6 种 |
| 日期范围 | 2022-01-01 → 2025-12-31(93.6% 集中在 2022–2024) |
| 缺失值 | 0 |
| 平均消息长度 | 314 字符(约 52 词) |
数据列 Schema
| 列名 | 类型 | 描述 |
|---|---|---|
ticket_id |
string | 唯一标识符(TKT-XXXXX) |
building_id |
string | 楼宇代码(BLD-XXX) |
unit |
string | 公寓编号 |
raw_text |
string | 租户自由文本消息——主要模型输入 |
category |
string | 10 种维护类别之一 |
urgency |
string | 紧急程度:P1 Emergency (4h)/P2 Urgent (24h)/P3 Standard (3-5d)/P4 Scheduled (7-14d) |
tenant_tone |
string | 6 种沟通语气之一 |
contractor_id |
string | 分配的承包商 |
resolution_hours |
float | 解决时长(1.2–599.9 小时) |
resolution_notes |
string | 简短的结果描述 |
cost_usd |
float | 维修成本(6–11,151 美元) |
created_at |
datetime | 创建时间戳(ISO 8601,含小时) |
status |
string | 状态:open/scheduled/closed |
building_age |
string | 楼宇年代:pre-war 或 new |
recurring_flag |
bool | 标记该单元是否为重复问题单元 |
contractor_specialty |
string | 承包商专业领域(10 种) |
contractor_avg_resolution_hours |
float | 承包商历史平均解决时长 |
contractor_avg_cost |
float | 承包商历史平均成本 |
contractor_success_rate |
float | 承包商成功率(0–1) |
contractor_buildings_serviced |
int | 承包商服务的楼宇数量 |
类别和语气类型
10 种类别:Plumbing · Electrical · HVAC · Appliances · Elevator · Structural · Pests · Common Areas · Security · Noise
6 种租户语气:polite-formal · frustrated-repeat · panicked-caps · passive-aggressive · vague-confused · multi-issue
紧急程度 SLA 目标
| 等级 | SLA 目标 | 含义 |
|---|---|---|
| P1 Emergency | 4 小时 | 生命安全隐患 |
| P2 Urgent | 24 小时 | 影响居住适宜性 |
| P3 Standard | 3–5 天 | 生活质量问题 |
| P4 Scheduled | 7–14 天 | 预防性维护 |
数据来源与清洗
- 第一批次 (Batch A):14,000 行,其中 8,704 行存在模板重复问题
- 第二批次 (Batch B):10,500 行,独立生成,无重复问题
- 清洗流程:移除大规模模板 → 统一紧急程度编码 → 合并并精确去重 → 修复时间戳 → 清理编码 → 语义去重(余弦相似度 > 0.95) → 重新编号
最终结果:13,798 行,100% 唯一 raw_text,0 缺失值。
合成数据质量验证
- 中位数成对余弦相似度:0.23(健康值 < 0.4)
- 词汇多样性:词汇-类型比曲线持续上升,无早期平台期
- 提示模板指纹:相同 bucket(类别×紧急程度×语气)内的工单相似度(0.672)高于 bucket 间(0.257),比例约 2.6
- 人工审核(200 条样本):0 条模板文本 / AI 拒绝语句 / 长度异常;类别关键词不匹配约 15%(属于关键词语义启发式的误报)
- 统计验证:P1 与非 P1 解决时长、文本长度与语气、成本与类别均通过显著性检验
探索性数据分析要点
分布特征
- 类别分布近均匀(9.83%–10.11%)
- 紧急程度偏向日常维护:P3 28.0% > P2 25.4% > P4 24.1% > P1 22.6%
- 语气均匀分布(16.1%–17.5%)
- 状态:70% closed, 16% open, 14% scheduled
- 楼宇年代:58% new, 42% pre-war
关键发现:语气 ≠ 紧急程度
panicked-caps 语气的租户描述非紧急问题(P3/P4)的比例高达 51.6%,超过紧急问题(48.4%)。仅凭大写文字判断紧急程度会误判约一半的恐慌消息。
类别 × 紧急程度
- 最高 P1 紧急率:Security (26.7%)、Elevator (26.1%)、Electrical (24.8%)
- 最低 P1 紧急率:Structural (19.4%)、Noise (20.0%)、Common Areas (20.5%)
运营分析
- 成本梯度:成本最低类别 Noise($188 中位数),最高 Structural($655 中位数);结构工程 + 电梯 + HVAC 占总花费 44.9%
- 解决时间 vs SLA:所有等级实际中位数均略超过目标
- 承包商:55 家供应商,成功率范围 0.74–0.99(均值 0.88)
季节性与时间结构
- 各类别累计量随时间平行增长,类别平衡保持稳定
- 季节效应温和,HVAC 在 1 月略有增加
- 90 天内重复率:13.76%(1,899 条工单为同一单元同一类别 90 天内重复)
- ⚠️ 2025 年数据量骤减
语义可分性
- UMAP 降维显示 10 个清晰的类别聚类
- 调整兰德指数(ARI):0.644(> 0.4 目标)
- 平均聚类纯度:0.771(> 0.6 目标)
相关性结构
cost_usd↔resolution_hours:r = -0.33(紧急情况快但贵,计划维护慢但便宜)- ⚠️ 数据泄露警告:
resolution_hours、cost_usd及其衍生标志属于结果变量,不应输入分流模型
嵌入模型对比
| 模型 | Precision@3 | MRR | 延迟 |
|---|---|---|---|
| BAAI/bge-small-en-v1.5 ✅ | 0.337 | 0.453 | 9.2 ms |
| all-MiniLM-L6-v2 | 0.333 | 0.488 | 7.2 ms |
| intfloat/e5-small-v2 | 0.312 | 0.496 | 11.2 ms |
获胜模型:BAAI/bge-small-en-v1.5
预期用途与下游任务
- 分流分类器:从
raw_text预测category+urgency - 相似案例检索:嵌入工单、构建 FAISS 索引、查找最相似的 3 个历史案例并排序承包商
- 语气匹配生成器:根据租户语气生成工单和回复草稿
不适用于:生产环境部署、实际物业管理决策、训练真实包含个人身份信息的租户数据。
已知限制
| 问题 | 严重程度 | 建议 |
|---|---|---|
| 2025 年数据量骤降(仅占 6.4%) | 中等 | 时间建模时过滤到 created_at < 2025-01-01 |
| 承包商专业领域匹配较弱(仅 32.5% 匹配) | 中等 | 不使用 contractor_specialty 作为类别强先验 |
| 相同 bucket 内同质性(相似度比 ≈ 2.6) | 低-中 | 训练嵌入模型时加强去重或保留整个 bucket |
| 合成数据(非真实租户数据) | — | 不用于生产决策或替代真实数据 |
| 仅英语 | — | 不支持多语言 |
生成详情
- 模型:Qwen2.5-7B-Instruct
- 方法:基于 bucket 的提示生成(每个
category × urgency × tone组合一个提示) - 承包商:55 个承包商,具有一致的专长和绩效统计
- 后处理:合并 + 清洗流程





