遇见数据集

pakistan-notice-helper-traces

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

巴基斯坦通知助手隐私安全轨迹数据集包含巴基斯坦通知助手诈骗检查请求的紧凑、确定性元数据。该数据集不包含原始消息文本、图像字节、个人身份信息或模型推理过程,所有字段均为标量字符串、数字或布尔值,确保隐私安全。数据集字段包括轨迹ID、时间戳、经过严格脱敏的输入文本(限500字符)或固定模板的图像描述、输入类别(如快递、银行、FBR)、紧急程度布尔信号、结果摘要、诈骗策略标签以及风险标签和回复草稿策略等扁平化结果列。数据来源于应用中的种子示例(6个公开案例)和运行时操作日志,但需注意种子数据仅用于说明,运行时数据可能包含重复请求和未分类记录。该数据集适用于文本分类任务,特别是与诈骗检测、安全评估相关的场景,支持英语和乌尔都语。使用时应遵循数据集的局限性说明,包括正则表达式检测的近似性、运行时频率不代表总体分布、隐私脱敏可能遗漏非常规信息等。数据集采用CC BY 4.0许可证发布。

The Pakistan Notification Assistant Privacy-Safe Trajectory Dataset contains compact, deterministic metadata for scam check requests from the Pakistan Notification Assistant. It does not include raw message text, image bytes, personally identifiable information, or model inference processes; all fields are scalar strings, numbers, or booleans to ensure privacy safety. Dataset fields include trajectory ID, timestamp, strictly anonymized input text (limited to 500 characters) or fixed-template image descriptions, input categories (e.g., courier, banking, FBR), urgency boolean signals, result summaries, scam strategy labels, and flattened result columns like risk labels and reply draft strategies. Data is sourced from seed examples in the app (6 public cases) and runtime operation logs, but note that seed data is for illustration only, and runtime data may contain duplicate requests and unclassified records. This dataset is suitable for text classification tasks, particularly for scam detection and security assessment scenarios, supporting English and Urdu. Usage should adhere to the datasets limitations, including approximate regex detection, runtime frequency not representing overall distribution, and potential omission of unconventional information due to privacy anonymization. The dataset is released under the CC BY 4.0 license.

创建时间:
2026-06-07
原始信息汇总

数据集概述

  • 名称: Pakistan Notice Helper Privacy-Safe Traces
  • 许可协议: CC BY 4.0
  • 任务类别: 文本分类
  • 语言: 英语、乌尔都语
  • 标签: 安全、诈骗、巴基斯坦、确定性轨迹、隐私

目的

该数据集包含关于巴基斯坦通知助手(Pakistan Notice Helper)诈骗检测请求的紧凑、确定性元数据。数据集中不包含隐藏的模型推理或自主智能体轨迹。创建轨迹不会调用额外的AI模型调用,轨迹仅观察现有请求路径,并将其转换为允许列表中的类别、布尔值和固定描述。

字段

  • Trace identity: 随机轨迹ID和UTC时间戳
  • input: 针对文本提交的经过严格缩减、长度受限的文本,或图像提交的固定模板 image: ... 描述
  • input_category: 确定性类别,如快递、银行或FBR
  • urgency: 确定性布尔值紧急信号
  • result_summary: 映射模式的确定性摘要,包括是否已知或未分类,以及风险标签为何重要
  • scam_tactics: 可读的逗号分隔策略
  • risk_label 和 reply_draft_policy 等平面结果列

每个数据集单元格均为标量字符串、数字或布尔值,不包含字典或嵌套对象。trace_id 是第一个序列化列,所有检测到的布尔信号合并到单个 scam_tactics 类别列中。

隐私保护

数据集从不存储以下内容:

  • 原始消息文本
  • 截图、图像字节或base64
  • URL、电话号码、CNIC、姓名、地址、账户/卡号或追踪号码
  • 模型解释、红旗标记、安全步骤文本、回复草稿或原始模型输出
  • 异常、凭据、令牌或端点标头

文本轨迹存储严格缩减的形式,最大500字符。正则表达式移除常见URL、电子邮件、电话、CNIC、卡/账号、凭据、地址、追踪ID、长数字和首字母大写的名称或实体。图像仅存储固定描述。

来源

  • 种子轨迹: 代表巴基斯坦通知助手附带的六个公开示例
  • 运行时轨迹: 可能代表成功、拒绝或失败的请求。轨迹生成本身不会调用模型

种子行是说明性示例,非评估集,六个均具有 Likely scam 标签,不可用于估算类别平衡、准确率、召回率或真实诈骗流行率。运行时行是操作日志,有意保留重复请求。

限制

  • 正则表达式信号和类别检测是近似值
  • 运行时频率可能反映测试或重复使用,而非总体流行率
  • 正则表达式缩减可能遗漏异常的个人或机密信息
  • 新颖性未针对外部威胁情报来源进行研究
  • 数据集无法重现原始消息或截图
  • 风险标签为安全指导,非官方验证

相关链接

  • 应用: https://huggingface.co/spaces/build-small-hackathon/pakistan-notice-helper
  • 源代码: https://github.com/kingabzpro/pakistan-notice-helper
搜集汇总
数据集介绍
pakistan-notice-helper-traces 数据集图片
构建方式
该数据集源自巴基斯坦通知助手(Pakistan Notice Helper)应用,专注于存储关于诈骗检查请求的确定性元数据。构建过程中,系统利用Modal托管的Qwen模型对请求进行常规评估,同时通过追踪器(Trace)在不额外调用AI模型的情况下,将现有请求路径转换为预设的分类、布尔值和固定描述。对于文本提交,数据经过严格脱敏处理,长度限制为500字符;对于图像提交,仅存储固定模板描述,而不保存OCR文本或模型解释。追踪器遵循确定性规则,仅保留与证据相符的信息,当模型提示与证据冲突时,优先采用基于英文和乌尔都语证据的确定性映射。
特点
数据集的最大特点是其隐私安全性与确定性。所有存储字段均为标量字符串、数字或布尔值,无嵌套对象,便于在HuggingFace表格中浏览。数据包含诸如trace_id、input、input_category、urgency、result_summary、scam_tactics等字段,其中布尔信号被整合至单一的scam_tactics类别列中。记录不包含原始消息文本、图像数据、个人标识符(如URL、电话号码、CNIC)、模型解释或回复草稿等敏感信息。种子数据为六个公开示例,运行时数据则保留了重复请求的特性,反映了真实的使用日志。
使用方法
数据集可用于训练或评估文本分类模型,尤其适用于巴基斯坦地区的诈骗检测场景。使用时需注意:运行时数据包含重复请求、未分类图像描述及不完整的评估结果,因此建议创建独立的精选子集,排除risk_label为none的记录,审查或排除未分类图像行,基于脱敏的input和结果列进行去重,并根据任务需求采用适当的类别平衡策略。源仓库中的analyze_trace_dataset.py脚本可用于模式验证和生成质量指标摘要。数据集不适用于评估类别分布、准确率或真实诈骗流行率,其风险标签仅作为安全指导,而非官方验证。
背景与挑战
背景概述
在数字通信日益普及的背景下,针对巴基斯坦地区的网络诈骗与虚假通知构成了显著的社会安全威胁。为应对这一挑战,巴基斯坦通知助手(Pakistan Notice Helper)项目应运而生,旨在通过人工智能技术辅助用户识别潜在诈骗信息。作为该项目的重要组成部分,Pakistan Notice Helper Privacy-Safe Traces数据集于近期创建,由参与构建小型黑客松(build-small-hackathon)的研究人员与开发者共同维护。该数据集聚焦于文本分类任务,涵盖英语和乌尔都语两种语言,其核心研究问题在于如何在不泄露用户隐私的前提下,高效记录与评估诈骗检测请求的元数据。通过提供确定性的类别、紧急信号与诈骗策略标签,该数据集为相关领域的安全研究提供了可靠的基准参考,尤其对于低资源语言环境下的诈骗识别研究具有重要推动意义。
当前挑战
该数据集所解决的领域问题包括:1) 巴基斯坦地区特有的网络诈骗模式识别,如冒充快递公司、银行或联邦税务局(FBR)的虚假通知,其语言混杂且形式多样,对传统机器学习模型构成挑战;2) 在保护用户隐私的严苛约束下进行数据收集,数据集构建过程中采用激进的红action处理(如正则表达式移除URL、电话号码、国民身份证号等),但无法保证完全去除所有潜在标识符,需用户主动选择退出敏感内容;3) 运行时数据可能包含重复请求、未分类图像描述及不完整的评估记录,需通过专门的数据筛选与去重策略才能用于模型训练或评估;此外,正则信号与类别检测仅为近似结果,且未与外部威胁情报源进行新颖性验证,限制了其在真实世界中的直接应用效果。
常用场景
经典使用场景
在巴基斯坦反诈骗领域,该数据集主要用于训练和评估文本分类模型,以自动识别和归类各类诈骗通知,如快递诈骗、银行诈骗或FBR冒充等。其经典使用场景是基于高度脱敏的元数据,构建轻量级且隐私安全的诈骗检测系统。研究人员可借助数据集中确定的类别标签、紧急信号和诈骗策略字段,训练模型对用户提交的文本或图像描述进行高效分类,从而在保护用户隐私的前提下实现实时的诈骗风险预警。
衍生相关工作
围绕该数据集,衍生工作包括基于脱敏元数据的诈骗策略归纳与可视化分析,以及跨语言(英语-乌尔都语)证据规则的优化研究。研究者利用确定性映射规则,探讨了正则表达式与枚举类别在低资源语言场景中的鲁棒性。另有工作关注数据集质量指标如去重、类别平衡对模型训练的影响,并开发了配套的分析脚本以辅助数据清洗。这些工作共同推动了隐私安全型诈骗检测数据集的设计标准,为类似应急响应系统提供了可复用的方法论参考。
数据集最近研究
最新研究方向
该数据集致力于巴基斯坦地区短信诈骗检测的前沿安全研究,聚焦于隐私保护与确定性元数据提取。通过去标识化、长度受限的文本和固定模板的图像描述,数据集规避了原始敏感信息的存储,仅保留诈骗战术、风险标签等结构化字段,为构建低隐私泄露风险的文本分类模型提供基础。这一方向回应了发展中国家普遍存在的电信诈骗问题,尤其结合了本地化语言(英语/乌尔都语)和诈骗模式(如快递、银行、FBR等),推动了安全AI在资源受限环境下的应用。其影响在于:一方面为学者提供可复现的隐私安全基准数据,另一方面通过确定性映射机制减少模型推理的不可靠性,突出透明可审计的安全评估范式,对防范社会工程学攻击具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务