遇见数据集

hamza-amin/urdu-spam-dataset

收藏
Hugging Face2026-04-09 更新2026-04-12 收录
官方服务:

资源简介:

--- language: ur tags: - text-classification - spam-detection - urdu - nlp license: mit task_categories: - text-classification task_ids: - intent-classification pretty_name: Urdu Spam Detection Dataset size_categories: - 1K<n<10K --- # Urdu Spam Detection Dataset ## Description This dataset is designed for classifying Urdu text into: - **0 → Not Spam** - **1 → Spam** It is intended for AI-powered emergency helpline systems (e.g., 1122/911) to filter prank or irrelevant calls. --- ## Dataset Structure **Format:** CSV | Column | Type | Description | |--------|------|-------------| | text | string | Urdu sentence | | label | int (0/1) | Spam classification | --- ## Example ``` text,label آپ کو میں نے پہلے بھی کال کیا تھا کیا یاد ہے,1 یہ ایک ایمرجنسی ہے پلیز ایمبولینس بھیجیں,0 ```` --- ## Use Cases - Emergency call filtering - Real-time spam detection - Urdu NLP classification tasks --- ## Notes - Data is synthetically generated - Cleaned and deduplicated - Balanced between spam and non-spam --- ## Loading Dataset ```python from datasets import load_dataset dataset = load_dataset("hamza-amin/urdu-spam-dataset") ```` --- ## License MIT

--- language: 乌尔都语(Urdu) tags: - 文本分类(text-classification) - 垃圾信息检测(spam-detection) - 乌尔都语(Urdu) - 自然语言处理(Natural Language Processing,NLP) license: MIT task_categories: - 文本分类 task_ids: - 意图分类(intent-classification) pretty_name: 乌尔都语垃圾信息检测数据集 size_categories: - 1000 < 样本量 < 10000 --- # 乌尔都语垃圾信息检测数据集 ## 描述 本数据集旨在将乌尔都语文本划分为两类: - **0 → 非垃圾信息** - **1 → 垃圾信息** 其设计目标是为AI驱动的紧急求助热线系统(如1122/911)提供支持,以过滤恶作剧或无关来电。 --- ## 数据集结构 **格式:逗号分隔值(Comma-Separated Values,CSV)** | 列名 | 数据类型 | 描述 | |--------|------|-------------| | text | 字符串 | 乌尔都语语句 | | label | 整数(0/1) | 垃圾信息分类标签 | --- ## 示例 text,label آپ کو میں نے پہلے بھی کال کیا تھا کیا یاد ہے,1 یہ ایک ایمرجنسی ہے پلیز ایمبولینس بھیجیں,0 --- ## 应用场景 - 紧急来电过滤 - 实时垃圾信息检测 - 乌尔都语自然语言处理分类任务 --- ## 备注 - 数据为合成生成 - 已完成清洗与去重处理 - 垃圾信息与非垃圾信息样本分布均衡 --- ## 数据集加载 python from datasets import load_dataset dataset = load_dataset("hamza-amin/urdu-spam-dataset") --- ## 许可证 MIT

提供机构:
hamza-amin
二维码
社区交流群
二维码
科研交流群
商业服务