TrainingDataPro/generated-e-mail-spam
收藏资源简介:
--- language: - en license: cc-by-nc-nd-4.0 task_categories: - text-generation - text-classification tags: - code - finance dataset_info: features: - name: title dtype: string - name: text dtype: large_string splits: - name: train num_bytes: 233533 num_examples: 300 download_size: 230500 dataset_size: 233533 --- # Generated E-mail Spam - text classification dataset The dataset consists of a **CSV file** containing of 300 generated email spam messages. Each row in the file represents a separate email message, its *title and text.* The dataset aims to facilitate the analysis and detection of spam emails. # 💴 For Commercial Usage: To discuss your requirements, learn about the price and buy the dataset, leave a request on **[TrainingData](https://trainingdata.pro/datasets/spambase?utm_source=huggingface&utm_medium=cpc&utm_campaign=generated-e-mail-spam)** to buy the dataset The dataset can be used for various purposes, such as *training machine learning algorithms to classify and filter spam emails, studying spam email patterns, or analyzing text-based features of spam messages*. # Generated Data The data was generated using `model text-davinci-003` Open AI API  # 💴 Buy the Dataset: This is just an example of the data. Leave a request on **[https://trainingdata.pro/datasets](https://trainingdata.pro/datasets/spambase?utm_source=huggingface&utm_medium=cpc&utm_campaign=generated-e-mail-spam)** to discuss your requirements, learn about the price and buy the dataset # Content ### File with the extension .csv (utf-8) includes the following information: - **title**: title of the email, - **text**: text of the email # Email spam might be generated in accordance with your requirements. ## **[TrainingData](https://trainingdata.pro/datasets/spambase?utm_source=huggingface&utm_medium=cpc&utm_campaign=generated-e-mail-spam)** provides high-quality data annotation tailored to your needs More datasets in TrainingData's Kaggle account: **https://www.kaggle.com/trainingdatapro/datasets** TrainingData's GitHub: **https://github.com/Trainingdata-datamarket/TrainingData_All_datasets** *keywords: spam mails dataset, email spam classification, spam or not-spam, spam e-mail database, spam detection system, email spamming data set, spam filtering system, spambase, feature extraction, spam ham email dataset, classifier, machine learning algorithms, automated, generated data, synthetic data, synthetic data generation, synthetic dataset , cybersecurity, text dataset, sentiment analysis, llm dataset, language modeling, large language models, text classification, text mining dataset, natural language texts, nlp, nlp open-source dataset, text data*
--- 语言: - 英语(en) 许可协议:CC BY-NC-ND 4.0 任务类别: - 文本生成 - 文本分类 标签: - 代码 - 金融 数据集信息: 特征: - 名称:title,数据类型:字符串 - 名称:text,数据类型:大字符串 划分集: - 名称:训练集(train),字节数:233533,样本数:300 下载大小:230500 数据集总大小:233533 --- # 生成式电子邮件垃圾邮件——文本分类数据集 本数据集包含一个**CSV格式文件**,内含300条生成的垃圾邮件消息。文件中每一行对应一封独立的电子邮件,包含其*主题与正文*。本数据集旨在助力垃圾邮件的分析与检测工作。 # 💴 商业使用须知:如需洽谈需求、了解定价并购买本数据集,请前往**[TrainingData](https://trainingdata.pro/datasets/spambase?utm_source=huggingface&utm_medium=cpc&utm_campaign=generated-e-mail-spam)**提交申请。 本数据集可应用于多种场景,例如*训练用于分类与过滤垃圾邮件的机器学习算法、研究垃圾邮件的模式、分析垃圾邮件消息的文本特征*等。 # 生成式数据 本数据集的数据通过OpenAI API的`text-davinci-003`模型生成。  # 💴 购买数据集:此仅为数据示例。如需洽谈需求、了解定价并购买本数据集,请前往**[https://trainingdata.pro/datasets/spambase?utm_source=huggingface&utm_medium=cpc&utm_campaign=generated-e-mail-spam](https://trainingdata.pro/datasets/spambase?utm_source=huggingface&utm_medium=cpc&utm_campaign=generated-e-mail-spam)**提交申请。 # 数据集内容 ### UTF-8编码的CSV格式文件 包含以下信息: - **title**:电子邮件的主题标题 - **text**:电子邮件的正文内容 # 可根据您的需求定制生成垃圾邮件。 ## **[TrainingData](https://trainingdata.pro/datasets/spambase?utm_source=huggingface&utm_medium=cpc&utm_campaign=generated-e-mail-spam)** 可提供贴合您需求的高质量数据标注服务 TrainingData在Kaggle平台的账号内还有更多优质数据集:**https://www.kaggle.com/trainingdatapro/datasets** TrainingData的GitHub开源仓库:**https://github.com/Trainingdata-datamarket/TrainingData_All_datasets** *关键词:垃圾邮件数据集、电子邮件垃圾邮件分类、垃圾/非垃圾邮件、垃圾邮件数据库、垃圾邮件检测系统、垃圾邮件数据集合、垃圾邮件过滤系统、spambase、特征提取、垃圾邮件与正常邮件数据集、分类器、机器学习算法、自动化、生成式数据、合成数据、合成数据生成、合成数据集、网络安全、文本数据集、情感分析、大语言模型(LLM)数据集、语言建模、大语言模型、文本分类、文本挖掘数据集、自然语言文本、自然语言处理(NLP)、NLP开源数据集、文本数据*
生成的电子邮件垃圾邮件 - 文本分类数据集
该数据集包含一个 CSV 文件,其中包含 300 条生成的电子邮件垃圾邮件消息。文件中的每一行代表一个单独的电子邮件消息,包括其 标题和正文。该数据集旨在促进垃圾邮件的分析和检测。
数据集信息
特征
- title: 电子邮件的标题,数据类型为字符串。
- text: 电子邮件的正文,数据类型为大字符串。
数据分割
- train: 训练集,包含 233533 字节和 300 个样本。
数据大小
- 下载大小: 230500 字节
- 数据集大小: 233533 字节
数据生成
数据是通过使用 model text-davinci-003 Open AI API 生成的。
用途
该数据集可用于多种目的,例如 训练机器学习算法以分类和过滤垃圾邮件,研究垃圾邮件模式,或分析垃圾邮件消息的文本特征。




