遇见数据集

open-smtp-error-dataset

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Open SMTP Error Dataset 是一个英文、机器可读的参考数据集,用于提供 SMTP 增强状态码的知识和谨慎的操作分类。版本 1.1.0 包含 92 条稳定的知识记录和一个独立的、可审计的目录,内含 120 条分类规则。该数据集是一个参考产物,而非实时提供商策略反馈;它有助于可观测性、支持、解析器测试和有限投递操作,但不建立收件人状态或最终收件箱位置。数据集提供两个配置:default 配置(知识数据集)包含 92 条英文知识记录,涵盖诊断和投递决策上下文;classification_rules 配置(分类规则目录)包含 120 条有序规则,其中 99 条精确映射和 21 条谨慎回退规则。数据集不包含原始 SMTP 响应、观察到的投递事件示例、收件人信息、个人数据、提供商特定线路文本或内部工作材料。

The Open SMTP Error Dataset is an English, machine-readable reference dataset for providing knowledge of SMTP enhanced status codes and cautious operational classification. Version 1.1.0 contains 92 stable knowledge records and a separate, auditable directory of 120 classification rules. The dataset is a reference artifact, not real-time provider policy feedback; it aids observability, support, parser testing, and limited delivery operations, but does not establish recipient status or final inbox placement. The dataset offers two configurations: default (knowledge dataset) with 92 English knowledge records covering diagnostics and delivery decision context; classification_rules (classification rules directory) with 120 ordered rules, including 99 exact mappings and 21 cautious fallback rules. The dataset does not contain raw SMTP responses, observed delivery event examples, recipient information, personal data, provider-specific line text, or internal working materials.

创建时间:
2026-07-31
原始信息汇总

数据集概述

Open SMTP Error Dataset 是一个面向 SMTP 增强状态码知识的英语、机器可读参考数据集,提供谨慎的操作性分类规则。当前版本为 v1.1.0,包含 92 条稳定的知识记录120 条可审计的分类规则。该数据集定位为参考工件,而非实时的服务商策略源,主要用于可观测性、技术支持、解析器测试及有界投递操作,不对收件人状态或最终收件箱位置做出判定。

数据集配置

配置名称 内容与规模 文件位置
default 92 条英文知识记录,包含诊断和投递决策上下文 data/open-smtp-error-knowledge.parquet
classification_rules 120 条有序规则:99 条精确映射 + 21 条谨慎回退规则 data/classification-rules.parquet

此外,还存在独立的弹跳识别契约文件 data/bounce-recognition-rules.json,包含 92 条精确增强状态码映射和 4 个文本信号,其契约版本为 1.0.0。

知识记录字段

每条知识记录包含以下 operational_classification 字段:

  • rule_key
  • failure_persistence
  • cause_family
  • recipient_validity
  • retry_disposition
  • suppression_disposition
  • confidence
  • needs_review

其中,rule_key 表示首个匹配的分类规则;needs_reviewtrue 时表示结果适用于人工审查或补充上下文收集,而非不可逆的自动化操作。

分类规则模式

classification_rules 配置中每行包含以下公共字段:

schema_versionrule_keysourceprecedence_tierenhanced_status_codeenhanced_status_prefixmatch_fieldmatch_operatormatch_valuefailure_persistencecause_familyrecipient_validityretry_dispositionsuppression_dispositionconfidenceneeds_reviewrationalesource_titleevidence_referenceknowledge_record_idexcluded_enhanced_status_codes

规则评估是确定性的:先考虑精确映射,排除项优先于回退规则,随后再考虑谨慎回退规则。覆盖范围之外的结果保持未分类状态。特别地,5.7.28 按策略有意保持未分类,而 4.7.28 的精确映射仍然可用。

加载方式

可使用 load_dataset 加载两个配置:

  • 知识配置:用于解释性目录内容
  • 规则配置:当应用需要展示规则来源、优先级、置信度和审查要求时使用

使用边界与负责任使用

数据集中不包含:原始 SMTP 响应、观察到的投递事件示例、收件人信息、个人数据、服务商特定的线上文本及内部工作材料。公开包仅包含隐私安全的结构化知识、规则和溯源信息

禁止仅凭文本信号或标记为 needs_review 的结果自动抑制收件人、关闭调查或做出其他不可逆的投递决策。运营遥测数据应保留在授权系统中。

公开文件清单(v1.1.0)

  • README.md
  • bounce-recognition-guide.md
  • CHANGELOG.md
  • NOTICE.md
  • data/open-smtp-error-knowledge.jsonl
  • data/open-smtp-error-knowledge.csv
  • data/open-smtp-error-knowledge.parquet
  • data/bounce-recognition-rules.json
  • data/dataset-manifest.json
  • data/dataset.schema.json
  • data/classification-rules.jsonl
  • data/classification-rules.csv
  • data/classification-rules.parquet
  • data/classification-rule.schema.json

注意LICENSE.md 在此版本中刻意缺席,其标识符和处理方式有待单独的所有者决策。NOTICE 文件记录第三方署名,但不对整个数据集声明许可证。

搜集汇总
数据集介绍
open-smtp-error-dataset 数据集图片
构建方式
该数据集以SMTP增强状态码知识为核心,构建了包含92条稳定知识记录与120条分类规则的机器可读参考包。知识记录涵盖诊断上下文与投递决策信息,分类规则则按精确映射与谨慎回退两层级有序组织。所有数据以Parquet格式存储,并配套JSON/CSV格式的副本及模式定义文件,确保了数据的结构严谨性与可移植性。数据集明确区分默认知识配置与分类规则配置,前者提供解释性目录内容,后者适用于需展示规则来源、优先级及审查要求的应用场景。
特点
该数据集具备高度的专业性与审慎性。其分类规则采用确定性评估机制,优先处理精确映射,尊重排除项,再考虑回退规则,未覆盖情形保持未分类状态,如5.7.28被刻意排除,而4.7.28的精确映射可用。数据记录包含丰富的操作分类字段,如失败持久性、原因族、收件人有效性、重试与抑制处置、置信度及审查需求等,为邮件退回处理提供细粒度洞察。此外,数据集排除原始SMTP响应、个人信息等敏感内容,仅含隐私安全的结构化知识、规则与溯源信息,体现了负责任的构建理念。
使用方法
使用者可通过HuggingFace的datasets库便捷加载两个配置,分别获取知识数据与分类规则。知识配置适用于解释性目录查询,规则配置则适合需要展示规则依据、优先级、置信度及审查要求的应用。值得注意的是,数据集强调其作为参考工件的定位,不建立收件人状态或最终收件箱放置结论。文本信号或标记为需审查的结果不得用于自动抑制收件人、关闭调查等不可逆投递决策,使用者应在授权系统中保留运营遥测数据。
背景与挑战
背景概述
Open SMTP Error Dataset 诞生于电子邮件投递与诊断日益复杂化的背景下,由 Blazalek 等研究者于 2023 年构建,旨在应对 SMTP 扩展状态码在运维监控、解析测试及退信处理中缺乏标准化、机器可读知识库的困境。该数据集以 92 条知识记录与 120 条有序分类规则,构建了首个兼顾解释性与审慎操作边界的参考型知识包,为邮件系统可观测性、支持流程与领域规则审计提供了基准资源。其设计强调不替代实时策略,而作为稳定契约,深刻影响了退信分类、投递决策辅助及 SMTP 知识建模的研究方向,成为连接协议规范与工程实践的重要桥梁。
当前挑战
该数据集面临的核心挑战在于领域问题的固有复杂性:SMTP 错误码语义随提供商策略动态演化,单一文本信号难以覆盖退信场景的多样性,且知识库需平衡确定性映射(99 条)与谨慎回退(21 条)以避免误判。构建上,数据治理要求严格剔除个人隐私与专有内容,同时需维持 92 条知识记录与 120 条规则之间的可审计性、版本一致性及跨格式(JSON/CSV/Parquet)同步。此外,规则设计需处理故意未分类的代码(如 5.7.28)与排除逻辑,确保在无监督场景下提供可解释、可人工复核的决策支持,而非自动化执行依据。
常用场景
经典使用场景
Open SMTP Error Dataset在电子邮件基础设施与投递诊断领域具有举足轻重的地位。该数据集以机器可读的形态,系统性地收录了92条SMTP增强状态码知识记录及120条审慎的操作分类规则,为开发人员与运维人员提供了标准化、结构化的错误语义参照。其经典使用场景聚焦于SMTP会话失败后的成因解析与处置策略推导——通过精确匹配增强状态码,辅以文本信号与逻辑规则,能够有效界定失败持久性、成因范畴、收件人有效性及重试或抑制倾向,从而在投递管道的观测性强化、退信识别器测试及客服支持知识库构建中发挥核心作用。该数据集并非实时策略源,而是稳定的参考基准,助力实现一致且可审计的错误分类流程,避免主观臆断与异质性处理。
衍生相关工作
该数据集的内聚性与结构化特性已催生了一系列衍生工作方向。其一,基于其可扩展的规则模式,研究者可开发自适应分类器,通过增量学习整合新兴的供应商特有错误码,维持知识库的时效性。其二,数据集中对5.7.28等特定编码的策略性未分类,激发了关于安全默认与不确定性建模的探讨,可能导向概率化投递决策框架的构建。其三,其清晰的provenance记录与schema设计,为构建跨数据集的可信知识融合框架提供了参考范本,有望推动统一邮件诊断本体(Ontology)的形成。此外,规则置信度与needs_review字段的引入,鼓励了人机协同(Human-in-the-loop)的退信治理流程研究,使自动化系统在关键决策前能有效利用专家判断。这些衍生研究共同推动着SMTP错误处理从静态查表向智能、审慎、负责任的方向演进。
数据集最近研究
最新研究方向
随着电子邮件通信规模的持续膨胀,SMTP投递失败与退信处理已成为邮件运营体系中不可忽视的痛点。Open SMTP Error Dataset以其机器可读的结构化知识库与分类规则集,为这一领域带来了新的曙光。该数据集不仅收录了92条精炼的SMTP增强状态码知识记录,还配套了120条审慎的操作分类规则,且严格遵循隐私安全边界,剔除了所有个人与敏感信息。其前沿性体现在对邮件退回的精细化、可审计分类上,通过引入失败持久性、原因族、收件人有效性等字段,并明确区分精确映射与谨慎回退策略,为邮件系统的可观测性、解析器测试及受控投递操作提供了坚实基准。这一数据集强化了退信处理流程的透明度与可靠性,推动邮件基础设施朝着更智能、更负责任的方向演进,对保障通信生态的健壮性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务