open-smtp-error-dataset
收藏资源简介:
Open SMTP Error Dataset 是一个英文、机器可读的参考数据集,用于提供 SMTP 增强状态码的知识和谨慎的操作分类。版本 1.1.0 包含 92 条稳定的知识记录和一个独立的、可审计的目录,内含 120 条分类规则。该数据集是一个参考产物,而非实时提供商策略反馈;它有助于可观测性、支持、解析器测试和有限投递操作,但不建立收件人状态或最终收件箱位置。数据集提供两个配置:default 配置(知识数据集)包含 92 条英文知识记录,涵盖诊断和投递决策上下文;classification_rules 配置(分类规则目录)包含 120 条有序规则,其中 99 条精确映射和 21 条谨慎回退规则。数据集不包含原始 SMTP 响应、观察到的投递事件示例、收件人信息、个人数据、提供商特定线路文本或内部工作材料。
The Open SMTP Error Dataset is an English, machine-readable reference dataset for providing knowledge of SMTP enhanced status codes and cautious operational classification. Version 1.1.0 contains 92 stable knowledge records and a separate, auditable directory of 120 classification rules. The dataset is a reference artifact, not real-time provider policy feedback; it aids observability, support, parser testing, and limited delivery operations, but does not establish recipient status or final inbox placement. The dataset offers two configurations: default (knowledge dataset) with 92 English knowledge records covering diagnostics and delivery decision context; classification_rules (classification rules directory) with 120 ordered rules, including 99 exact mappings and 21 cautious fallback rules. The dataset does not contain raw SMTP responses, observed delivery event examples, recipient information, personal data, provider-specific line text, or internal working materials.
数据集概述
Open SMTP Error Dataset 是一个面向 SMTP 增强状态码知识的英语、机器可读参考数据集,提供谨慎的操作性分类规则。当前版本为 v1.1.0,包含 92 条稳定的知识记录 和 120 条可审计的分类规则。该数据集定位为参考工件,而非实时的服务商策略源,主要用于可观测性、技术支持、解析器测试及有界投递操作,不对收件人状态或最终收件箱位置做出判定。
数据集配置
| 配置名称 | 内容与规模 | 文件位置 |
|---|---|---|
default |
92 条英文知识记录,包含诊断和投递决策上下文 | data/open-smtp-error-knowledge.parquet |
classification_rules |
120 条有序规则:99 条精确映射 + 21 条谨慎回退规则 | data/classification-rules.parquet |
此外,还存在独立的弹跳识别契约文件 data/bounce-recognition-rules.json,包含 92 条精确增强状态码映射和 4 个文本信号,其契约版本为 1.0.0。
知识记录字段
每条知识记录包含以下 operational_classification 字段:
rule_keyfailure_persistencecause_familyrecipient_validityretry_dispositionsuppression_dispositionconfidenceneeds_review
其中,rule_key 表示首个匹配的分类规则;needs_review 为 true 时表示结果适用于人工审查或补充上下文收集,而非不可逆的自动化操作。
分类规则模式
classification_rules 配置中每行包含以下公共字段:
schema_version、rule_key、source、precedence_tier、enhanced_status_code、enhanced_status_prefix、match_field、match_operator、match_value、failure_persistence、cause_family、recipient_validity、retry_disposition、suppression_disposition、confidence、needs_review、rationale、source_title、evidence_reference、knowledge_record_id、excluded_enhanced_status_codes
规则评估是确定性的:先考虑精确映射,排除项优先于回退规则,随后再考虑谨慎回退规则。覆盖范围之外的结果保持未分类状态。特别地,5.7.28 按策略有意保持未分类,而 4.7.28 的精确映射仍然可用。
加载方式
可使用 load_dataset 加载两个配置:
- 知识配置:用于解释性目录内容
- 规则配置:当应用需要展示规则来源、优先级、置信度和审查要求时使用
使用边界与负责任使用
数据集中不包含:原始 SMTP 响应、观察到的投递事件示例、收件人信息、个人数据、服务商特定的线上文本及内部工作材料。公开包仅包含隐私安全的结构化知识、规则和溯源信息。
禁止仅凭文本信号或标记为 needs_review 的结果自动抑制收件人、关闭调查或做出其他不可逆的投递决策。运营遥测数据应保留在授权系统中。
公开文件清单(v1.1.0)
README.mdbounce-recognition-guide.mdCHANGELOG.mdNOTICE.mddata/open-smtp-error-knowledge.jsonldata/open-smtp-error-knowledge.csvdata/open-smtp-error-knowledge.parquetdata/bounce-recognition-rules.jsondata/dataset-manifest.jsondata/dataset.schema.jsondata/classification-rules.jsonldata/classification-rules.csvdata/classification-rules.parquetdata/classification-rule.schema.json
注意:LICENSE.md 在此版本中刻意缺席,其标识符和处理方式有待单独的所有者决策。NOTICE 文件记录第三方署名,但不对整个数据集声明许可证。





