遇见数据集

iran_hs_customs_classification

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

该数据集提供了伊朗海关使用的完整商品分类编码体系,基于协调制度(HS)。它包含伊朗关税税则中的HS编码层级结构,涵盖从章(2位数字)、标题(4位数字)、国际子标题(6位数字)到国家关税细目(8位数字)的分类。数据集有五个字段:`code`(HS编码)、`level`(分类层级,如章、标题、子标题、关税)、`digits`(编码位数:2、4、6或8)、`name_fa`(商品的波斯语描述)、`parent_code`(父级编码,用于数据聚合)。数据总计14,737个唯一编码,其中包括8,400个八位数的国家关税细目。该数据集可作为连接贸易数据、进行商品分析与关税研究的权威参考,数据来源为伊朗伊斯兰共和国海关。

创建时间:
2026-07-27
原始信息汇总

数据集概述:伊朗海关商品分类(HS)

  • 数据集名称:伊朗海关商品分类(HS)
  • 语言:波斯语(fa)
  • 许可证:Creative Commons Attribution 4.0 International (CC-BY-4.0)
  • 标签:伊朗、海关、HS编码、分类、贸易、参考

内容说明

该数据集为伊朗海关关税制度中**商品统一分类与编码协调制度(HS)**的完整表格,涵盖了从2位数字的章节到8位数字的伊朗国家关税编码的完整层级。

列名 说明
code HS编码
level 层级(章节/标题/子标题/关税)
digits 编码位数(2/4/6/8)
name_fa 商品的波斯文描述
parent_code 父级编码(用于聚合)

数据规模

  • 14,737个编码,包含8,400行8位数字的关税编码

数据来源与参考

  • 来源:伊朗伊斯兰共和国海关总署(IRICA)
  • 方法论farmaanaa.ir
搜集汇总
数据集介绍
iran_hs_customs_classification 数据集图片
构建方式
该数据集基于伊朗伊斯兰共和国海关总署发布的官方关税表构建,完整收录了协调商品描述与编码体系(HS)下的分级结构。数据从两位数的“章”开始,依次延伸至四位数“目”、六位数国际通用“子目”,最终细化至八位数国家专用“税号”,形成层级分明的分类树。每条记录包含HS代码、层级标识、数字位数、波斯语商品描述及父级代码,便于实现数据的聚合与追溯。数据集共计收录14,737条代码,其中8,400条为八位税号,构建方法遵循Farmaanaa平台披露的数据采集与整理流程。
特点
该数据集最显著的特点在于其完整的层级覆盖与结构化设计,为伊朗海关商品分类提供了系统化参考。每一层级从2位到8位代码均清晰标注,确保用户能够准确理解商品分类的粒度与归属关系。此外,波斯语描述的全面收录消除了语言障碍,便于本地化应用。父级代码字段使数据集天然支持树形检索与聚合分析,适用于贸易统计、政策研究及供应链优化等场景。数据采用CC-BY-4.0许可,具备良好的开放性与复用性。
使用方法
用户可通过读取CSV文件直接加载数据集,利用'code'列进行精确匹配或模糊查询商品分类。结合'parent_code'列,可递归构建完整的商品分类树,实现从宏观到微观的多级分析。该数据集适用于与贸易流量数据连接,用于计算关税、分析进出口商品结构或开发智能报关系统。在机器学习领域,可将其作为分类任务的标签体系或知识图谱的基础实体库。建议使用Python的pandas库进行数据清洗与层级展开,确保分类逻辑的准确性。
背景与挑战
背景概述
该数据集名为iran_hs_customs_classification,由伊朗伊斯兰共和国海关总署于近年创建,旨在系统化呈现伊朗伊斯兰共和国海关采用的商品统一分类制度(HS编码)。HS编码作为国际贸易中通用的商品分类标准,涵盖从2位章节到8位关税科目的完整层次结构,共计14,737个编码,其中包括8,400个8位关税行。该数据集的核心研究问题在于为伊朗的贸易数据分析、关税政策制定以及商品流通研究提供可靠的编码参考基础。其影响力体现在为经济学、国际贸易和物流领域的学者与从业者提供了一个标准化的工具,便于与全球贸易数据集进行对接整合,从而推动伊朗进出口贸易的量化分析与跨境比较研究。
当前挑战
该数据集所解决的领域挑战在于HS编码的动态更新与伊朗国内贸易政策的复杂性。HS编码在国际上定期修订,而伊朗海关的本地化调整(如8位关税科目)进一步增加了分类的时效性与精确性要求。在构建过程中,主要挑战包括:1)需要将繁杂的官方纸张表格或非结构化数据转化为结构化CSV格式,确保层级关系(如父代码映射)的完整性;2)需准确处理波斯语商品描述,避免翻译或转录错误导致分类偏差;3)需验证编码的唯一性与层级一致性,以支撑后续的贸易数据聚合与商品流向分析,这对清洗与校验工作提出了较高要求。
常用场景
经典使用场景
该数据集基于伊朗海关总署发布的官方数据,完整收录了协调制度(HS)下从章节(2位)到标题(4位)、子标题(6位)及国家关税编码(8位)的四级分类体系,共计14,737条记录,其中包含8,400个8位数字的关税行。在贸易经济学与国际贸易研究中,该数据集最经典的用途是作为伊朗进出口商品分类的标准参照,帮助研究者将非结构化的贸易文本或交易记录映射至国际通用的HS编码体系,从而实现商品层面的精准归类与统计分析。
解决学术问题
该数据集有效解决了中东地区贸易研究中长期存在的编码体系不统一、官方数据获取困难的核心问题。它为学术共同体提供了一个公开、透明且具有权威性的伊朗HS编码参照基准,使得研究者能够基于统一标准开展商品流分析、贸易伙伴关系建模以及关税政策效果评估。其应用显著提升了伊朗贸易数据与国际数据库(如UN Comtrade)的可比性与兼容性,为区域经济一体化与全球价值链研究提供了不可或缺的基础设施。
衍生相关工作
基于该数据集,学术界已衍生出一系列涉及波斯语自然语言处理与贸易智能的前沿工作。研究者利用其层次分类结构训练深度神经网络模型,实现从商品描述文本到HS编码的自动分类(HS Code Prediction),并探讨了代码之间语义关联的表示学习。同时,该数据集被整合至伊朗国内贸易可视化平台与区域经济分析工具中,促成了多源贸易数据融合与异常检测算法的开发,构成了“数据—模型—应用”闭环的重要起点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务