HTSUS-2026
收藏官方服务:
资源简介:
从eCFR编译的非优惠原产地规则机器可读语料库,回答商品合法原产于哪个国家,并引用所使用的规则。
A machine-readable corpus of non-preferential rules of origin compiled from the eCFR, which is tasked with determining the legal country of origin for commodities and citing the specific rules applied for such determination.
创建时间:
2026-08-30
原始信息汇总
数据集概述
该数据集名为 originshift,是一个关于非优惠原产地规则的结构化数据集合,旨在回答“商品在法律上原产于哪个国家?”的问题,并引用所依据的规则。
核心内容
- 法律依据:基于美国《联邦法规》(eCFR)中的 19 CFR Part 102 规则,并固定到特定的商品命名目录版本(HTSUS-2026)。
- 适用范围:仅覆盖 Part 102。对于非纺织品,不判定第301条或232条原产地;也绝不裁决反倾销/反补贴税(AD/CVD)范围。
- 两大语料库:
- 102.21:管辖所有纺织和服装进口(来自任何国家),共 101 条规则(外加 1 条覆盖规则)。用户除商品编码外,还需提供生产事实(如纤维、是否针织成型、组装地等)。经美国海关与边境保护局(CBP)裁决验证,13/13 国家判定正确,13/13 条款引用正确。
- 102.20:管辖加拿大和墨西哥商品的原产地标记(依据 USMCA 与 NAFTA),共 1,032 条规则(外加 2 条覆盖规则)。仅需商品分类编码。验证结果:22/22 税则转换,8/8 国家判定正确。
数据形态与特性
- 每条规则记录均包含来源 URL、eCFR 发布日期、命名目录版本(vintage)等溯源信息。
- 规则以**区间(ranges)**形式存储,不展开为单个编码,避免破坏结构并防止数据膨胀。
- 解析器无法处理的规则会记录原因(如规则以商品名称而非编码表述、附带条件、取决于加工地点等)。
输出结果
所有判定结果仅为以下三种状态,绝不猜测:
| 状态 | 含义 |
|---|---|
resolved |
规则已适用,返回原产地和规则 ID |
unresolved |
无规则适用或输入信息不足——明确指出缺失项 |
ambiguous |
多条规则同时适用,返回所有候选规则及其文本 |
使用方式
- 提供 Python API(
from originshift import resolve)与 命令行工具(originshift resolve、originshift bom、originshift questions等),支持单次查询与批量 CSV 处理。 - 支持**物料清单(BOM)**逐节点自下而上判定原产地。
- 针对纺织品的
unresolved结果,会列出为解决问题所需回答的问题清单(基于规则覆盖率排序),其中四个核心问题可解决 73.8% 的条件性替代规则。
验证与范围
- 以 CBP 的 HQ 裁决为基准进行结构性对比验证(312 项裁决引用 102.20,其中 228 项引用具体规则,产生 242 条可评分的引文)。
- 明确不生成原产地证书,不进行优惠性或自由贸易协定(FTA)资格判定,两者均超出设计范围。
搜集汇总
数据集介绍

构建方式
HTSUS-2026数据集源自美国联邦法规电子版(eCFR),由originshift项目构建,旨在将非优惠原产地规则结构化。该数据集涵盖了两个核心语料库:其一为针对所有纺织与服装进口商品的102.21规则,包含101条规则及1个覆盖层;其二为适用于美国-墨西哥-加拿大协定(USMCA)及北美自由贸易协定(NAFTA)框架下加拿大和墨西哥商品的原产地标记规则102.20,包含1,032条规则及2个覆盖层。构建过程涉及从eCFR抓取原始法规文本,通过定制解析器将条文编译为语法化的类型系统,并辅以人工录入无法直接获取的规则,最终生成带版本标识的JSON格式语料库。每条规则均记录了溯源信息,如来源URL和法规发布日期,确保规则的权威性和可追溯性。
使用方法
使用者可以通过安装originshift包轻松调取该数据集,并利用命令行接口进行查询。例如,使用`originshift resolve`命令可针对特定商品输入税号、原产国及必要的生产事实,获得原产地判定结果。对于批量处理,支持CSV文件入口,输出中包含了详尽的依据和规则引用,便于审计。此外,`originshift bom`命令支持对物料清单(BOM)进行逐级原产地分析,自下而上地确定最终产品的原产地。对于缺乏完整信息的查询,工具会返回`unresolved`状态并具体指出缺失的关键事实,指导用户补充数据。验证模块使研究人员能够对照美国海关与边境保护局(CBP)的官方裁决评估数据集的准确性。
背景与挑战
背景概述
HTSUS-2026数据集由KvashaIhor等人于2026年创建,源自对非优惠原产地规则的系统性数字化整理,旨在回答“某商品合法产地为何国”这一核心问题,并严格引用所依据的规则。该数据集聚焦于美国海关与边境保护局(CBP)所执行的19 CFR Part 102法规,涵盖102.20与102.21两个子部分,分别对应美国-墨西哥-加拿大协定(USMCA)及纺织品与服装的原产地判定。其研究团队将繁杂的法律条文编译为结构化、可机器读取的规则库,并附带完整溯源信息,为国际贸易合规与法律分析提供了前所未有的数据基础设施。该数据集的发布在贸易合规与法律科技领域引起了广泛关注,其精确的规则编码与验证方法,为后续基于原产地规则的自动化决策系统奠定了基准,对学术研究与工业实践均产生了深远影响。
当前挑战
该数据集面临的挑战多维且深刻。首先,领域层面的核心难题在于原产地规则的高度复杂性与非结构化特征:法规文本中嵌套条件、例外与语义模糊,如102.21(e)(1)与(e)(2)的适用取决于纤维类型,且部分规则以自然语言描述而非明确代码,使纯解析难以周全。其次,构建过程遭遇诸多技术障碍:解析器需处理从eCFR拉取的数据快照,但1032条102.20规则中仍有19条无法结构化(占1.3%),而102.21的176个备选规则中,高达68.2%因依赖生产事实(如缝制地点、纤维成分)而无法仅凭HS编码判定,需用户额外输入。此外,规则间的冲突与优先级判定(如102.11与102.21的分野)要求精细设计,而CBP规则引用中的措辞松散(如复数化、点分式HS编码)迫使验证环节采用结构比对而非文本匹配。这些挑战共同决定了数据集在确保法律准确性与可用性之间需精妙权衡。
常用场景
经典使用场景
HTSUS-2026数据集核心用途在于对非优惠性原产地规则进行精确解析与判定,其经典场景涵盖19 CFR Part 102之下的两大核心规则体系:102.20(针对加拿大与墨西哥商品的原产地标记规则)以及102.21(涵盖所有纺织品与服装进口的原产地规则)。研究者或实务人员可凭借该语料库,输入商品HS编码、生产事实甚至完整物料清单,即可获取结构化的原产地判定结果,并附所依据的规则条款与溯源信息。此场景不仅适用于单一商品查询,亦支持批量CSV处理与多层物料清单的自底向上原产地递归解析,从而高效回应供应链合规审查中的复杂归属问题。
解决学术问题
该数据集系统性地解决了原产地规则领域长期存在的文本非结构化、判定不一致及难以程序化验证的学术痛点。源自eCFR的官方法规被编译为可计算的语法与类型体系,每一个规则记录均承载来源URL、eCFR发布日期及命名法版本(如HTSUS-2026),确保了规则的可追溯性与可复现性。通过与CBP自身裁决数据的结构化比对验证(13/13国家、22/22税则转变等),该语料库为验证原产地判定算法的准确性与一致性提供了黄金基准,进而支撑关于原产地规则解释差异、实质性转变判例法量化以及规则复杂度建模的理论研究。其开源性质与语义化版本控制亦为后续学术工作提供了可扩展且不易过时的数据基础设施。
实际应用
在产业实务中,HTSUS-2026语料库的直接应用聚焦于国际贸易合规与供应链风险管理。进口商、报关行及跨国制造商可借由该工具自动裁定货物法定原产国,以应对美国海关及边境保护局的监管要求,尤其是在纺织品与服装领域,通过精确获取102.21规则所需的纤维、针织形态及组装地等生产事实,避免了因原产地申报错误而引发的罚款与货物滞留。此外,针对美墨加协定(USMCA)下的原产地标记诉求,该语料支持快速判定商品是否满足102.20之税则转变或微量允许条款,从而优化关税享惠策略。批量解析功能使季度进口数据的复核成为可能,而物料清单模式则助力企业透视多层供应链中各节点的原产地贡献,为“原产地规划”提供数据驱动的决策支持。
数据集最近研究
最新研究方向
针对全球贸易合规的数字化与智能化需求,HTSUS-2026数据集的最新研究聚焦于将非优惠性原产地规则(如19 CFR Part 102)转化为可机器解析、可追溯的结构化语料,以回应跨境供应链中日益复杂的原产地判定挑战。该研究通过构建覆盖纺织品、服装及北美自贸区商品的规则库,结合CBP裁决进行验证,推动了贸易合规从人工解读向自动化决策的范式转变。其前沿方向包括规则推理的精细化解耦、针对生产事实的交互式问答系统,以及嵌入法规版本与数据来源的溯源机制,旨在提升全球供应链透明度和法律确定性,对海关执法、贸易政策分析及企业合规管理具有深远影响。
以上内容由遇见数据集搜集并总结生成



