遇见数据集

ATH-MaaS/HSCodeComp

收藏
Hugging Face2026-07-08 更新2026-07-22 收录
官方服务:

资源简介:

HSCodeComp是第一个现实、专家级的电子商务基准数据集,旨在评估深度搜索代理在层次规则应用(Level-3知识)方面的能力。该任务要求代理根据嘈杂的真实世界电子商务领域描述的产品,通过正确应用复杂的层次关税规则(例如来自eWTP和官方海关裁决)来预测精确的10位协调制度代码(HSCode)。这些规则通常包含模糊语言和隐式逻辑,使得准确分类极具挑战性。数据集输入包括产品标题、属性集合、平台定义的产品类别、价格和货币;知识部分涵盖层次关税规则、人工编写的决策规则和官方海关裁决数据库。输出为10位数字字符串的HSCode,具有层次结构:前2位表示HS章节,前4位表示HS标题,前6位表示HS子标题,最后4位为国家特定代码。数据集包含632个专家标注的条目,覆盖27个HS章节和32个一级类别,数据来源于大规模电子商务平台,并经过多位领域专家验证,标注者间一致性大于98%。该数据集用于测试14个基础模型、6个开源代理和3个闭源系统,突出了层次规则应用在现有AI代理系统中仍是一个主要未解决的挑战。

HSCodeComp is the first realistic, expert-level e-commerce benchmark designed to evaluate deep search agents on their ability to perform hierarchical rule application (Level-3 knowledge). The task requires agents to predict the exact 10-digit Harmonized System Code (HSCode) for products described with noisy, real-world e-commerce domain data by correctly applying complex, hierarchical tariff rules (e.g., from eWTP and official customs rulings). These rules often contain vague language and implicit logic, making accurate classification highly challenging. The dataset input includes product title, a set of attributes, platform-defined product categories, price, and currency; knowledge components encompass hierarchical tariff rules, human-written decision rules, and official customs rulings databases. The output is a single 10-digit numeric string HSCode with a hierarchical structure: the first 2 digits represent the HS chapter, the first 4 digits the HS heading, the first 6 digits the HS sub-heading, and the last 4 digits (7-10) the country-specific codes. It contains 632 expert-annotated entries, covering 27 HS chapters and 32 first-level categories, sourced from large-scale e-commerce platforms, validated by multiple domain experts with an inter-annotator agreement of >98%. The dataset is used to test 14 foundation models, 6 open-source agents, and 3 closed-source systems, highlighting that hierarchical rule application remains a major unsolved challenge for state-of-the-art AI agent systems.

提供机构:
ATH-MaaS
搜集汇总
数据集介绍
ATH-MaaS/HSCodeComp 数据集图片
构建方式
HSCodeComp数据集的构建过程严谨且专业,依托于大规模电商平台的产品数据,最终经由多位领域专家协同完成。具体而言,研究人员设计了一套包含六个步骤的精细流程来确保数据质量:首先从真实电商场景中采集产品信息,包括标题、属性、类别、价格及货币等维度;随后由专家对产品进行初步的HSCode预测,并经过多轮交叉验证与讨论达成共识,以确保标签的准确性与一致性。整个数据集包含632条经过专家标注的产品记录,覆盖27个HS章节与32个一级商品类别,专家间的标注一致性超过98%,为评估深度智能体在层级规则应用中的表现提供了高质量的基准。
特点
该数据集的核心特点在于其真实性与专家级的难度,聚焦于层级规则应用这一关键但常被忽视的认知能力。HSCodeComp要求智能体依据复杂的层级化关税规则(如eWTP规则与官方海关裁决)为带有噪音的真实电商产品预测精确的10位HS编码。规则中充斥着模糊语言与隐含逻辑,使得准确的分类极具挑战。实验揭示出当前顶尖AI智能体(如SmolAgent配合GPT-5视觉模型)的最佳性能仅为46.8%,而人类专家可达95.0%,凸显了巨大的性能鸿沟。值得注意的是,推理时扩展策略(如多数投票与自我反思)不仅未能提升效果,反而导致性能下降,进一步表明深度搜索在层级规则应用领域仍是尚未攻克的难题。
使用方法
HSCodeComp的使用流程简洁明了,便于研究复现。数据集以CSV格式提供,每项包含产品描述、属性信息及对应的真实HSCode。用户首先需配置Python环境,安装pandas、openai等依赖库,并在项目根目录设置.env文件以配置OpenAI的密钥与基础URL。随后,在测试脚本中指定待评估的模型,例如将models_to_test设置为包含gpt-4o的列表,运行eval/test_llm.py脚本即可。评估脚本会报告多层级精确匹配准确率,覆盖2位、4位、6位、8位及10位HS编码,从而全面衡量智能体在层级分类任务中的表现。
背景与挑战
背景概述
在全球电子商务迅猛发展的浪潮中,商品的海关编码(Harmonized System Code, HSCode)准确分类是跨境贸易、关税计算与合规监管的核心支撑。HSCodeComp数据集由阿里巴巴集团MarcoPolo团队于2025年创建,聚焦于层级化规则应用这一三级知识能力,旨在评估深度搜索代理在复杂真实场景下的表现。该数据集包含632条由多位领域专家严格标注的商品条目,覆盖27个HS章节与32个一级类别,专家间标注一致性超过98%。作为首个面向电商领域、专家级别的基准测试,HSCodeComp填补了现有智能体评估框架中对层级规则理解与应用的空白,揭示了当前最先进AI系统与人类专家之间的显著差距,为智能代理在复杂规则推理方向的研究提供了关键标尺。
当前挑战
HSCodeComp所解决的领域核心挑战在于,商品的海关编码预测不仅需要处理噪声多、特征杂的真实电商描述,更需精确应用包含模糊语言与隐含逻辑的层级化关税规则,这对于现有智能代理而言是一个尚未攻克的难题。实验表明,最优AI代理(SmolAgent+GPT-5)的准确率仅为46.8%,远低于人类专家的95.0%,且推理时间扩展策略(如多数投票与自我反思)无法有效提升性能。在数据集构建过程中,挑战包括从大规模电商平台筛选高质量商品数据、设计六步专家标注流程以确保标签准确性、以及构建涵盖官方分类系统、人类决策规则和历史裁决数据库的知识体系,这些均需要深厚的领域知识与精细的质控机制。
常用场景
经典使用场景
HSCodeComp数据集被设计用于评估深度搜索智能体在层次化规则应用任务上的表现,其核心场景是预测电子商务产品的精确10位协调制度代码(HSCode)。该数据集提供了包含产品标题、属性、平台分类、价格及货币等丰富信息的真实世界噪声输入,要求智能体在复杂的关税规则体系中完成归类的精准推理。作为首个专家级别的现实电子商务基准,HSCodeComp通过设问海量模糊语言与隐含逻辑交织的规则条目,为衡量人工智能系统在知识密集型决策中的能力设立了严苛的标尺。
衍生相关工作
HSCodeComp的发布催生了一系列围绕层次化规则理解与深度搜索推理的经典探索。研究者围绕该基准展开了对智能体工具调用与推理优先级的消融分析,发现优先利用工具获取准确信息相较于盲目推理能显著提升表现。此外,实验推动了关于推理时计算有效性(inference-time scaling)的深入讨论,多数投票与自我反思等策略的失效激发了更高效的元认知框架设计。相关工作还延伸至多模态融合与领域知识图谱检索,为构建更具鲁棒性的专业级智能体系奠定了评测基石。
数据集最近研究
最新研究方向
当前,基于层级规则推理的深度搜索智能体评估成为人工智能领域的前沿焦点。HSCodeComp作为首个面向电商场景的专家级基准数据集,开创性地聚焦于层级化关税编码(HSCode)这一具有高度专业性与逻辑复杂性的真实业务问题。该数据集通过设计复杂的隐性规则与模糊语言约束,揭示了当前最先进AI智能体在层级规则应用上的显著短板——最优模型仅达46.8%准确率,与人类专家95.0%的表现相去甚远。尤为令人深思的是,研究发现推理时扩展策略(如多数投票与自我反思)不仅未能提升性能,反而加剧错误与幻觉的产生,这一反直觉现象为AI在结构性知识推理中的脆弱性提供了重要实证,标志着该领域亟需超越传统搜索范式、探索更深层次的知识应用机制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务