遇见数据集

ecommerce-intent

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

ZeroProof E-commerce Intent 是一个用于支付意图分类的英文文本数据集,专门为训练小型模型以在AI智能体执行操作前验证用户实际请求而构建。数据集包含客户与客服之间的对话,每条对话标注有一个结构化的意图对象,涵盖七种核心类型:消费(spend)、发送(send)、兑换(exchange)、定期支付(recur)、账单(bill)、撤销(reverse)和无意图(none)。数据通过多智能体市场模拟生成:语言模型分别扮演客户和客服角色进行回合制对话,每段对话独立采样人物角色、情境、语气、设备和使用行为,并包含对抗性角色。生成过程采用标签盲法(客户模型仅被告知在购物,而非生成训练样本),标签在后续步骤中根据锁定策略单独标注,且每个数据分割均通过结构性数据门控,确保训练集与测试集零泄漏。数据格式为JSONL,每条记录包含消息序列(含角色和内容)和目标对象(包括意图检测标志、核心类型、详细信息字段、置信度、理由和源消息序列索引)。该数据集设计为领域专用,适用于电子商务和智能体商务场景中的支付意图模型训练与评估。

ZeroProof E-commerce Intent is an English text dataset for payment intent classification, specifically constructed for training small-scale models to verify users' actual requests prior to AI Agent operations. This dataset contains conversations between customers and customer service agents, with each conversation annotated with a structured intent object covering seven core categories: spend, send, exchange, recur, bill, reverse, and none. The dataset is generated via multi-agent market simulation: language models assume the roles of customers and customer service agents respectively for turn-based conversations. Each conversation independently samples character roles, scenarios, conversational tones, devices, and usage behaviors, and incorporates adversarial roles. The generation process employs label blinding: the customer model is only notified that it is participating in a shopping scenario, rather than being informed that it is generating training samples. Labels are separately annotated in subsequent steps using a locking strategy, and each data split undergoes structured data gating to ensure zero data leakage between the training and test sets. The dataset follows the JSONL format, where each record includes a message sequence (comprising speaker roles and corresponding content) and a target object. The target object contains fields such as intent detection flag, core category, detailed information, confidence score, rationale, and source message sequence index. This is a domain-specific dataset tailored for e-commerce and agent-based commerce scenarios, and is designed for training and evaluating payment intent classification models.

创建时间:
2026-07-09
原始信息汇总

数据集概述

数据集名称:ZeroProof E-commerce Intent
发布者:zero-proof-ai
许可证:CC-BY-4.0
语言:英文
数据集大小:10K 到 100K 条样本
任务类别:文本分类
标签:意图分类、支付、电子商务、智能商务、合成数据

数据内容

数据集包含客户与客服之间的对话,每条对话标注了一个结构化意图对象,意图分为七类:

  • spend(消费)
  • send(发送)
  • exchange(兑换/交换)
  • recur(循环/定期)
  • bill(账单)
  • reverse(撤销/退款)
  • none(无意图)

每条样本包含:

  • messages:对话历史,包含用户和助手的消息序列
  • target:意图标注对象,包括:
    • intent_detected:是否检测到意图
    • core_type:核心意图类型
    • details:该意图的补充字段(如 action、reason_code)
    • confidence:置信度
    • reason:标注理由
    • source_message_seqs:支撑标注的用户消息序号

数据生成方式

数据通过多智能体市场模拟生成,非爬取或模板化。语言模型扮演顾客和客服进行多轮对话,独立采样角色、情境、语气、设备和行为,包括对抗性角色。生成过程对标签不可知(顾客模型仅被告知在购物,不被告知正在生成训练样本),标签在独立阶段依据固定策略分配,且训练集和测试集之间无泄漏。

预期用途

用于训练和评估电子商务及智能商务场景下的支付意图模型。设计上为窄领域、特定任务,非通用指令集,仅支持英文。

基于该数据训练的模型

搜集汇总
数据集介绍
ecommerce-intent 数据集图片
构建方式
该数据集通过创新的多智能体市场模拟机制构建,而非简单的爬取或模板化生成。在生成过程中,语言模型分别扮演顾客与客服代理,围绕随机采样的角色画像、情境、语气、设备及行为(包括对抗性行为)展开多轮对话。顾客模型仅感知到购物场景,对标签生成过程一无所知,从而确保了数据的自然性。标签在一个独立的流程中依据严格策略进行分配,并经过结构性数据门控检验,确保训练集与测试集之间无任何信息泄露。
特点
数据集聚焦于电商支付场景下的意图分类,涵盖消费、发送、兑换、循环、账单、撤销及无意图七种核心类型。每条样本包含完整的对话记录与结构化意图对象,其中标签由意图存在性、核心类型、细节字段、置信度及推理依据构成,并明确标注了支撑标签的原始用户轮次。数据规模介于1万至10万条之间,采用CC-BY-4.0许可协议,专为窄领域支付意图建模而设计,英语单语。
使用方法
适用于训练和评估电商及代理型商务场景中的支付意图模型。使用时,可基于对话轮次利用`core_type`字段进行七分类任务,亦可借助`details`中的结构化字段实现细粒度意图解析。数据集已预分为训练集与测试集,可直接加载使用。基于该数据已训练出0.5B及1B参数规模的专用模型,可作为基线或迁移学习的起点。
背景与挑战
背景概述
在电子商务与智能体商务蓬勃发展的当下,精准理解用户支付意图成为保障交易安全与提升用户体验的关键。ecommerce-intent数据集由ZeroProof团队于近期创建,专注于支付场景下的意图分类任务,核心研究问题是如何构建能够验证用户真实请求的轻量级模型,以防止AI代理误操作。该数据集涵盖七种支付相关意图,如退款、转账、账单查询等,为领域内模型训练提供了窄域但高价值的标注资源,其创新性的多智能体市场模拟生成方法显著区别于传统模板化或爬取数据,对推动电子商务智能代理的可靠决策具有重要影响力。
当前挑战
数据集的挑战首先体现在所解决的领域问题上:电子商务对话中的支付意图细粒度分类面临意图边界模糊、用户表达多样化及伪造请求识别等难点,现有通用分类模型难以精准区分'退款'与'取消订单'等语义相近的意图。构建过程中,采用多智能体模拟虽能生成高质量自然对话,但需确保标签分配的公正性与无泄漏性,同时避免模拟数据与真实用户行为的偏差;此外,数据集当前仅涵盖英文与七类固定意图,如何扩展至多语言及动态意图体系成为后续迭代的关键挑战。
常用场景
经典使用场景
在电商与智能代理商务场景中,精准识别用户在对话中隐含的支付意图是构建可靠AI客服系统的核心挑战之一。ecommerce-intent数据集专为文本分类任务而设计,尤其聚焦于意图分类子领域,其经典使用场景在于训练和评估能够从多轮客户对话中提取支付意图的小型语言模型。该数据集覆盖了七种核心意图类型,包括消费、转账、换汇、周期性支付、账单、逆向交易以及无意图,每个样本均携带结构化意图对象,使模型能够学习从自然语言对话中精准定位如重复扣款退款等具体操作需求。这种高度领域定制化的设计,使其成为电商支付流程中意图检测及校正模型训练的标准基准。
解决学术问题
在学术界,ecommerce-intent数据集有效解决了面向电商支付对话的结构化意图识别这一前沿难题。传统意图分类研究往往依赖模板化数据或通用领域语料,难以覆盖真实对话中的复杂场景与对抗性行为。该数据集通过创新的多智能体市场模拟生成方法,引入了角色扮演、情境取样、语气变化等多样性因素,甚至包含对抗性用户行为,从而为研究者提供了同时具备高生态效度与标签纯净度的实验材料。其核心贡献在于推动了从粗粒度对话分类向细粒度、多字段的意图结构化解析的学术转型,为探究领域特化小模型在零样本或少样本条件下的鲁棒意图理解能力提供了宝贵平台。
衍生相关工作
基于ecommerce-intent数据集,学术界与工业界已在领域特化小模型方向上展开了富有成效的探索。最具代表性的衍生工作当属ZeroProof团队直接训练并发布的zeroproof-ecommerce-1b与zeroproof-ecommerce-0.5b两个轻量级意图理解模型,验证了在单一支付对话场景中,紧凑型架构即可取得与大型通用模型媲美的意图分类精度。这一成果推动了模型私有化部署与边缘计算场景下意图识别技术的落地。此外,该数据集的生成方法论也为后续研究开辟了新途径,尤其是多智能体模拟合成训练数据的技术路线,催生了对对抗性用户检测、标签噪声鲁棒性以及跨领域意图迁移学习等前沿课题的进一步探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务