遇见数据集

pirvn-products

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

该数据集是一个多语言商品信息数据集,包含商品标题、类别、价格、品牌、规格等结构化字段。数据规模方面,总计包含 11,785 条样本,划分为训练集(9,428 条)、验证集(589 条)和测试集(1,768 条),总数据量约为 26.99 MB。数据集特征包括:商品标题(中文和英文)、商品类别、价格(浮点数)、数据来源、品牌、完整描述、重量、规格说明、提示词文本以及唯一ID。基于其结构化多语言文本和商品属性字段,该数据集可能适用于多语言文本生成、信息抽取、商品分类或电商领域的自然语言处理任务。

This dataset is a multilingual product information dataset comprising structured fields including product titles, categories, prices, brands, specifications, and more. In terms of data scale, it contains a total of 11,785 samples, split into a training set (9,428 samples), a validation set (589 samples), and a test set (1,768 samples), with an overall data volume of approximately 26.99 MB. The dataset features include: product titles in both Chinese and English, product categories, floating-point price values, data sources, brands, full product descriptions, weights, specification descriptions, prompt texts, and unique IDs. Leveraging its structured multilingual text and product attribute fields, this dataset may be applicable to natural language processing tasks such as multilingual text generation, information extraction, product classification, or e-commerce-related scenarios.

创建时间:
2026-06-19
原始信息汇总

数据集概览:IKN03/pirvn-products

该数据集是一个商品信息数据集,包含商品标题、分类、价格、品牌、规格等详细字段,适用于商品描述生成、分类等任务。

主要特征

该数据集包含以下11个字段:

  • title (字符串): 商品标题。
  • title_en (字符串): 商品的英文标题。
  • category (字符串): 商品类别。
  • price (浮点数): 商品价格。
  • source (字符串): 数据来源。
  • brand (字符串): 商品品牌。
  • full (字符串): 商品完整描述。
  • weight (浮点数): 商品重量。
  • specs (字符串): 商品规格。
  • prompt (字符串): 提示词,可能用于模型输入。
  • id (整数): 商品唯一标识符。

数据集规模

  • 总大小:26,990,381 字节
  • 下载大小:12,464,739 字节
  • 总样本数:11,785 条

数据划分

数据集被分为三个子集:

  • 训练集 (train): 9,428 条样本,占数据集的绝大部分。
  • 验证集 (validation): 589 条样本。
  • 测试集 (test): 1,768 条样本。

配置与文件

  • 配置名称:default
  • 数据文件路径:data/train-*data/validation-*data/test-*。这些文件位于该数据集仓库的根目录下。
搜集汇总
数据集介绍
pirvn-products 数据集图片
构建方式
pirvn-products数据集源自对电商平台商品信息的系统性采集与整理,涵盖了多语言商品标题、分类、价格、品牌、规格等结构化字段。通过将原始数据进行清洗、去重与标准化处理,构建了包含训练、验证与测试三个子集的完整数据集,充分考虑了数据分布的均衡性与代表性。
使用方法
数据集以标准格式提供,可通过HuggingFace Datasets库直接加载使用,预划分的训练(9428条)、验证(589条)与测试(1768条)样本便于模型开发与评估。适用于商品描述生成、跨语言商品匹配、属性提取等场景,也可作为电商领域预训练与微调任务的优质数据资源。
背景与挑战
背景概述
PIRVN-Products数据集是越南零售商品领域内一项重要的数据资源,由当地研究团队在2023年左右创建,旨在解决越南语环境下商品信息的结构化与语义理解问题。该数据集聚焦于标题、类别、价格、品牌、规格等核心字段,为多语言产品目录的自动解析与分类研究提供了标准化的基准。其影响力在于推动了越南电商场景中自然语言处理技术的应用,尤其是在低资源语言的产品匹配与检索任务上,为相关领域研究奠定了数据基础。
当前挑战
数据集面临的挑战主要包括两个方面。在领域问题层面,它致力于攻克越南语商品信息处理中的多义性、拼写变体及缺乏统一术语标准等难题,使得从非结构化文本中提取结构化属性变得尤为困难。在构建过程中,研究团队需应对数据来源多样化带来的格式不一致问题,同时确保标注质量与覆盖广度之间的平衡,尤其是对于小众品类和复杂规格的准确编码,这要求投入大量人工校验与领域知识整合工作。
常用场景
经典使用场景
在电子商务与自然语言处理的交叉领域中,pirvn-products数据集为多模态商品理解与检索任务提供了坚实的数据基础。该数据集汇集了近万条包含标题、类别、价格、品牌及详细规格的商品信息,尤其通过中英文双语标题和自然语言prompt字段,支撑起跨语言商品匹配、属性抽取和生成式推荐等经典研究场景。研究者可借助其结构化标签与自由文本的融合,探索商品文本的语义表征与细粒度分类,从而推动智能购物助手的精准化发展。
解决学术问题
该数据集直面电子商务场景中商品信息异构与语义鸿沟的核心学术挑战。通过提供统一格式的商品规格、价格及类别标注,它有效解决了多源商品数据的对齐与融合难题,为弱监督学习和零样本分类提供了可复现的基准。其prompt字段的设计尤为关键,有助于探索基于预训练模型的商品描述生成与属性推理,进而推动知识图谱补全和跨模态检索等前沿方向的理论突破。
实际应用
在实际产业落地中,pirvn-products数据集赋能了智能库存管理、动态定价策略和个性化商品推荐系统。电商平台可借助其结构化信息实现自动化类目归类与价格异常检测,同时利用双语标题优化全球化搜索体验。更值得关注的是,基于该数据集训练的模型能够辅助生成规范化的商品描述,降低人工运营成本,并提升客户在移动端和语音交互场景下的购物效率与满意度。
数据集最近研究
最新研究方向
在当前电商与自然语言处理交叉领域的前沿探索中,pirvn-products数据集因其多模态、多属性结构的特性,正成为推动产品检索与视觉问答系统优化的关键资源。该数据集涵盖中英文标题、类别、价格、品牌及详细规格等丰富字段,尤其包含由产品图像衍生的语义prompt,使其在零样本学习与跨模态对齐研究中备受青睐。结合近期热门的AIGC应用浪潮,研究者利用该数据集构建可控生成模型,提升商品描述自动生成与个性化推荐的可解释性。此外,其结构化规格信息助力细粒度属性识别与知识图谱构建,为电商平台智能客服与供应链管理的精准化演进提供了坚实的数据底座,彰显了结构化商品数据在智能化商业体系中的核心价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务