遇见数据集

zalo-products-all

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集名为“Zalo Products - Main Dataset”,是Zalo机器人从所有用户提交的消息中收集的产品数据。数据集包含以下字段:产品图片(image)、产品名称(product_name)、描述(description)、价格(price)、类别(category)、发送者ID(sender_id)、发送者名称(sender_name)以及记录时间戳(timestamp)。当用户向Zalo机器人发送包含图片、描述、价格和类别信息的消息时,系统自动将数据存储到该数据集中。此外,每个用户还拥有一个独立的数据集(bep40/<sender_id>-zalo-data)。该数据集可用于产品分类、信息检索、用户行为分析等任务。数据集由ML Intern工具自动生成。

The dataset is named "Zalo Products - Main Dataset", which is product data collected by the Zalo bot from all messages submitted by users. The dataset contains the following fields: product image, product name, description, price, category, sender ID, sender name, and timestamp. When a user sends a message containing an image, description, price, and category information to the Zalo bot, the system automatically stores the data in this dataset. Additionally, each user has an independent dataset (bep40/<sender_id>-zalo-data). This dataset can be used for tasks such as product classification, information retrieval, and user behavior analysis. The dataset is automatically generated by the ML Intern tool.

创建时间:
2026-08-18
原始信息汇总

Zalo Products - Main Dataset 数据集概览

数据集简介

该数据集是由 ML Intern 工具生成的产品数据集合,收录了所有用户通过 Zalo 机器人提交的产品信息,涵盖完整的商品资料。

数据结构(Schema)

列名 类型 描述
image 图片(二进制/URL) 产品图片
product_name 文本 产品名称
description 文本 产品描述内容
price 数字 产品价格
category 文本 产品类别
sender_id 文本 发送者 ID
sender_name 文本 发送者姓名
timestamp 文本 记录时间

运作机制

  • 当用户发送包含图片和描述/价格/类别的消息时,数据会保存到此数据集中
  • 每位用户也拥有独立的数据集:bep40/<sender_id>-zalo-data
  • 本数据集汇总了所有用户提交的产品信息

使用方式

python from datasets import load_dataset

dataset = load_dataset(bep40/zalo-products-all)

生成信息

该数据集仓库由 ML Intern 生成,这是一个在 Hugging Face Hub 上进行机器学习研发的智能代理工具。

  • 试用 ML Intern:https://smolagents-ml-intern.hf.space
  • 源代码:https://github.com/huggingface/ml-intern
搜集汇总
数据集介绍
zalo-products-all 数据集图片
构建方式
该数据集源于Zalo机器人交互过程中收集的产品信息,涵盖了产品名称、描述、价格、类别、技术规格等核心属性,同时记录了发送者信息、聊天标识、时间戳及消息类型等元数据。原始数据经清洗与结构化处理,形成以表格形式存储的多字段架构,每一行代表一条独立的产品记录,确保数据具备完整的可追溯性和规范性。
特点
数据集具备多维度信息整合的特点,不仅包含产品本身的详尽描述与技术参数,还融合了交互场景中的上下文数据,如发送者ID、群组标识及消息内容,这为分析用户行为与产品关联提供了丰富素材。其字段类型以字符串为主,兼顾灵活性与可扩展性,尤其适合处理非结构化的产品文本。此外,数据源自真实业务环境,具有高度的生态真实性,能够反映实际市场中的产品分布与交流模式。
使用方法
使用者可通过HuggingFace的datasets库便捷加载该数据集,仅需调用`load_dataset`函数并指定名称即可获取完整数据。在具体应用中,数据可用于构建产品推荐系统、价格预测模型或类别分类器,亦可进行自然语言处理任务如文本摘要与情感分析。鉴于其包含交互日志,还可用于会话式AI的训练或用户画像挖掘。建议在使用前进行必要的数据预处理,如价格字段的数值化转换及空值处理,以适应下游分析或建模需求。
背景与挑战
背景概述
随着电子商务与即时通讯平台的深度融合,基于聊天机器人的产品数据采集成为构建商品信息库的重要途径。Zalo作为越南广泛使用的社交应用,其内置的商业功能催生了大量包含丰富商品信息的非结构化对话数据。该数据集由Hugging Face社区成员bep40创建,旨在从Zalo机器人聊天记录中提取结构化商品信息,涵盖产品名称、描述、价格、类别及技术规格等字段。这一资源的发布填补了越南语电商领域缺少高质量、真实场景数据集的空白,为跨语言信息抽取、对话式商务分析等研究提供了宝贵的语料支撑,并已通过ML Intern工具生成与维护,展现了自动化数据工程在商业场景中的应用潜力。
当前挑战
该数据集的核心挑战在于处理聊天数据的原始性与异构性。首先,从Zalo对话中提取的产品信息常伴随噪声,如价格格式不统一、描述含表情符号或口语化表达,对实体识别与属性对齐构成障碍。其次,数据覆盖多类别商品,但类别分布不均可能导致模型偏向高频类别,影响泛化性能。此外,字段中的sender_id、chat_id等涉及用户隐私,需进行去标识化处理,而构建过程中需应对从自由文本到结构化映射的复杂性,包括技术规格的细粒度拆分与图像链接的有效性验证。这些挑战要求后续研究在数据清洗、鲁棒建模及隐私保护机制上持续创新,以充分释放该数据集的价值。
常用场景
经典使用场景
该数据集汇集了从Zalo机器人采集到的商品讯息,涵盖商品名称、描述、价格、类别、技术规格以及对话上下文等多维字段,为电子商务领域的研究提供了丰富而细腻的语料基础。其典型应用场景在于商品信息的结构化解析与语义挖掘,研究者可基于此开展商品分类、属性抽取、价格预测及描述生成等任务,亦可结合消息文本与图像链接进行多模态信息融合探索。凭借其真实交互数据的独特性,该数据集成为构建和评估电商智能客服、商品推荐系统及对话式购物助手的理想基准。
解决学术问题
该数据集有效回应了低资源环境下电商信息稀疏的学术难题,尤其是针对越南语商品数据稀缺的现状,提供了大规模、真实场景的语料支撑。它解决了商品实体识别、类别层次分类及技术规格标准化等核心研究问题,为跨语言商品信息处理、多模态对齐及上下文感知的对话理解提供了可靠实验平台。其公开可复现的特性促进了电商NLP领域的实证研究,助力于提升商品检索精度与用户交互体验,对新兴市场电商智能化的学术探索具有深远意义。
衍生相关工作
该数据集的发布催生了一系列富有成效的衍生研究,包括基于预训练语言模型的商品信息抽取系统、融合视觉与文本特征的跨模态检索框架,以及面向越南语电商领域的领域适配词向量与语言模型。后续工作亦探索了利用对话上下文增强商品推荐的可解释性,并构建了针对嘈杂短文本的鲁棒分类算法。该数据集还常被用于评测生成式模型在商品描述改写与摘要方面的性能,推动了电商NLP技术在越南语场景下的迭代与创新,成为相关学术社区共享的宝贵资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务