遇见数据集

女士上衣电商评论属性标签提取训练数据

收藏
浙江省数据知识产权登记平台2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

本数据面向女士上衣电商评论的细粒度属性标签自动提取需求,构建可用于训练属性级标签提取模型的标注数据集,使模型能够从消费者评论片段中自动提取具体产品属性评价标签(共122种),覆盖物流、面料、做工、颜色、服务、版型、价格共7个属性维度,并判定每个标签的情感极性。可用于产品质量监控与改进方向定位等场景,解决评论信息碎片化、难以自动提炼为可量化产品洞察的问题,为服装行业企业及合作方提供结构化的NLP训练数据支撑。一、加工前的数据说明:原始数据来源于企业自有电商平台商品评价区的消费者评论文本,涵盖女士上衣各品类商品的用户评价内容。 二、处理规则: 1.评论采集与清洗:采集企业自有电商平台的消费者评论文本,进行去重、去除特殊符号与无意义字符等清洗处理,并去除评论中包含的消费者昵称、订单号等个人信息,仅保留评价内容本身,保障不可逆向还原原始消费者身份。对每条评论生成唯一评论ID,一条评论可包含多个属性片段。 2.评论片段拆分与属性维度体系构建:将每条评论按语义拆分为独立的评价片段,每个片段对应一个具体属性评价。基于电商评论语义特征与行业经验归纳,建立7个标签属性维度——物流、面料、做工、颜色、服务、版型、价格,用于归类每个提取标签所属的产品属性方面。 3.人工标签提取与标注:组织多名标注员对每个评论片段进行标签提取,标注内容包括:提取标签(从片段中归纳的属性评价关键词,共122种)、标签属性维度、标签情感极性(正面、中性、负面共3类)、提取置信度(标注员对该标签提取准确性的自评信度,数值越高表示越确信提取准确)。 4.记录编码化处理:对每条记录生成无规则编码化的唯一标识,保障数据记录的唯一性与可追溯性。 三、数据内容描述:最终形成结构化的女士上衣电商评论属性标签提取训练数据集合,包含以下字段:1)评论ID:原始评论的唯一编号,一条评论可对应多条标签记录;2)原始评论片段:经清洗与脱敏后的消费者评价片段文本;3)提取标签:从评论片段中归纳提取的属性评价关键词,共122种;4)标签属性维度:提取标签所属的产品属性方面,分为物流、面料、做工、颜色、服务、版型、价格共7类;5)标签情感极性:提取标签的情感方向,分为正面、中性、负面共3类;6)提取置信度:标注员对标签提取准确性的自评信度值;7)标注人员编号:标注人员的匿名编号;8)标注时间:标注完成的日期;9)记录唯一标识:每条数据记录的唯一编码。该数据集构成一套涵盖细粒度属性标签、属性维度、情感极性与置信度的女士上衣评论属性标签提取训练数据库,可直接用于属性级情感分析与标签提取模型的训练与评估。

创建时间:
2026-07-05
搜集汇总
数据集介绍
女士上衣电商评论属性标签提取训练数据 数据集图片
背景与挑战
背景概述
该数据集为女士上衣电商评论的细粒度属性标签提取训练数据,包含2402条记录,涵盖物流、面料、做工、颜色、服务、版型、价格7个属性维度,共122种属性标签,并标注了每条标签的情感极性(正面、中性、负面)和提取置信度。数据来源于企业自有电商平台的消费者评论,经过清洗、脱敏和人工标注,形成结构化数据,可直接用于属性级情感分析与标签提取模型的训练和评估,适用于产品质量监控与改进方向定位等场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务