女士上衣电商评论属性标签提取训练数据
收藏资源简介:
本数据面向女士上衣电商评论的细粒度属性标签自动提取需求,构建可用于训练属性级标签提取模型的标注数据集,使模型能够从消费者评论片段中自动提取具体产品属性评价标签(共122种),覆盖物流、面料、做工、颜色、服务、版型、价格共7个属性维度,并判定每个标签的情感极性。可用于产品质量监控与改进方向定位等场景,解决评论信息碎片化、难以自动提炼为可量化产品洞察的问题,为服装行业企业及合作方提供结构化的NLP训练数据支撑。一、加工前的数据说明:原始数据来源于企业自有电商平台商品评价区的消费者评论文本,涵盖女士上衣各品类商品的用户评价内容。 二、处理规则: 1.评论采集与清洗:采集企业自有电商平台的消费者评论文本,进行去重、去除特殊符号与无意义字符等清洗处理,并去除评论中包含的消费者昵称、订单号等个人信息,仅保留评价内容本身,保障不可逆向还原原始消费者身份。对每条评论生成唯一评论ID,一条评论可包含多个属性片段。 2.评论片段拆分与属性维度体系构建:将每条评论按语义拆分为独立的评价片段,每个片段对应一个具体属性评价。基于电商评论语义特征与行业经验归纳,建立7个标签属性维度——物流、面料、做工、颜色、服务、版型、价格,用于归类每个提取标签所属的产品属性方面。 3.人工标签提取与标注:组织多名标注员对每个评论片段进行标签提取,标注内容包括:提取标签(从片段中归纳的属性评价关键词,共122种)、标签属性维度、标签情感极性(正面、中性、负面共3类)、提取置信度(标注员对该标签提取准确性的自评信度,数值越高表示越确信提取准确)。 4.记录编码化处理:对每条记录生成无规则编码化的唯一标识,保障数据记录的唯一性与可追溯性。 三、数据内容描述:最终形成结构化的女士上衣电商评论属性标签提取训练数据集合,包含以下字段:1)评论ID:原始评论的唯一编号,一条评论可对应多条标签记录;2)原始评论片段:经清洗与脱敏后的消费者评价片段文本;3)提取标签:从评论片段中归纳提取的属性评价关键词,共122种;4)标签属性维度:提取标签所属的产品属性方面,分为物流、面料、做工、颜色、服务、版型、价格共7类;5)标签情感极性:提取标签的情感方向,分为正面、中性、负面共3类;6)提取置信度:标注员对标签提取准确性的自评信度值;7)标注人员编号:标注人员的匿名编号;8)标注时间:标注完成的日期;9)记录唯一标识:每条数据记录的唯一编码。该数据集构成一套涵盖细粒度属性标签、属性维度、情感极性与置信度的女士上衣评论属性标签提取训练数据库,可直接用于属性级情感分析与标签提取模型的训练与评估。




