女士上衣电商差评归因分类标注数据
收藏资源简介:
本数据面向女士上衣电商差评的原因自动归因与分类需求,构建可用于训练差评归因分类模型的标注数据集,使模型能够自动识别消费者差评的归因类别(尺码偏差、做工、描述不符、面料、色差、服务、物流共7类)、细分原因标签(共28种)及问题严重度(严重、中等、轻微共3级)。可用于差评原因自动溯源与产品质量问题定位等场景,解决差评内容表述多样化、难以自动归类至具体质量问题环节并量化严重程度的问题,为服装行业企业及合作方提供结构化的差评归因训练数据支撑。一、加工前的数据说明:原始数据来源于企业自有电商平台商品评价区的消费者差评文本,涵盖女士上衣各品类商品的负面评价内容。 二、处理规则: 1.差评采集与清洗:采集企业自有电商平台的消费者差评文本,进行去重、去除特殊符号与无意义字符等清洗处理,并去除差评中包含的消费者昵称、订单号等个人信息,仅保留差评内容本身,保障不可逆向还原原始消费者身份。对每条差评生成唯一差评编号。 2.归因分类体系构建:基于电商差评语义特征与行业经验归纳,建立两级分类体系——一级归因类别分为尺码偏差、做工、描述不符、面料、色差、服务、物流共7类,描述差评所涉及的主要问题环节;二级细分原因标签在每个归因类别下进一步细化具体原因(如尺码偏差类下的"偏小""偏大""版型不合"等),共28种细分原因标签。同时建立严重度评估标准,分为严重、中等、轻微共3级,用于量化差评反映的问题严重程度。 3.人工标注:组织多名标注员对每条差评进行标注,标注内容包括:归因类别、细分原因标签、严重度。 4.记录编码化处理:对每条记录生成无规则编码化的唯一标识,保障数据记录的唯一性与可追溯性。 三、数据内容描述:最终形成结构化的女士上衣电商差评归因分类标注数据集合,包含以下字段:1)差评编号:每条差评的唯一顺序编号;2)差评内容:经清洗与脱敏后的消费者差评文本;3)归因类别:人工标注的差评所属问题环节,分为尺码偏差、做工、描述不符、面料、色差、服务、物流共7类,作为模型训练的主监督标签;4)细分原因标签:人工标注的具体原因描述,共28种;5)严重度:人工标注的问题严重程度,分为严重、中等、轻微共3级;6)标注人:标注人员的匿名编号;7)记录唯一标识:每条数据记录的唯一编码;8)数据生成时间:该条记录的生成日期。该数据集构成一套涵盖归因类别、细分原因与严重度的女士上衣差评归因分类训练数据库,可直接用于差评归因分类模型的训练与评估。




