遇见数据集

INTENTIONQA

收藏
arXiv2024-06-15 更新2024-06-18 收录
官方服务:

资源简介:

INTENTIONQA是由香港科技大学计算机科学与工程系创建的一个多选题问答数据集,专注于评估语言模型在电子商务中理解购买意图的能力。该数据集包含4,360个精心设计的问题,分为三个难度级别,通过自动化流程构建,确保在大规模电子商务平台上的可扩展性。数据集通过将人类注释的意图从FolkScope转换为问题,利用ASER事件知识图谱进行自动干扰项采样,以提高数据集质量。INTENTIONQA的应用领域主要集中在改进电子商务搜索服务,通过增强语言模型对购买意图的理解和利用,提升产品推荐等下游任务的效果。

INTENTIONQA is a multiple-choice question answering (QA) dataset developed by the Department of Computer Science and Engineering at the Hong Kong University of Science and Technology, focusing on evaluating language models' capability to comprehend purchase intentions in the e-commerce domain. This dataset contains 4,360 carefully designed questions categorized into three difficulty levels, and is constructed via an automated pipeline to ensure scalability across large-scale e-commerce platforms. Specifically, it converts human-annotated purchase intentions from FolkScope into question structures, and leverages the ASER event knowledge graph for automatic distractor sampling to enhance the dataset's quality. The main application scenarios of INTENTIONQA center on improving e-commerce search services, by strengthening language models' understanding of purchase intentions and utilizing such capabilities to elevate the performance of downstream tasks such as product recommendation.

创建时间:
2024-06-15
搜集汇总
数据集介绍
INTENTIONQA 数据集图片
构建方式
INTENTIONQA的构建基于FolkScope意图知识库,从中筛选出典型性评分高于0.5的共购产品与意图断言。通过自动流水线,将每条断言转化为双任务多项选择题:任务一掩码意图作为正确答案,任务二掩码其中一个产品作为正确答案。利用ASER事件知识图谱计算产品与意图的上下文嵌入相似度,据此采样三个负干扰项,并依据共购产品相似度将问题划分为易、中、难三个难度等级。所有步骤无需人工标注,保证了可扩展性。
特点
该数据集包含4360道精心设计的多项选择题,覆盖意图理解与意图利用两个互补任务,支持对语言模型在电商场景中购买意图理解能力的细粒度评估。每个问题配备三个经过严格相似度筛选的负干扰项,有效降低假阴性率。难度分级基于产品间语义相似度,使得模型在简单、中等和困难子集上的表现差异能够揭示其推理能力的局限性。人工评估验证了数据的高正确率和低假阴性率。
使用方法
INTENTIONQA以多项选择问答形式呈现,适用于零样本、思维链及自一致性等多种评估范式。用户可直接加载问题与选项,通过计算模型预测与正确答案的匹配率来评估意图理解与利用能力。数据集已公开,支持对19种不同规模和类型的语言模型进行基准测试,并可用于微调实验,例如结合MIND等外部意图知识库进行指令微调以提升模型性能。
背景与挑战
背景概述
INTENTIONQA是由香港科技大学计算机科学与工程系的研究团队于2024年创建的双任务多项选择问答基准数据集,旨在评估语言模型在电子商务场景中对购买意图的理解能力。该数据集的核心研究问题在于,尽管语言模型已被广泛用于意图知识蒸馏,但其对真实世界中用户中心意图的深层理解仍存在显著不足。通过构建包含4360个精心设计的问题,覆盖三个难度级别,INTENTIONQA为衡量语言模型在意图推断与利用方面的表现提供了标准化评估框架。其影响力在于揭示了现有模型在电子商务意图理解任务中的局限性,并为未来构建更具意图感知能力的电商服务奠定了重要基础。
当前挑战
INTENTIONQA所面临的挑战首先体现在领域问题层面:语言模型难以准确理解产品与意图之间的复杂关联,尤其是在需要联合推理多个产品与潜在意图的场景中,其表现远落后于人类水平。其次,在数据集构建过程中,挑战包括如何从大规模电子商务平台中自动生成高质量、低假阴性率的问答对,这要求设计有效的产品与意图相似性度量方法,并借助事件知识图谱进行上下文增强。此外,还需克服语言模型在开放生成任务中评估不一致的问题,通过多项选择形式确保评估的稳定性和可重复性,同时保持数据集的扩展性和成本效益。
常用场景
经典使用场景
INTENTIONQA作为一项双重任务多项选择问答基准,被广泛用于评估语言模型在电子商务场景下对购买意图的理解能力。其经典使用场景涵盖两个核心任务:一是意图理解(IntentUnderstand),即根据用户已购商品推断其潜在购买意图;二是意图利用(IntentUtilize),即基于用户意图预测其可能追加购买的商品。该数据集通过精心设计的4360道题目,覆盖简单、中等、困难三个难度层级,为细粒度评估模型在不同推理复杂度下的表现提供了标准化平台。
实际应用
在实际应用中,INTENTIONQA为电子商务平台优化智能推荐系统、客服对话机器人及查询理解服务提供了关键支撑。通过评估模型对购买意图的推理能力,该数据集可助力开发更精准的个性化推荐算法,例如在用户购买耳机后预测其可能追加购买耳垫或音频升级线。同时,其自动构建流程可扩展至大规模商品数据库,为电商平台实现意图感知的搜索服务与动态商品推荐奠定了技术基础,显著提升了用户体验与商业转化效率。
衍生相关工作
INTENTIONQA的提出催生了一系列衍生研究工作,包括利用外部意图知识库如MIND进行微调以提升模型性能的探索,以及基于ConceptNet关系类型的细粒度意图分析。实验表明,经过意图知识微调的Mistral-7B模型在意图理解任务上可接近GPT-4水平,但意图利用任务仍具挑战性。此外,该数据集还促进了结合常识知识注入的模型(如CAR、CANDLE)在电子商务领域的迁移应用,推动了小参数模型在意图理解上媲美大规模语言模型的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务