NEUDM/aste-data-v2
收藏资源简介:
> 上述数据集为ABSA(Aspect-Based Sentiment Analysis)领域数据集,基本形式为从句子中抽取:方面术语、方面类别(术语类别)、术语在上下文中情感极性以及针对该术语的观点词,不同数据集抽取不同的信息,这点在jsonl文件的“instruction”键中有分别提到,在此我将其改造为了生成任务,需要模型按照一定格式生成抽取结果。 #### 以acos数据集中抽取的jsonl文件一条数据举例: ``` { "task_type": "generation", "dataset": "acos", "input": ["the computer has difficulty switching between tablet and computer ."], "output": "[['computer', 'laptop usability', 'negative', 'difficulty']]", "situation": "none", "label": "", "extra": "", "instruction": " Task: Extracting aspect terms and their corresponding aspect categories, sentiment polarities, and opinion words. Input: A sentence Output: A list of 4-tuples, where each tuple contains the extracted aspect term, its aspect category, sentiment polarity, and opinion words (if any). Supplement: \"Null\" means that there is no occurrence in the sentence. Example: Sentence: \"Also it's not a true SSD drive in there but eMMC, which makes a difference.\" Output: [['SSD drive', 'hard_disc operation_performance', 'negative', 'NULL']]' " } ``` > 此处未设置label和extra,在instruction中以如上所示的字符串模板,并给出一个例子进行one-shot,ABSA领域数据集(absa-quad,acos,arts,aste-data-v2,mams,semeval-2014,semeval-2015,semeval-2016,towe)每个数据集对应instruction模板相同,内容有细微不同,且部分数据集存在同一数据集不同数据instruction内容不同的情况。 #### 原始数据集 - 数据[链接](https://github.com/xuuuluuu/Position-Aware-Tagging-for-ASTE) - Paper: [Position-Aware Tagging for Aspect Sentiment Triplet Extraction](https://arxiv.org/abs/2010.02609) - 说明:原始数据集由laptop14、restaurant14、restaurant15以及restaurant16四部分文件组成。 #### 当前SOTA *数据来自[Easy-to-Hard Learning for Information Extraction](https://arxiv.org/abs/2305.09193)* - 评价指标:F1 Score - SOTA模型:E2H-large - 在laptop14数据部分:**75.92** - 在restaurant14数据部分:**65.98** - 在restaurant15数据部分:**68.80** - 在restaurant16数据部分:**75.46** - 平均:**71.54** - Paper:[Easy-to-Hard Learning for Information Extraction](https://arxiv.org/pdf/2305.09193.pdf) - 说明:该论文来自[Google Scholar](https://scholar.google.com/scholar?as_ylo=2023&hl=zh-CN&as_sdt=2005&sciodt=0,5&cites=8596892198266513995&scipsc=)检索到的引用ASTE-data-v2原论文的论文之一,在比较2023年的一些论文工作后筛选了一个最优指标以及模型。
本数据集属于基于方面的情感分析(Aspect-Based Sentiment Analysis,ABSA)领域,其核心任务为从语句中抽取四类信息:方面术语、方面类别(术语所属类别)、术语在上下文语境中的情感极性,以及针对该术语的评价观点词。不同数据集需抽取的信息维度存在差异,相关说明可在jsonl文件的"instruction"字段中查看。本次工作将该类数据集改造为生成式任务,要求模型按照指定格式生成抽取结果。 #### 以acos数据集中抽取的jsonl文件一条数据举例: json { "任务类型": "generation", "数据集名称": "acos", "输入": ["这款电脑在平板与电脑模式间切换存在卡顿。"], "输出": "[['电脑', '笔记本电脑使用性能', '负面', '卡顿']]", "场景": "none", "标签": "", "额外信息": "", "指令说明": " 任务:抽取方面术语及其对应的方面类别、情感极性与观点词。 输入:单句文本 输出:由四元组构成的列表,每个四元组依次包含抽取得到的方面术语、所属方面类别、情感极性以及观点词(若存在)。补充说明:"Null"表示语句中无对应内容。 示例: 语句:"此处搭载的并非真正的固态硬盘(SSD),而是eMMC存储,这会对性能产生影响。" 输出:[['固态硬盘(SSD)', '硬盘运行性能', '负面', 'NULL']] " } 本示例未设置标签与额外信息字段,指令说明采用上述字符串模板,并通过单样本示例(one-shot)进行演示。ABSA领域数据集涵盖absa-quad、acos、arts、aste-data-v2、mams、semeval-2014、semeval-2015、semeval-2016、towe等,各数据集的指令模板框架一致,但细节存在差异;部分数据集甚至存在同数据集内不同样本的指令内容不一致的情况。 #### 原始数据集 - 数据[链接](https://github.com/xuuuluuu/Position-Aware-Tagging-for-ASTE) - 论文: [面向方面情感三元组抽取的位置感知标注](https://arxiv.org/abs/2010.02609) - 说明:原始数据集包含laptop14、restaurant14、restaurant15与restaurant16四个子数据集文件。 #### 当前最优模型(SOTA) *数据来源:[面向信息抽取的从易到难学习](https://arxiv.org/abs/2305.09193)* - 评价指标:F1值 - 当前最优模型:E2H-large - 在laptop14子数据集上:**75.92** - 在restaurant14子数据集上:**65.98** - 在restaurant15子数据集上:**68.80** - 在restaurant16子数据集上:**75.46** - 整体平均性能:**71.54** - 相关论文:[面向信息抽取的从易到难学习](https://arxiv.org/pdf/2305.09193.pdf) - 说明:该论文为通过[Google Scholar](https://scholar.google.com/scholar?as_ylo=2023&hl=zh-CN&as_sdt=2005&sciodt=0,5&cites=8596892198266513995&scipsc=)检索到的引用ASTE-data-v2原论文的文献之一,研究团队在对比2023年以来的多项相关研究工作后,选取了该最优性能指标与对应模型。
数据集概述
数据集类型
- 领域:Aspect-Based Sentiment Analysis (ABSA)
- 任务类型:Generation
数据集内容
- 数据集名称:acos
- 输入格式:句子
- 输出格式:列表,包含四个元素的元组,分别表示提取的方面术语、方面类别、情感极性及观点词。
- 示例:
- 输入:"the computer has difficulty switching between tablet and computer ."
- 输出:"[[computer, laptop usability, negative, difficulty]]"
数据集说明
- 任务描述:从句子中抽取方面术语及其对应的方面类别、情感极性和观点词。
- 输入说明:单个句子。
- 输出说明:一个列表,每个元素为一个四元组,包含方面术语、方面类别、情感极性和观点词(若无观点词,则用"NULL"表示)。
- 示例输出:[[SSD drive, hard_disc operation_performance, negative, NULL]]
原始数据集信息
- 组成:由laptop14、restaurant14、restaurant15及restaurant16四部分文件组成。
- 来源:Position-Aware Tagging for Aspect Sentiment Triplet Extraction
当前SOTA模型
- 模型名称:E2H-large
- 评价指标:F1 Score
- 性能指标:
- laptop14部分:75.92
- restaurant14部分:65.98
- restaurant15部分:68.80
- restaurant16部分:75.46
- 平均:71.54
- 来源论文:Easy-to-Hard Learning for Information Extraction




