遇见数据集

nightingal3/fig-qa

收藏
Hugging Face2023-06-10 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - expert-generated - crowdsourced language_creators: - crowdsourced language: - en license: - mit multilinguality: - monolingual pretty_name: Fig-QA size_categories: - 10K<n<100K source_datasets: - original task_categories: - multiple-choice task_ids: - multiple-choice-qa --- # Dataset Card for Fig-QA ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Splits](#data-splits) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Discussion of Biases](#discussion-of-biases) - [Additional Information](#additional-information) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) ## Dataset Description - **Repository:** https://github.com/nightingal3/Fig-QA - **Paper:** https://arxiv.org/abs/2204.12632 - **Leaderboard:** https://explainaboard.inspiredco.ai/leaderboards?dataset=fig_qa - **Point of Contact:** emmy@cmu.edu ### Dataset Summary This is the dataset for the paper [Testing the Ability of Language Models to Interpret Figurative Language](https://arxiv.org/abs/2204.12632). Fig-QA consists of 10256 examples of human-written creative metaphors that are paired as a Winograd schema. It can be used to evaluate the commonsense reasoning of models. The metaphors themselves can also be used as training data for other tasks, such as metaphor detection or generation. ### Supported Tasks and Leaderboards You can evaluate your models on the test set by submitting to the [leaderboard](https://explainaboard.inspiredco.ai/leaderboards?dataset=fig_qa) on Explainaboard. Click on "New" and select `qa-multiple-choice` for the task field. Select `accuracy` for the metric. You should upload results in the form of a system output file in JSON or JSONL format. ### Languages This is the English version. Multilingual version can be found [here](https://huggingface.co/datasets/cmu-lti/multi-figqa). ### Data Splits Train-{S, M(no suffix), XL}: different training set sizes Dev Test (labels not provided for test set) ## Considerations for Using the Data ### Discussion of Biases These metaphors are human-generated and may contain insults or other explicit content. Authors of the paper manually removed offensive content, but users should keep in mind that some potentially offensive content may remain in the dataset. ## Additional Information ### Licensing Information MIT License ### Citation Information If you found the dataset useful, please cite this paper: @misc{https://doi.org/10.48550/arxiv.2204.12632, doi = {10.48550/ARXIV.2204.12632}, url = {https://arxiv.org/abs/2204.12632}, author = {Liu, Emmy and Cui, Chen and Zheng, Kenneth and Neubig, Graham}, keywords = {Computation and Language (cs.CL), Artificial Intelligence (cs.AI), FOS: Computer and information sciences, FOS: Computer and information sciences}, title = {Testing the Ability of Language Models to Interpret Figurative Language}, publisher = {arXiv}, year = {2022}, copyright = {Creative Commons Attribution Share Alike 4.0 International} }

annotations_creators: - 专家生成 - 众包 language_creators: - 众包 language: - 英语(en) license: - MIT许可证 multilinguality: - 单语言 pretty_name: Fig-QA size_categories: - 10K<n<100K source_datasets: - 原创数据集 task_categories: - 多项选择 task_ids: - 多项选择问答 # Fig-QA 数据集卡片 ## 目录 - [目录](#目录) - [数据集描述](#数据集描述) - [数据集概述](#数据集概述) - [支持任务与评测榜单](#支持任务与评测榜单) - [语言说明](#语言说明) - [数据集结构](#数据集结构) - [数据划分](#数据划分) - [数据集使用注意事项](#数据集使用注意事项) - [偏见讨论](#偏见讨论) - [附加信息](#附加信息) - [许可证信息](#许可证信息) - [引用信息](#引用信息) ## 数据集描述 - **代码仓库**:https://github.com/nightingal3/Fig-QA - **相关论文**:https://arxiv.org/abs/2204.12632 - **评测榜单**:https://explainaboard.inspiredco.ai/leaderboards?dataset=fig_qa - **联系人**:emmy@cmu.edu ### 数据集概述 本数据集对应论文《Testing the Ability of Language Models to Interpret Figurative Language》(测试大语言模型(Large Language Model)解读比喻性语言的能力)。Fig-QA 包含10256条由人类创作的创意隐喻样本,这些样本以威诺格拉德模式(Winograd schema)的形式成对出现。该数据集可用于评估模型的常识推理能力,其中的隐喻样本也可作为训练数据,用于隐喻检测或隐喻生成等其他任务。 ### 支持任务与评测榜单 你可通过向Explainaboard的[评测榜单](https://explainaboard.inspiredco.ai/leaderboards?dataset=fig_qa)提交结果,在测试集上评估你的模型。点击"New"并选择`qa-multiple-choice`作为任务字段,选择`accuracy`作为评估指标。你需以JSON或JSONL格式的系统输出文件形式上传评估结果。 ### 语言说明 本数据集为英文版本。多语言版本可参见[此处](https://huggingface.co/datasets/cmu-lti/multi-figqa)。 ### 数据划分 训练集-{S, M(无后缀), XL}:不同规模的训练子集 开发集(Dev) 测试集(Test,测试集不提供标签) ## 数据集使用注意事项 ### 偏见讨论 本数据集的隐喻均由人类创作,可能包含侮辱性或其他显性不当内容。论文作者已手动移除冒犯性内容,但用户仍需注意,数据集中仍可能残留潜在的冒犯性内容。 ## 附加信息 ### 许可证信息 MIT 许可证 ### 引用信息 若你认为本数据集对你的研究有所帮助,请引用如下论文: bibtex @misc{https://doi.org/10.48550/arxiv.2204.12632, doi = {10.48550/ARXIV.2204.12632}, url = {https://arxiv.org/abs/2204.12632}, author = {Liu, Emmy and Cui, Chen and Zheng, Kenneth and Neubig, Graham}, keywords = {Computation and Language (cs.CL), 人工智能 (cs.AI), FOS: 计算机与信息科学, FOS: Computer and information sciences}, title = {Testing the Ability of Language Models to Interpret Figurative Language}, publisher = {arXiv}, year = {2022}, copyright = {Creative Commons Attribution Share Alike 4.0 International} }

提供机构:
nightingal3
原始信息汇总

数据集概述

数据集名称

  • 名称: Fig-QA

数据集基本信息

  • 语言: 英语 (en)
  • 许可证: MIT License
  • 多语言性: 单语种
  • 大小: 10K<n<100K
  • 来源: 原始数据
  • 任务类别: 多项选择
  • 任务ID: 多项选择问答 (multiple-choice-qa)

数据集描述

  • 概述: Fig-QA包含10256个人类编写的创意隐喻示例,这些示例作为Winograd模式配对,用于评估模型的常识推理能力。这些隐喻也可用于其他任务,如隐喻检测或生成。
  • 支持的任务和排行榜: 可通过提交模型到Explainaboard的排行榜来评估模型在测试集上的表现。

数据集结构

  • 数据分割: 训练集(不同大小)、开发集、测试集(测试集标签未提供)

使用数据的考虑

  • 偏见讨论: 数据集中的隐喻由人类生成,可能包含侮辱或其他明确内容。虽然论文作者手动移除了攻击性内容,但用户应注意可能仍存在潜在的攻击性内容。

附加信息

  • 许可证信息: MIT License
  • 引用信息: 如果发现数据集有用,请引用相关论文。
搜集汇总
数据集介绍
nightingal3/fig-qa 数据集图片
构建方式
Fig-QA数据集由卡内基梅隆大学研究团队构建,旨在评估语言模型对修辞性语言的理解能力。该数据集包含10,256个人工撰写的创造性隐喻样本,每个样本以Winograd模式配对,形成多项选择题形式。数据集的构建结合了专家生成与众包标注,确保隐喻的多样性与自然性。训练集按规模分为S、M(无后缀)、XL三个版本,另设开发集与测试集,其中测试集未提供标签以支持公平评估。
特点
Fig-QA的核心特点在于其聚焦于修辞性语言理解这一挑战性任务,通过精心设计的隐喻对评估模型的常识推理能力。数据集中的隐喻均为人类创作,涵盖丰富的语义场景,且经人工过滤以去除明显冒犯性内容。其Winograd模式设计巧妙,要求模型在细微语境差异中做出正确选择,从而暴露语言模型在非字面意义理解上的局限性。此外,数据集支持多项任务,除问答评估外,还可用于隐喻检测或生成模型的训练。
使用方法
研究者可通过HuggingFace平台直接加载Fig-QA数据集,并使用其预定义的多项选择问答格式进行模型评估。推荐将模型输出提交至Explainaboard排行榜,选择'qa-multiple-choice'任务与'accuracy'指标,以JSON或JSONL格式上传结果。数据集采用MIT开源协议,允许广泛使用。引用时需注明论文《Testing the Ability of Language Models to Interpret Figurative Language》,以确保学术溯源。
背景与挑战
背景概述
在自然语言处理领域,对隐喻、讽刺等修辞性语言的语义理解长期被视为衡量模型常识推理能力的重要标尺。2022年,由卡内基梅隆大学研究人员Emmy Liu、Cui Chen、Kenneth Zheng与Graham Neubig共同创建的Fig-QA数据集应运而生,旨在系统评估语言模型对创造性隐喻的解读能力。该数据集包含10256条人工撰写的Winograd模式隐喻对,每个样本通过二选一的选择题形式考察模型从上下文推断隐含指代关系的本领。作为首个专注于比喻性语言理解的大规模基准,Fig-QA填补了传统常识推理数据集在修辞现象覆盖上的空白,其发布推动了学界对预训练语言模型在非字面语义处理中脆弱性的关注,并催生了后续多语言扩展版本Multi-FigQA。
当前挑战
Fig-QA所面临的挑战首先根植于比喻性语言理解的本质困境:隐喻的解读高度依赖文化背景与创造性联想,而现有模型常将字面含义与修辞意图混淆,导致在Winograd模式测试中表现逊于人类基线。在数据集构建层面,挑战体现为三重:其一,需确保隐喻对在语义反转后仍保持自然性与歧义性,这对编者的语言学素养提出严苛要求;其二,人工标注过程虽经恶意内容过滤,但潜在的社会偏见仍可能通过隐喻载体(如动物或职业类比)渗透至样本中;其三,作为单语资源,其评估结果难以直接迁移至多语言场景,尽管后续多语言版本已尝试缓解该局限,但跨语言隐喻映射的覆盖度仍受限于文化特异性表达。
常用场景
经典使用场景
Fig-QA数据集的核心应用场景在于评估和提升语言模型对修辞性语言的理解能力,尤其是对创造性隐喻的常识推理。该数据集包含10256个人工撰写的Winograd模式隐喻对,通过多选问答形式,迫使模型在歧义消解中捕捉语义隐含的比喻关系。这一设计直击当前自然语言处理系统在非字面意义理解上的薄弱环节,为检验模型从上下文推断隐喻意图、区分字面与比喻义提供了标准化测试基准。研究者常将其作为评估大语言模型在抽象推理与语用理解维度上的关键指标。
实际应用
在实际应用中,Fig-QA所驱动的隐喻理解能力可广泛赋能于人机交互、创意内容生成与教育技术等领域。例如,智能写作助手能借助此类模型识别用户修辞意图,提供更精准的润色建议;对话系统可更自然地处理诗歌、广告或社交媒体中隐喻丰富的表达,提升交互的亲和力与深度。此外,在语言教学场景中,该数据集可作为评估非母语学习者隐喻理解水平的辅助工具,或用于开发针对修辞敏感性的自适应练习系统,从而促进语言认知能力的培养。
衍生相关工作
Fig-QA的发布催生了多项相关研究工作,其中最具代表性的是其多语言扩展版本Multi-FigQA,该工作将评估框架拓展至中文、西班牙语等语言,检验跨文化隐喻理解的普适性。此外,研究者基于该数据集探索了提示工程与对比学习对隐喻推理的增强效果,部分工作将其与常识知识图谱结合以提升模型对隐含语义的捕获能力。在可解释性领域,Fig-QA也被用作分析Transformer注意力分布与隐喻成分对应关系的探针,为理解神经网络处理修辞语言的内部机制提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务