遇见数据集

Pirá

收藏
arXiv2022-02-05 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

Pirá数据集是由圣保罗大学创建的一个双语(葡萄牙语-英语)问题回答数据集,专注于海洋和巴西海岸。该数据集包含2261个经过精心策划的问题/答案(QA)集,涵盖4074个文本,内容涉及海洋数据、生物多样性和气候变化。数据集的创建过程涉及收集两个不同的语料库:与巴西海岸相关的科学论文摘要和联合国关于海洋的报告摘录,由254名志愿者手动生成QA集。Pirá数据集旨在支持自然语言处理中的多项任务,如问题回答、信息检索和机器翻译,特别适用于研究双语对话代理面临的挑战。

The Pirá Dataset is a bilingual (Portuguese-English) question answering dataset focused on marine and Brazilian coastal topics, created by the University of São Paulo. It contains 2,261 meticulously curated question-answering (QA) pairs derived from 4,074 texts covering themes including marine data, biodiversity, and climate change. The development of the Pirá Dataset involved compiling two distinct corpora: abstracts of scientific papers related to the Brazilian coast, and excerpts from United Nations reports on marine affairs, with 254 volunteers manually generating all the QA pairs. This dataset is designed to support a range of natural language processing (NLP) tasks, including question answering, information retrieval, and machine translation, and is particularly suited for researching the challenges faced by bilingual dialogue AI agents.

提供机构:
圣保罗大学
创建时间:
2022-02-05
搜集汇总
数据集介绍
Pirá 数据集图片
构建方式
Pirá数据集的构建依托于海洋科学与巴西沿海生态这一专业领域,由254名本科生、研究生及研究人员共同参与。语料来源包括两个部分:其一为来自Scopus数据库的3891篇关于巴西沿海的科学论文摘要,其二为联合国《世界海洋评估》报告中的183段文本节选。志愿者以这些文本为基础,手动生成双语问答对,每套问答包含葡萄牙语和英语的问题与答案。生成过程分为两个阶段:首先,志愿者依据文本创建问答对,并借助自动翻译工具进行初步翻译后人工校对;其次,由另一组志愿者对问答对进行同行评审,评估其合理性、可回答性,并对问题加以改写,以降低词汇重叠带来的模型偏见。最终,经过语法修正与质量筛选,数据集共收录2261套经人工验证的高质量问答对。
特点
Pirá数据集的核心特点在于其双语性与领域专精性。作为首个包含葡萄牙语支撑文本的问答数据集,它同时提供英语版本,填补了低资源语言在海洋科学领域的空白。数据集涵盖气候变迁、海洋生物多样性及巴西沿海生态等复杂主题,问题类型以“是什么”为主(62.1%),兼具“如何”、“为何”等多样性。此外,数据集包含三种版本:Pirá-F过滤版仅保留有意义且可回答的问答对;Pirá-T触发版引入不可回答问题,以支持答案触发机制的研究;Pirá-C完整版则保留所有原始数据。特别地,通过志愿者对问题的重写,数据集有效缓解了问答与文本间的词汇共现偏差,提升了模型的泛化挑战性。
使用方法
Pirá数据集适用于多项自然语言处理任务,尤其聚焦于跨语言场景。在信息检索任务中,研究者可利用该数据集训练神经检索模型,以葡萄牙语或英语问题为查询,定位包含答案的文本段落。在阅读理解任务中,数据集既支持生成式问答(端到端答案生成),也支持抽取式问答(定位文本跨度),尽管其答案并非严格为文本片段。此外,Pirá-T版本特别适合答案触发机制的研究,要求模型判断问题是否可回答。数据集还可用于机器翻译微调,以及基于语料标签的分类任务。研究者可根据需求选择Pirá-F、Pirá-T或Pirá-C版本,以适配不同的实验设计与评估目标。
背景与挑战
背景概述
在自然语言处理领域,高质量的问答数据集是推动模型性能提升的关键资源,然而现有资源多集中于英语,少数覆盖汉语、法语等语言,而葡萄牙语等语言仍面临严重匮乏。2021年,由圣保罗大学的研究团队(包括André Paschoal、Paulo Pirozelli等)创建的Pirá数据集应运而生,旨在填补这一空白。该数据集聚焦于海洋与巴西海岸的科学知识,包含2261组精心构建的双语(葡萄牙语-英语)问答对,基于学术摘要和联合国报告文本手工生成,并经过同行评审验证。作为首个支持葡萄牙语的问答数据集,Pirá不仅为双语问答系统提供了训练基准,还推动了海洋科学、气候变化与生物多样性等领域的跨语言研究,对低资源语言的自然语言处理具有里程碑式的影响力。
当前挑战
Pirá数据集所解决的领域问题核心在于双语问答的跨语言语义对齐与科学知识的复杂推理。具体挑战包括:其一,海洋科学文本的专业性导致问答对需兼顾术语准确性(如“blocky effect”的翻译)与可读性,而葡萄牙语与英语在语法结构(如性别一致性)和复合词表达上的差异加剧了翻译难度。其二,构建过程中面临方法标准化不足的困境:尽管制定了详细指南,志愿者在答案长度、问题类型(如避免“是/否”问题)及上下文泛化性上仍存在显著差异,部分问题因缺乏时间框架或依赖动态数据(如石油井数量)而难以更新。此外,评估阶段发现,基于词匹配的模型易受标注偏差影响,需通过人工改写与等价性判断来缓解,但人工与自动语义相似度评估的偏差(如长短答案、逻辑推理差异)仍构成持续挑战。
常用场景
经典使用场景
Pirá数据集的核心应用场景聚焦于双语言阅读理解与信息检索任务。作为首个包含葡萄牙语支撑文本的问答数据集,它特别适用于构建跨语言对话系统,研究者可利用其双语对齐的问答对,训练模型在英语文档中检索信息并生成葡萄牙语答案,从而模拟真实世界中非英语用户依赖英语资源获取知识的典型困境。该数据集还支持生成式问答与抽取式问答两种范式,前者通过端到端模型从语料中提炼答案,后者则聚焦于文本跨度定位,为评估模型在科学文献语境下的语义理解能力提供了独特基准。
衍生相关工作
Pirá数据集催生了多项衍生研究,包括基于Sentence-BERT的语义等价性评估方法,通过对比人工判断与嵌入模型在答案相似性上的差异,揭示了开放答案中长句与短句、词汇多样性及逻辑推理等因素对语义匹配的影响。此外,研究者利用该数据集探索了双语言检索增强生成(RAG)框架,验证了在不同语言输入输出组合下(如葡萄牙语查询、英语文档)的问答性能。其不可回答问题版本Pirá-T还启发了关于答案触发机制的后续工作,推动了模型在不确定性情境下的决策能力研究。
数据集最近研究
最新研究方向
Pirá数据集的最新研究方向聚焦于构建面向海洋科学与气候变化的双语问答资源,填补葡萄牙语在自然语言处理领域的高质量语料空白。该数据集以巴西海岸与全球海洋生态为知识域,通过人工构建的双语问答对、不可回答问题及同义改写策略,推动跨语言阅读理解与信息检索的前沿探索。其研究意义在于:一方面,它首次为葡萄牙语提供了经过同行评审的问答基准,支撑海洋生物多样性、气候变化等热点议题的AI应用;另一方面,通过设计双语等价性评估与答案触发机制,为多语言模型的语义对齐与鲁棒性研究提供了独特实验平台,呼应了联合国可持续发展目标中对海洋保护的迫切需求。
相关研究论文
  • 1
    Pirá: A Bilingual Portuguese-English Dataset for Question-Answering about the Ocean圣保罗大学 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务