遇见数据集

NOVA-vision-language/calame-pt

收藏
Hugging Face2024-03-14 更新2024-06-15 收录
官方服务:

资源简介:

CALAME-PT是一个葡萄牙语基准测试,由小文本(上下文)及其相应的最后一个单词组成。这些上下文理论上应包含足够的信息,使人类或模型能够猜测其最后一个单词,而不会过于具体或模糊。数据集分为手写集和生成集两部分,手写集包含406个由葡萄牙语母语者手写的样本,生成集包含1670个由GPT-3.5生成并经过人工审查的样本。生成集的样本来自葡萄牙维基百科、OSCAR和Arquivo.pt等数据源,经过GPT-3.5的改写/总结和匿名化处理,并经过人工审查以确保质量。

CALAME-PT is a Portuguese benchmark dataset consisting of short texts (contexts) and their corresponding final words. Theoretically, these contexts contain sufficient information to allow humans or models to guess their final words without being overly specific or ambiguous. The dataset is split into two subsets: a handwritten set and a generated set. The handwritten set includes 406 samples handwritten by native Portuguese speakers. The generated set contains 1,670 samples generated by GPT-3.5 and manually reviewed. Samples in the generated set are sourced from data repositories including Portuguese Wikipedia, OSCAR, and Arquivo.pt, and have undergone rewriting/summarization and anonymization via GPT-3.5, followed by manual review to ensure quality.

提供机构:
NOVA-vision-language
原始信息汇总

CALAME-PT

Context-Aware LAnguage Modeling Evaluation for Portuguese

CALAME-PT 是一个葡萄牙语基准测试,由小段文本(上下文)及其相应的最后一个词组成。这些上下文在理论上应包含足够的信息,使得人类或模型能够猜测其最后一个词,既不过于具体也不过于模糊。

组成

CALAME-PT 由两个“数据集”组成 - 手写和生成。

  • 手写集:包含 406 个由葡萄牙语母语者手写的样本;
  • 生成集:包含 1670 个由 GPT-3.5 生成的样本,随后提交给人审阅。

自动生成

为了生成生成集的样本,从 3 个后处理数据源中随机抽取文档:葡萄牙语维基百科(PTWIKI)、OSCAR 和 Arquivo.pt。这些数据集对应并使用了 GlorIA 中提到的数据集。随后,GPT-3.5 被提示对每个文档进行重写/总结,并执行实体(人、公司等)的匿名化步骤。

然后,生成的样本被提交给人审阅,进行以下操作:1) 删除不良样本 2) 进行一些重写以确保质量和避免删除整个样本 3) 手动执行匿名化步骤。

如何使用

确保您的 Datasets 包已更新! py from datasets import load_dataset

dataset = load_dataset("NOVA-vision-language/calame-pt", "all") dataset_handwritten_only = load_dataset("NOVA-vision-language/calame-pt", "handwritten") dataset_generated_only = load_dataset("NOVA-vision-language/calame-pt", "generated")

搜集汇总
数据集介绍
NOVA-vision-language/calame-pt 数据集图片
构建方式
CALAME-PT是一个专为葡萄牙语设计的上下文感知语言模型评估基准。该数据集由两大子集构成:其一为手写集,包含406条由葡萄牙语母语者精心撰写的样本;其二为生成集,包含1670条经由GPT-3.5自动生成并经过人工审核的样本。生成集的构建过程严谨而系统:首先从葡萄牙语维基百科、OSCAR及Arquivo.pt三个经过后处理的数据源中随机抽取文档,随后利用GPT-3.5对每个文档进行重写、摘要及实体匿名化处理。最后,所有生成样本均提交至人工审核环节,剔除低质样本,手动修正部分内容并完善匿名化步骤,从而确保数据集的高质量与可靠性。
特点
CALAME-PT数据集的核心特点在于其精心设计的上下文与目标词配对结构,每个短文本上下文均蕴含足够信息,使人类或模型能够准确推断出最后一个词,同时避免过度具体或模糊。数据集采用双轨制构成,手写集与生成集互为补充,前者体现自然语言的原始质感,后者则展示了大模型生成能力的潜力。此外,数据集规模适中(1K至10K样本间),适用于零样本评估场景,尤其适合葡萄牙语语言建模任务的性能测试。其MIT开源许可协议进一步降低了使用门槛,促进了葡萄牙语自然语言处理研究的可复现性与可扩展性。
使用方法
使用CALAME-PT数据集需确保已安装并更新Datasets库。用户可通过load_dataset函数灵活加载不同配置,例如调用load_dataset('NOVA-vision-language/calame-pt', 'all')即可获取包含手写集与生成集的完整数据;若需单独使用手写样本,则指定'handwritten'配置;若仅需生成样本,则指定'generated'配置。加载后的数据集可直接用于葡萄牙语语言模型的零样本评估,通过计算模型对上下文最后一个词的预测准确率来衡量其语言理解能力。这一简洁高效的使用方式,使得CALAME-PT成为评估葡萄牙语语言模型性能的有力工具。
背景与挑战
背景概述
在自然语言处理领域,语言模型的评估基准对于衡量模型在特定语言上的理解与生成能力至关重要。CALAME-PT(Context-Aware LAnguage Modeling Evaluation for Portuguese)数据集由NOVA视觉语言实验室于近期创建,旨在为葡萄牙语提供一种细粒度的上下文感知语言建模评估工具。该数据集的核心研究问题聚焦于模型能否从短文本语境中准确推断出最后一个单词,以此检验模型对语境信息的捕捉能力。CALAME-PT包含手工编写与自动生成并经过人工审核的两部分样本,共计超过2000条,其设计借鉴了英语中LAMBADA基准的思路,但专门针对葡萄牙语的语言特性进行优化,为葡萄牙语自然语言处理研究提供了重要的零样本评估资源,对推动该语言领域的模型发展具有显著影响力。
当前挑战
CALAME-PT所解决的领域问题在于,现有语言模型评估基准多集中于英语,缺乏针对葡萄牙语等低资源语言的上下文推理能力评测,导致模型在该语言上的表现难以客观衡量。构建过程中面临的挑战包括:手工编写样本需确保语境信息既足以推断目标词,又不至于过于具体或模糊,这对编写者的语言直觉要求极高;自动生成样本虽借助GPT-3.5从葡萄牙语维基百科、OSCAR和Arquivo.pt等语料中采样并改写,但需处理实体匿名化与文本质量把控的复杂平衡,后续人工审核不仅要剔除低质样本,还需手动修正匿名化遗漏,这一流程耗时且需严格的质量控制,最终保证了数据集的可靠性与语言代表性。
常用场景
经典使用场景
CALAME-PT作为面向葡萄牙语的上下文感知语言模型评估基准,其经典使用场景在于零样本条件下对语言模型的语义理解与推理能力进行测试。该数据集由短文本段落及其末尾词汇构成,要求模型依据前文语境准确预测被遮蔽的最后一个词。这种设计巧妙融合了完形填空与上下文推理的评估范式,特别适用于检验预训练语言模型在葡萄牙语语境下捕捉长距离依赖和消除语义歧义的能力。研究人员常通过计算模型在CALAME-PT上的预测准确率,来横向对比不同架构或训练策略的语言模型在葡萄牙语上的表现差异。
衍生相关工作
CALAME-PT的发布衍生了一系列相关研究工作,最直接的关联是催生了针对葡萄牙语的语言模型对比分析,例如GlorIA系列模型在CALAME-PT上的表现成为评估其上下文建模能力的重要指标。此外,该数据集推动了多语言评估基准的扩展研究,部分工作借鉴其双轨构建方法论,为其他低资源语言开发类似评估集。在方法层面,CALAME-PT的生成样本构建流程——即利用大型语言模型生成后经人工审核——为低成本构建高质量评估数据提供了可复现的范式,影响后续如CALAME-ES等跨语言变体的开发。
数据集最近研究
最新研究方向
CALAME-PT作为葡萄牙语语境感知语言建模评估基准,其前沿研究方向聚焦于零样本场景下语言模型对上下文语义的精准捕捉能力。该数据集通过人工撰写与GPT-3.5生成并经过人工审查的双轨构建策略,为评估模型在低资源语言(葡萄牙语)上的推理表现提供了可靠标尺。当前研究热点包括利用该基准对比不同规模预训练模型(如GlorIA)在歧义消解与常识推断中的性能差异,并结合LAMBADA任务范式探索跨语言迁移学习的有效性。其意义在于推动非英语语言模型评估体系的标准化,尤其为巴西、葡萄牙等葡语国家的自然语言处理应用(如智能助手、文本补全)提供关键验证工具,同时为多语言模型在文化特异性语境下的鲁棒性研究开辟新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务