maritaca-ai/poscomp
收藏官方服务:
资源简介:
该数据集包含2022年和2023年POSCOMP考试的题目。POSCOMP(巴西计算机研究生入学国家考试)是巴西计算机学会管理的计算机研究生入学国家考试。数据集包含140个葡萄牙语多项选择题,涵盖数学、计算机基础和技术。该数据集作为PoETa v2的一部分发布。
Questions from the POSCOMP exams of 2022 and 2023. POSCOMP (Exame Nacional para Ingresso na Pós-Graduação em Computação) is the Brazilian national exam for admission to graduate programs in Computing, administered by the Sociedade Brasileira de Computação (SBC). The dataset contains 140 multiple-choice questions in Portuguese covering mathematics, computer fundamentals, and computer technology. This dataset was released as part of PoETa v2.
提供机构:
maritaca-ai搜集汇总
数据集介绍

构建方式
POSCOMP数据集源自巴西计算机学会(SBC)主办的全国性研究生入学考试——POSCOMP,涵盖2022与2023两个年度的试题。该数据集由研究者从原始试卷中系统化抽取,共计140道多项选择题,每道题目均包含完整的问题文本、五个选项(A至E)、标准答案以及唯一标识符(如POSCOMP_2023_56)。此外,每条数据还附带了题目在试卷中的编号、是否存在关联图像、图像数据及其类型标签。为了便于下游任务使用,数据被统一整理为单一阵列形式,并公开在HuggingFace平台,遵循CC-BY-4.0许可协议。
使用方法
利用该数据集极为简便,用户可通过HuggingFace的datasets库以一行代码直接加载:`load_dataset("maritaca-ai/poscomp", split="train")`。加载后的每个样本均为字典格式,包含问题、选项、答案、学科标签及推理类型等字段,用户可根据需要提取特定字段进行模型预测或评估。数据集专为葡萄牙语环境下的多项选择问答任务设计,适用于训练、验证或作为基准测试集。引用时建议参考PoETa v2相关论文,以确保学术规范性。
背景与挑战
背景概述
POSCOMP数据集由巴西计算机学会(SBC)于2022年至2023年期间创建,主要研究人员来自Maritaca AI团队,作为PoETa v2基准测试的一部分发布。该数据集聚焦于巴西全国计算机研究生入学考试(POSCOMP)中的多项选择题,涵盖数学、计算机基础及计算机技术三大核心领域,共包含140道葡萄牙语题目。其核心研究问题在于评估大语言模型在葡萄牙语语境下对计算机科学知识的理解与推理能力,尤其强调对图像理解、数学推理和复杂推理的检测。该数据集的发布填补了葡萄牙语计算机科学评估资源的空白,对推动多语言自然语言处理研究具有重要影响力。
当前挑战
POSCOMP数据集所解决的领域问题包括:1)大语言模型在葡萄牙语专业领域知识评估中的不足,尤其是计算机科学类题目的梯度化测试;2)模型对多模态信息(如图像)的理解能力不足,需通过元标签(如IU、MR、CR)区分推理层次。构建过程中面临的挑战有:1)从历年考试中筛选并标准化140道高质量题目,需确保题目领域分布均衡且无冗余;2)手动标注图像关联性、推理类型等元信息,需耗费大量人力与专业知识;3)处理葡萄牙语特有的术语表述与学科交叉问题,避免因语言歧义导致评估偏差。
常用场景
经典使用场景
poscomp数据集汇聚了巴西国家计算研究生入学考试(POSCOMP)2022至2023年间的140道多项选择题,专为评估葡萄牙语环境下大语言模型的计算学科综合能力而设计。其经典使用场景在于衡量模型在数学、计算机基础与计算机技术三大核心领域的掌握程度,尤其关注模型对包含图像、数学推理及复杂推理的题目的作答表现。该数据集以多项选择形式呈现,每道题配备五个备选答案,并附有科目标签与认知难度标记,成为检验模型在限定葡萄牙语计算知识体系下深度理解与推理能力的标杆性评测基准。
解决学术问题
在学术研究中,poscomp数据集旨在填补葡萄牙语计算领域大语言模型系统性评测的空白,解决了现有基准多聚焦英语或通用知识而忽视专业学科语境与语言特异性的问题。它促使研究者关注模型在数学运算、计算机体系结构原理及技术应用等细分课题上的能力边界,尤其通过区分图像理解、数学推理与复杂推理三种认知层次,精准定位模型在逻辑推导与多模态信息整合中的薄弱环节。该数据集的意义在于为跨语言自然语言处理研究提供了可复现的量化基准,推动葡萄牙语AI系统的学术评估从泛化任务走向专业化、结构化的深度分析。
实际应用
在实际应用中,poscomp数据集可作为高等教育机构筛选与优化葡萄牙语AI助教系统的关键测试工具,帮助验证辅导机器人或智能答疑平台在计算学科知识点上的应答准确率。企业和研究团队可利用该数据集评估面向巴西市场的教育科技产品(如自适应学习系统与自动评分引擎)在数学和计算机题目上的表现,从而迭代模型参数以提升对专业术语与推理链条的掌握。此外,它还能服务于计算机科学入学考试的自动化模拟与难度分析,为教学资源开发提供数据驱动的洞察。
数据集最近研究
最新研究方向
poscomp数据集聚焦于巴西计算机研究生入学考试的多选题基准,近期前沿方向主要围绕大规模语言模型在葡萄牙语场景下的鲁棒性评估与推理能力验证。该数据集作为PoETa v2评估框架的核心组成部分,通过涵盖数学、计算机基础与技术三大领域的140道高难度题目,为衡量模型在图像理解、数学推理及复杂推理等多元认知维度上的表现提供了极具挑战性的测试平台。在巴西计算机学会认证的权威背景下,poscomp数据集正推动着葡萄牙语自然语言处理领域从传统分类任务向深度语义解析与跨学科推理的范式转变,其对于揭示模型在资源稀缺语言环境下的泛化瓶颈与认知边界具有不可替代的学术价值与实践意义。
以上内容由遇见数据集搜集并总结生成



