HellaSwag IT数据集是HellaSwag数据集的意大利语版本,用于常识推理的自然语言推理任务。该数据集通过Argos Translate v. 1.9.1自动翻译而成。原始英文版本的HellaSwag数据集是一个用于测试机器是否能够完成句子的常识推理数据集,相关论文发表于ACL2019。数据集包含多个特征字段,如活动标签、上下文、结尾选项等,并分为训练集、验证集和测试集。
This is the evaluation set for the EVWSD-ITA EVALITA 2026 task. Each instance contains a "query" (manually written following the procedure outlined on the main site) and a list of candidate images (i
BBH数据集专注于23个具有挑战性的BIG-Bench任务,这些任务被称为BIG-Bench Hard (BBH)。这些任务在之前的语言模型评估中未能超越人类评分者的平均表现。研究发现,应用链式思维(CoT)提示到BBH任务中,使得PaLM在23个任务中的10个任务上超越了人类评分者的平均表现,Codex (code-davinci-002)在23个任务中的17个任务上超越了人类评分者的平均表现。