遇见数据集

portallib-tasks

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

PorTAL 14-Task Multiple-Choice Suite 是一个标准化的多项选择题任务套件,专为portallib训练示例而设计。该数据集整合了14个不同的自然语言理解任务,共包含129,212个训练样本和19,548个验证样本。每个数据样本包含四个字段:task(稳定的任务名称)、prompt(语言模型上下文,无尾部空格)、choices(候选续写选项,每个选项前有且仅有一个空格,无尾部空格)和gold_idx(正确选项的零基索引)。验证指标采用基于字符长度归一化的续写对数概率(acc_norm),同时单独报告黄金续写的标记平均负对数似然。数据来源于14个上游基准数据集,包括TruthfulQA、SuperGLUE(含RTE、CB、COPA、WiC、WSC)、BoolQ、AI2 ARC(Easy和Challenge)、HellaSwag、OpenBookQA、WinoGrande、CommonsenseQA和SciQ。数据集采用混合许可证,因为各组件具有不同的许可条款。该套件主要用于语言模型的多任务训练和评估,支持源训练、目标模型微调和评估等不同使用场景,每种场景都有确定性的样本选择策略。

PorTAL 14-Task Multiple-Choice Suite is a standardized multiple-choice question task suite designed for portallib training examples. The dataset integrates 14 different natural language understanding tasks, containing a total of 129,212 training samples and 19,548 validation samples. Each data sample includes four fields: task (stable task name), prompt (language model context, without trailing spaces), choices (candidate continuation options, each preceded by exactly one space and without trailing spaces), and gold_idx (zero-based index of the correct option). The validation metric uses continuation log probability normalized by character length (acc_norm), while also separately reporting the token average negative log-likelihood of the gold continuation. The data is sourced from 14 upstream benchmark datasets, including TruthfulQA, SuperGLUE (including RTE, CB, COPA, WiC, WSC), BoolQ, AI2 ARC (Easy and Challenge), HellaSwag, OpenBookQA, WinoGrande, CommonsenseQA, and SciQ. The dataset uses a mixed license because the components have different licensing terms. This suite is primarily used for multi-task training and evaluation of language models, supporting different usage scenarios such as source training, target model fine-tuning, and evaluation, each with deterministic sample selection strategies.

创建时间:
2026-07-14
原始信息汇总

数据集名称

PorTAL 14-Task Multiple-Choice Suite

数据集描述

该数据集是 portallib 训练示例所使用的标准化任务套件,包含129,212个训练示例和19,548个验证示例。

数据字段

每一行包含以下字段:

  • task:稳定的任务名称
  • prompt:语言模型上下文,末尾无空格;仅当源句子将空白置于开头时为空
  • choices:候选续写内容,开头恰好有一个空格,末尾无空格
  • gold_idx:正确续写的从零开始的索引

验证指标

portallib 中使用的验证指标是按字符长度归一化的续写对数概率(acc_norm),同时单独报告黄金续写的 token 平均负对数似然(NLL)。

数据规模

  • 训练示例:129,212
  • 验证示例:19,548
  • 类别:100K<n<1M

语种

英语(en)

任务类型

多项选择(multiple-choice)

许可证

其他(other),因各子数据集许可证不同

数据来源与出处

数据来自以下上游数据集,并使用了指定的修订版本:

任务 上游数据集 固定修订版本 上游声明许可证
TruthfulQA truthfulqa/truthful_qa 741b8276f2d1982aa3d5b832d3ee81ed3b896490 Apache-2.0
RTE, CB, COPA, WiC, WSC aps/super_glue 3de24cf8022e94f4ee4b9d55a6f539891524d646 其他;请查阅任务特定条款
BoolQ google/boolq 35b264d03638db9f4ce671b711558bf7ff0f80d5 CC BY-SA 3.0
ARC Easy, ARC Challenge allenai/ai2_arc 210d026faf9955653af8916fad021475a3f00453 CC BY-SA 4.0
HellaSwag Rowan/hellaswag 218ec52e09a7e7462a5400043bb9a69a41d06b76 Hub 元数据中未声明
OpenBookQA allenai/openbookqa 388097ea7776314e93a529163e0fea805b8a6454 Hub 元数据中未知
WinoGrande allenai/winogrande 01e74176c63542e6b0bcb004dcdea22d94fb67b5 Hub 元数据中未声明
CommonsenseQA tau/commonsense_qa 94630fe30dad47192a8546eb75f094926d47e155 MIT
SciQ allenai/sciq 2c94ad3e1aafab77146f384e23536f97a4849815 CC BY-NC 3.0

发布配方选择

portallib v0.1.0 版本的发布配方从该单一数据集修订版本中确定性选择示例:

  • 源训练:每个任务使用前2,000个训练示例,若任务示例少于2,000则使用全部可用示例,该子集在各轮次中固定。
  • Qwen3-8B 和 Gemma 3 4B 的再拟合:从完整池中对每个任务进行最多1,000个训练示例的种子采样(seed=0)。
  • 评估:每个任务使用前1,000个验证示例,若任务示例少于1,000则使用全部可用示例。

复现方法

完整的确定性标准化过程位于 scripts/prepare_dataset.py。安装发布的训练包后,从 portallib 仓库运行准备脚本: bash pip install portallib[training]==0.1.0 python scripts/prepare_dataset.py --output portal_tasks.json

规范 JSON 序列化的 SHA-256 值为 97ae9193a02b96daec13f7e21f56fbe7ed5102fd900e6c2093d9bbfc009f74cd

其他说明

  • TruthfulQA 仅暴露一个标注拆分,因此前75%用于训练,后25%用于验证。其余所有任务直接使用其上游的 trainvalidation 拆分。
  • 不包含测试标签。
搜集汇总
数据集介绍
portallib-tasks 数据集图片
构建方式
PorTAL 14-Task Multiple-Choice Suite是一个多任务多项选择数据集,整合了TruthfulQA、SuperGLUE、BoolQ等九个上游基准测试,共收录129,212条训练样本与19,548条验证样本。每条数据包含稳定任务名称、语言模型上下文提示、候选续写选项及正确答案索引。数据归一化过程完全可复现,通过指定脚本与端口库v0.1.0版本生成,并提供了SHA-256校验值确保完整性。训练与验证集划分遵循确定性策略:多数任务直接沿用上游的官方分割,仅TruthfulQA因仅有一个标注拆分而按75%与25%比例划分。
特点
该数据集的核心特色在于其任务多样性及灵活的样本选择机制。涵盖14项不同类型的能力评估任务,从常识推理到科学问答,形成全面能力测试矩阵。portallib库提供了多种发布配方,允许用户根据需求从完整样本池中选取子集,例如源训练采用每任务前2,000条固定样本,而模型微调则使用种子采样最多1,000条。验证度量采用字符长度归一化的续写对数概率(acc_norm),并单独报告正确续写的token平均负对数似然,为模型评估提供双重指标。
使用方法
使用者可通过HuggingFace数据集库直接加载,或使用portallib的复现脚本生成规范JSON文件。加载后,数据以任务为单位组织,每行包含prompt字段作为模型输入、choices字段提供候选选项、gold_idx字段标注正确答案。在portallib框架内,模型通过计算各选项的续写对数概率进行预测,优先采用acc_norm指标评估。对于自定义训练,建议参考REPRODUCING.md中的发布配方,根据应用场景选择适当的样本选取策略,并注意遵守各上游数据集的独立许可条款。
背景与挑战
背景概述
随着大规模语言模型在自然语言处理领域的迅猛发展,如何系统性地评估模型的常识推理、语义理解与文本生成能力成为关键瓶颈。为此,于2024年创建的PortAL 14-Task Multiple-Choice Suite数据集,由ramp-public研究团队基于HuggingFace生态构建,整合了TruthfulQA、SuperGLUE、ARC、HellaSwag等14项经典基准任务,共计129,212条训练样本与19,548条验证样本。该数据集的核心研究问题在于为多任务学习与模型微调提供统一、标准化的评估框架,其影响力体现在促进跨任务迁移学习与细粒度能力分析,已被广泛用于portallib库的训练示例与Qwen3-8B等模型的性能验证。
当前挑战
该数据集面临多维挑战。在领域问题层面,它旨在解决语言模型在多项选择任务中的泛化能力评估难题,尤其需平衡不同任务(如常识推理与事实一致性)间的异质性,避免模型过度拟合特定任务分布。在构建过程中,挑战主要源于数据归一化与版权合规:需将来自9个上游数据集的不同格式(如分词、空白处理)统一为持续对数概率评估标准,同时确保Apache-2.0、CC BY-SA 3.0等混合许可证的合规使用。此外,确定性采样策略(如每个任务仅取前2,000条)可能引入选择偏差,影响模型在完整任务池上的鲁棒性评估。
常用场景
经典使用场景
在自然语言处理领域,多任务评估是衡量语言模型综合能力的核心范式。PorTAL 14-Task Multiple-Choice Suite(即portallib-tasks)汇聚了14项经典选择题任务,涵盖常识推理(如CommonsenseQA、OpenBookQA)、事实一致性(TruthfulQA)、词义消歧(WiC)、指代消解(WSC)及逻辑蕴含(RTE、CB)等关键能力维度。其经典使用场景聚焦于语言模型的零样本与少样本评估:通过统一格式的提示词与候选续写,研究者可便捷地计算模型在各任务上的字符归一化对数概率(acc_norm),从而系统性地剖析模型在推理、知识与语言理解层面的相对优势与短板。该套件尤为适合检验预训练模型在多样任务上的泛化能力,为模型迭代提供多维度的诊断反馈。
实际应用
在实际应用层面,portallib-tasks为语言模型的工业化部署提供了扎实的保驾护航能力。企业在选用大模型进行产品集成时,往往需要一张详尽的“能力清单”来评估模型在客服问答(基于BoolQ的二元事实判定)、智能教育(基于SciQ的科学知识选择)、逻辑校验(基于RTE的文本蕴含分析)等场景中的可靠性与鲁棒性。该数据集能以统一的标准化流程为模型进行压力测试,揭示其在关键边缘案例上的失效模式。此外,借助portallib训练框架,工程师可基于该套件进行领域微调:例如利用源任务子集进行知识蒸馏或适配训练,将大模型的泛化能力迁移至资源受限的边端设备,从而在真实产品环境中平衡计算效率与语义理解质量。
衍生相关工作
portallib-tasks的发布催生了若干具有延续性的研究工作。其依托的portallib训练框架通过确定性种子选择和可复现的评估协议,为多任务微调与目标域适配提供了标准化基线。相关衍生工作首先表现为对子任务重要性权重的探索:研究者利用该套件分析了不同任务(如HellaSwag与TruthfulQA)在绑定微调时的梯度冲突,开发了动态任务重加权策略以消弭负迁移。其次,该数据集被用于验证“课程学习”假设,即按照推理复杂度递增的顺序排列任务标签能否加速收敛。此外,以Qwen3-8B和Gemma 3 4B为代表的模型在此套件上进行逐任务重拟合实验,揭示了不同规模模型在常识推理与语义相似性任务上的数据效率差异,这些发现直接促进了面向开源大模型的高效适配方法论发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务