portallib-tasks
收藏资源简介:
PorTAL 14-Task Multiple-Choice Suite 是一个标准化的多项选择题任务套件,专为portallib训练示例而设计。该数据集整合了14个不同的自然语言理解任务,共包含129,212个训练样本和19,548个验证样本。每个数据样本包含四个字段:task(稳定的任务名称)、prompt(语言模型上下文,无尾部空格)、choices(候选续写选项,每个选项前有且仅有一个空格,无尾部空格)和gold_idx(正确选项的零基索引)。验证指标采用基于字符长度归一化的续写对数概率(acc_norm),同时单独报告黄金续写的标记平均负对数似然。数据来源于14个上游基准数据集,包括TruthfulQA、SuperGLUE(含RTE、CB、COPA、WiC、WSC)、BoolQ、AI2 ARC(Easy和Challenge)、HellaSwag、OpenBookQA、WinoGrande、CommonsenseQA和SciQ。数据集采用混合许可证,因为各组件具有不同的许可条款。该套件主要用于语言模型的多任务训练和评估,支持源训练、目标模型微调和评估等不同使用场景,每种场景都有确定性的样本选择策略。
PorTAL 14-Task Multiple-Choice Suite is a standardized multiple-choice question task suite designed for portallib training examples. The dataset integrates 14 different natural language understanding tasks, containing a total of 129,212 training samples and 19,548 validation samples. Each data sample includes four fields: task (stable task name), prompt (language model context, without trailing spaces), choices (candidate continuation options, each preceded by exactly one space and without trailing spaces), and gold_idx (zero-based index of the correct option). The validation metric uses continuation log probability normalized by character length (acc_norm), while also separately reporting the token average negative log-likelihood of the gold continuation. The data is sourced from 14 upstream benchmark datasets, including TruthfulQA, SuperGLUE (including RTE, CB, COPA, WiC, WSC), BoolQ, AI2 ARC (Easy and Challenge), HellaSwag, OpenBookQA, WinoGrande, CommonsenseQA, and SciQ. The dataset uses a mixed license because the components have different licensing terms. This suite is primarily used for multi-task training and evaluation of language models, supporting different usage scenarios such as source training, target model fine-tuning, and evaluation, each with deterministic sample selection strategies.
数据集名称
PorTAL 14-Task Multiple-Choice Suite
数据集描述
该数据集是 portallib 训练示例所使用的标准化任务套件,包含129,212个训练示例和19,548个验证示例。
数据字段
每一行包含以下字段:
task:稳定的任务名称prompt:语言模型上下文,末尾无空格;仅当源句子将空白置于开头时为空choices:候选续写内容,开头恰好有一个空格,末尾无空格gold_idx:正确续写的从零开始的索引
验证指标
portallib 中使用的验证指标是按字符长度归一化的续写对数概率(acc_norm),同时单独报告黄金续写的 token 平均负对数似然(NLL)。
数据规模
- 训练示例:129,212
- 验证示例:19,548
- 类别:100K<n<1M
语种
英语(en)
任务类型
多项选择(multiple-choice)
许可证
其他(other),因各子数据集许可证不同
数据来源与出处
数据来自以下上游数据集,并使用了指定的修订版本:
| 任务 | 上游数据集 | 固定修订版本 | 上游声明许可证 |
|---|---|---|---|
| TruthfulQA | truthfulqa/truthful_qa |
741b8276f2d1982aa3d5b832d3ee81ed3b896490 |
Apache-2.0 |
| RTE, CB, COPA, WiC, WSC | aps/super_glue |
3de24cf8022e94f4ee4b9d55a6f539891524d646 |
其他;请查阅任务特定条款 |
| BoolQ | google/boolq |
35b264d03638db9f4ce671b711558bf7ff0f80d5 |
CC BY-SA 3.0 |
| ARC Easy, ARC Challenge | allenai/ai2_arc |
210d026faf9955653af8916fad021475a3f00453 |
CC BY-SA 4.0 |
| HellaSwag | Rowan/hellaswag |
218ec52e09a7e7462a5400043bb9a69a41d06b76 |
Hub 元数据中未声明 |
| OpenBookQA | allenai/openbookqa |
388097ea7776314e93a529163e0fea805b8a6454 |
Hub 元数据中未知 |
| WinoGrande | allenai/winogrande |
01e74176c63542e6b0bcb004dcdea22d94fb67b5 |
Hub 元数据中未声明 |
| CommonsenseQA | tau/commonsense_qa |
94630fe30dad47192a8546eb75f094926d47e155 |
MIT |
| SciQ | allenai/sciq |
2c94ad3e1aafab77146f384e23536f97a4849815 |
CC BY-NC 3.0 |
发布配方选择
portallib v0.1.0 版本的发布配方从该单一数据集修订版本中确定性选择示例:
- 源训练:每个任务使用前2,000个训练示例,若任务示例少于2,000则使用全部可用示例,该子集在各轮次中固定。
- Qwen3-8B 和 Gemma 3 4B 的再拟合:从完整池中对每个任务进行最多1,000个训练示例的种子采样(
seed=0)。 - 评估:每个任务使用前1,000个验证示例,若任务示例少于1,000则使用全部可用示例。
复现方法
完整的确定性标准化过程位于 scripts/prepare_dataset.py。安装发布的训练包后,从 portallib 仓库运行准备脚本:
bash
pip install portallib[training]==0.1.0
python scripts/prepare_dataset.py --output portal_tasks.json
规范 JSON 序列化的 SHA-256 值为 97ae9193a02b96daec13f7e21f56fbe7ed5102fd900e6c2093d9bbfc009f74cd。
其他说明
- TruthfulQA 仅暴露一个标注拆分,因此前75%用于训练,后25%用于验证。其余所有任务直接使用其上游的
train和validation拆分。 - 不包含测试标签。




