Mixed Bilingual Multi-Task Benchmark
收藏资源简介:
该数据集是一个混合双语多任务基准测试包,包含四个任务:1. 相同开发标签分类任务,使用不同混合中英文文本;2. 跨域多领域分类任务,具有不同标签和领域;3. 复杂自然语言多项选择任务,标签为A/B/C/D;4. 项目友好型多项选择任务(比例3:7),用于分类和路由评估。数据格式为JSONL,每个文件包含text和label字段,总行数为3770。
This dataset is a mixed bilingual multi-task benchmark suite comprising four tasks: 1. Classification task with identical development labels, using diverse mixed Chinese-English texts; 2. Cross-domain multi-domain classification task with distinct labels and domains; 3. Complex natural language multiple-choice task with labels A/B/C/D; 4. Project-friendly multiple-choice task with a 3:7 sample ratio, intended for classification and routing evaluation. The data format is JSONL, where each file contains "text" and "label" fields, with a total of 3770 lines.
数据集概述:Mixed Bilingual Multi-Task Benchmark
该数据集是一个混合中英文双语的多任务基准测试集合,用于评估模型在多种任务上的分类与路由性能。数据集共包含 3770 条 样本,分为四个子任务。
任务结构
数据集包含四个基准任务,模拟了隐藏测试结构:
- task1_same_dev_labels_mixed_bilingual:相同开发集标签下的混合中英文文本分类。
- task2_ood_180_labels_multidomain_mixed_bilingual:跨域、不同标签的分布外多领域分类。
- task3_complex_mcq_mixed_bilingual:复杂的自然语言多选题(选项 A/B/C/D)。
- task4_project_friendly_mcq_mixed_bilingual_ratio_3_7:项目友好的多选题,用于分类和路由评估,选项比例为 3:7。
数据规模
| 任务 | 训练集 | 测试集 | 标签数 | 备注 |
|---|---|---|---|---|
| task1_same_dev_labels_mixed_bilingual | 231 | 539 | 77 | 每标签 3 条训练 + 7 条测试 |
| task2_ood_180_labels_multidomain_mixed_bilingual | 540 | 1260 | 180 | 每标签 3 条训练 + 7 条测试 |
| task3_complex_mcq_mixed_bilingual | 180 | 420 | 4 | 每选项 45 条训练 + 105 条测试 |
| task4_project_friendly_mcq_mixed_bilingual_ratio_3_7 | 180 | 420 | 4 | 每选项 45 条训练 + 105 条测试,比例 3:7 |
数据格式
- 每个文件为 JSONL 格式,包含两个字段:
"text":文本内容"label":标签值
- 所有测试集的标签均出现在对应训练集中。
- 部分测试行包含**提示注入(prompt-injection)**文本,该注入文本属于数据集本身的正常内容,稳健的分类器应忽略它。




