multilingual_mcq
收藏资源简介:
该数据集是一个结构化的文本数据集,包含多个字段,旨在支持问答或文本生成任务。每个样本包括唯一标识符(id)、来源(source)、语言(language)、数据划分(split,如训练集或验证集)、提示文本(prompt)、答案文本(answer)、思维链文本(cot)、是否包含思维链的标志(has_cot)、主题(subject)、领域(domain)以及来源划分(source_split)。数据集总大小约为129.8 MB(下载大小约50.8 MB),包含129,627个训练样本和8,671个验证样本,以分片文件形式组织,适用于模型训练和评估。
This dataset is a structured text dataset containing multiple fields, designed to support question-answering or text generation tasks. Each sample includes a unique identifier (id), source (source), language (language), data split (split, such as training or validation set), prompt text (prompt), answer text (answer), chain-of-thought text (cot), a flag indicating whether it contains chain-of-thought (has_cot), subject (subject), domain (domain), and source split (source_split). The total dataset size is approximately 129.8 MB (download size about 50.8 MB), containing 129,627 training samples and 8,671 validation samples, organized in sharded files, and is suitable for model training and evaluation.
- 数据集名称:multilingual_mcq
- 数据集来源:Hugging Face 上的
cs-552-2026-MMRF组织 - 数据集描述:该数据集是一个多语言多选题(MCQ)数据集,包含问题、答案、思维链(CoT)等信息,适用于多语言问答和推理任务。
- 特征字段:
id:样本的唯一标识符(字符串)source:数据来源(字符串)language:语言(字符串)split:数据划分(字符串)prompt:问题或提示(字符串)answer:正确答案(字符串)cot:思维链推理过程(字符串)has_cot:是否包含思维链(布尔值)subject:主题(字符串)domain:领域(字符串)source_split:原始数据划分(字符串)
- 数据划分:
- 训练集(
train):129,627 个样本,约 122.46 MB - 验证集(
val):8,671 个样本,约 7.47 MB
- 训练集(
- 数据集大小:下载大小约 53.79 MB,数据集总大小约 129.93 MB
- 配置:默认配置(
default),训练集数据路径为data/train-*,验证集数据路径为data/val-* - 数据集地址:https://huggingface.co/datasets/cs-552-2026-MMRF/multilingual_mcq




