这是经过预处理和标记化的**s1_dataset_ptbr_1k**数据集,准备用于基于Llama/Tucano架构的模型微调。它通过应用特定的指令和思考过程("Thinking Process")模板生成,并使用**Tucano-1b1-Instruct**的标记器转换为IDs。数据集格式设计为促进"Chain of Thought"(思考链),包含原始问题、思考轨迹和解决方案的结构化数据。
该数据集包含四个主要特征:response(响应)、query(查询)、knowledge(知识)和label(标签)。数据集分为训练集和测试集,训练集包含31813个样本,测试集包含5989个样本。数据集的下载大小为6508120字节,总大小为24755153字节。数据集来源于McGill-NLP/FaithDial,并且对响应进行了分离,生成了BEGIN标签(Hallucination / N