skolegpt-instruct
收藏资源简介:
skolegpt-instruct是一个开源的丹麦语指令数据集,用于LLM的微调。该数据集是[OpenOrca指令数据集](https://huggingface.co/datasets/Open-Orca/OpenOrca)的一个高质量过滤子集的翻译。该项目是[SkoleGPT项目](https://skolegpt.dk/)的一部分。
SkoleGPT-instruct系一项开源的丹麦语指令数据集,旨在为大语言模型提供微调之用。该数据集源自[OpenOrca指令数据集](https://huggingface.co/datasets/Open-Orca/OpenOrca),经过精心筛选,成为其高质量过滤子集的翻译版本。该项目构成了[SkoleGPT项目](https://skolegpt.dk/)的重要组成部分。
SkoleGPT Instruct Dataset 概述
数据集描述
"skolegpt-instruct" 是一个开源数据集,用于丹麦语指令的微调大型语言模型(LLM)。该数据集是对 OpenOrca 指令数据集 的一个高质量过滤子集的翻译。该项目是 SkoleGPT 项目 的一部分。数据集可在 Hugging Face 上找到,地址为 kobprof/skolegpt-instruct。
数据处理流程
数据集的创建包括以下四个步骤:
-
数据采样:从 OpenOrca 数据集 中加载并打乱数据,特别是 "1M-GPT4-Augmented.parquet" 文件。选择特定数量的条目形成子集,并添加 "source" 列以跟踪来源。
-
数据过滤:通过
filter_data函数对原始数据集进行预处理和过滤。过滤步骤包括去除已翻译的指令、翻译指令、常见前缀和后缀、以冒号结尾的问题、多选题,以及进行基本清洁和去除特殊字符。 -
数据分层:根据 OpenOrca 的来源(niv, flan, cot, t0)对采样数据集进行分层。
-
数据翻译:使用 DeepL 服务进行数据翻译。翻译过程需要 DeepL 账户,并利用其 API 进行翻译,最多可免费翻译 500,000 个字符。
附加信息
数据集中还包含从 SkoleGPT 进行的调查中收集的指令,每条指令都与 GPT-4 的响应配对。这些指令标记为 "skolegpt_survey" 来源。相关的代码和调查问题分别可在 "survey2instructions.ipynb" 笔记本和 ./data/survey_questions.txt 中找到。




