GrandMaster-PRO-MAX
收藏资源简介:
## GrandMaster-PRO-MAX - Большой инструктивный датасет для русского языка Первый крупный высококачественный русскоязычный SFT датасет, полученный **не с помошью переводов ответов** моделей с английского языка. \ Cоздан для обучения моделей следовать самым разным инструкциям на разных языках (в основном на русском) и отвечать, так же, в основном на русском языке. Ответы за ассистента в этом датасете **полностью** сгенерированны **GPT-4-Turbo-1106** с нуля по исходномым инструкциям от пользователя. Исходные инструкции были взяты из различных источников, в том числе синтетических. Была выполнена дедупликация промптов по порогу cos_sim 0.975 с помошью intfloat/multilingual-e5-large. \ Некоторые инструкции были случайно предобработаны (измнение регистра, случайное удаление частых начал промптов, изменение пунктуации и тд) Характерной особенностью является, то, что модели обученные на этом датасете будут иметь уже "вшитую" способность к **Chain-Of-Thought (CoT)**, за счет использования более сложного промпта для генерации большинства ответов: """Your task is to generate an answer to the user's question on native Russian language (or on specially specified language in the question). It is important that your answer is well structured using Markdown and fulfills what the user asked for. At the beginning of the answer, if needed, try to give a small explanation about complex or ambiguous things in the user’s question, and after that, step by step do everything that is required. Try not to be too stuffy, your answers should be precise but not too boring. User's question: {question}""" Датасет содержит примерно **155 тысяч** уникальных пар инструкция - ответ. Денежный эквивалент генрации такого датасета с нуля - **около 4.5к долларов** **UPDATE 23.07.2024:** Датасет был обновлен, добавлены промпты из abacusai/SystemChat-1.1 и d0rj/OpenHermes-2.5-ru, сделана дедупликация. **UPDATE 27.07.2024:** Датасет был обновлен, добавлены засемпленые по кластерам английские оригинальные промпты из lmsys/lmsys-chat-1m с русскими и английскими ответами ### Источники исходных промптов 1. Часть от датасетов Saiga и Tagengo - около 16к 2. Русская часть датасета lmsys/lmsys-chat-1m - около 30к 3. Английская часть датасета lmsys/lmsys-chat-1m - около 37к 4. Част переведенного на руский датасета lmsys/lmsys-arena-human-preference-55k - около 21к 5. Синтетически сгенерированные - около 50к 6. Датасет системных промптов - abacusai/SystemChat-1.1 - около 5к уникальных 7. d0rj/OpenHermes-2.5-ru - около 20к уникальных переведенных промптов 8. Засемплированная мультиязычная часть датасета BAAI/Infinity-Instruct - около 30к (инструкции не переводились на русский специально) Важно: из датасетов использовались только промпты, ответы были сгенерированны заного. Информация о количестве промптов указана до дедупликации. #### Синтетически сгенерированные промпты Отдельно, для улучшения конкретных знаний моделей были сгенерированы синтетические русские промпты специальным способом, позволяющим максимально диверсифицировать генерации по темем и подтемам: 1. Математика - базовые школьные/вузовские знания о математике, задачки 2. Программирование - базовые школьные/вузовские знания о CS, задачки на алгоритмы 3. Логика и логические задачи 4. Объяснение концепций и терминов 5. Разработка концепций и идей 6. Чувствительные темы 7. Общие разговорные темы 8. Темы связанные с Россией и русским языком 9. RolePlay 10. How-to гайды и вопросы 11. Математика (часть 2) 12. Программирование - частые рабочие задачи 13. Задания на работу с текстом 14. Сравнения объектов, понятий и тд 15. Следование формату ответа указанному в промпте ### Визуализация датасета  ### Дополнительно В датасете есть поле cluster - были построены кластера с помощью intfloat/multilingual-e5-large, UMAP (понижение до размерности 10) и HDBSCAN (min_cluster_size=2, cluster_selection_epsilon=0.08). Всего **15149** уникальных кластеров. \ Так же в датасете есть поля prompt_tokens и answer_tokens - это количество токенов в инструкции и ответе модели посчитаное с помошью `tiktoken.encoding_for_model('gpt-4-turbo')`. ### Языки промптов prompt_lang ru 88781 en 64287 zh 421 es 269 ja 187 it 177 fr 171 pt 168 de 163 uk 129 bg 81 nl 32 sr 28 ... Всего **95** языков ### Языки ответов answer_lang ru 128149 en 25411 zh 420 es 309 pt 173 it 172 fr 172 de 142 bg 43 ja 30 sv 25 tr 21 uk 21 ... Всего **60** языков #### Распределение токенов в промпте count 155291.000000 mean 130.481445 std 167.803355 min 1.000000 25% 30.000000 50% 68.000000 75% 178.000000 max 3763.000000 #### Распределение токенов в ответе модели count 155291.000000 mean 720.647249 std 356.463506 min 1.000000 25% 468.000000 50% 743.000000 75% 980.000000 max 4095.000000 ### Авторы - Sergey Bratchikov, [NLP Wanderer](https://t.me/nlpwanderer) - Aleksandr Nikolich - Konstantin Korolev Cite: @article{nikolich2024vikhr, title={Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian}, author={Aleksandr Nikolich and Konstantin Korolev and Sergey Bratchikov and Artem Shelmanov and Igor Kiselev}, journal={arXiv preprint arXiv:2405.13929}, year={2024}, url={https://arxiv.org/pdf/2405.13929} }



