ru-dataset-small
收藏资源简介:
RU Dataset 1是一个俄语监督微调(SFT)数据集,专为语言模型的进一步训练设计。该数据集聚焦于编程、算法、软件架构、数学和指令遵循等主题,所有回答均采用详细展开格式,并在最终答案前包含明确的推理块,旨在训练模型的思维链(Chain-of-Thought)推理能力。数据集采用标准聊天格式,兼容HuggingFace Datasets和主流SFT框架,数据规模在1千到1万条之间。结构包括单轮问答(用于基础SFT训练)和多轮对话(用于训练模型保持上下文并进行复杂交互),涵盖Python、C++、Java、JavaScript等多种编程语言,以及算法、后端开发、代码审查、调试、机器学习、Linux、Docker等技术主题。适用于监督微调、指令遵循训练、推理能力训练及俄语多轮对话模型开发。
RU Dataset 1 is a Russian supervised fine-tuning (SFT) dataset specifically designed for further training of language models. It focuses on topics such as programming, algorithms, software architecture, mathematics, and instruction following. All answers are in a detailed, expanded format with explicit reasoning blocks before the final answer, aiming to train the models chain-of-thought reasoning capabilities. The dataset uses a standard chat format, compatible with HuggingFace Datasets and mainstream SFT frameworks, with a data scale ranging from 1,000 to 10,000 entries. The structure includes single-turn Q&A (for basic SFT training) and multi-turn dialogues (for training models to maintain context and engage in complex interactions), covering various programming languages like Python, C++, Java, and JavaScript, as well as technical topics such as algorithms, backend development, code review, debugging, machine learning, Linux, and Docker. It is suitable for supervised fine-tuning, instruction-following training, reasoning ability training, and the development of Russian multi-turn dialogue models.
数据集概述:RU Dataset 1 (ru-dataset-small)
语言:俄语 (ru)
许可证:Apache-2.0
任务类型:文本生成、问答
数据规模:1K < 样本数 < 10K
数据集配置:默认配置,包含训练集,数据格式为 JSON,文件分布在 dataset-1 至 dataset-4 文件夹中。
模态:文本
数据集描述
这是一个俄语 SFT(监督微调)数据集,主要用于微调语言模型。其核心聚焦于编程、算法、软件架构、数学以及指令遵循。所有助手回答均采用展开形式,并在回答前包含 <think> 推理块,支持思维链(Chain-of-Thought)学习。数据集正在积极扩充,会定期添加新对话。
数据格式
采用与 HuggingFace Datasets 及大多数 SFT 框架(如 TRL、Axolotl、LLaMA-Factory)兼容的标准对话格式: json { "messages": [ {"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "<think> ... </think>
..."} ] }
每个助手回复均包含一个明确的 <think> 推理块。
仓库结构
数据集按文件夹划分,每个文件夹包含 .jsonl 文件:
-
dataset-1/:单轮问答(问题 → 带
<think>的详细回答) -
dataset-2/:单轮问答(扩展主题)
-
dataset-3/:多轮对话(含澄清的多步对话)
-
dataset-4/:多轮对话(复杂对话,如代码审查、调试)
-
change_system_prompt.py:用于替换系统提示词的实用工具脚本
-
单轮:经典“问题-回答”格式,适用于基础 SFT。
-
多轮:完整的多轮对话,模型需维持上下文并在对话中细化决策,适合训练上下文思维。
主题范围
- 编程语言:Python、C++、Java、JavaScript、TypeScript、Rust、Go、SQL、Bash
- 主题:算法与数据结构、后端开发、代码审查、调试、软件架构、机器学习、数学、Linux、Docker、Git、Telegram 机器人、Web 开发
- 任务类型:概念解释、代码编写、代码审查、调试、含澄清的多步对话
使用方法
通过 HuggingFace Datasets 加载: python from datasets import load_dataset dataset = load_dataset("ru-dataset/ru-dataset-small") print(dataset["train"][0]["messages"])
本地加载: python from datasets import load_dataset dataset = load_dataset( "json", data_files={"train": ["dataset-1/.jsonl", "dataset-2/.jsonl"]} )
更改系统提示
仓库提供 change_system_prompt.py 脚本。下载脚本和数据集文件夹后,将其放置在同一目录下并运行:
bash
python change_system_prompt.py
该脚本会遍历所有文件,将 system 字段替换为脚本开头 NEW_SYSTEM 变量定义的值。
适用场景
| 任务 | 适用性 |
|---|---|
| 监督微调 (SFT) | ✅ |
| 指令遵循 | ✅ |
| 推理 / 思维链 | ✅ |
| 俄语模型 | ✅ |
| 多轮对话 | ✅ |
| RLHF / DPO | ⚠️ 部分适用 |
许可证
Apache-2.0,允许商用、修改及分发。




