Turkish-Python-instruction-450k
收藏资源简介:
该数据集是一个大规模的土耳其语Python指令数据集,包含超过448,531个独特样本,专为训练土耳其语代码助手、进行LLM微调和代码生成而设计。数据集按软件工程主题和token大小(128、256、386、512)进行模块化组织,当前版本涵盖PY_CORE(Python核心语法,205,585个样本)、OOP(面向对象编程,49,865个样本)、DATA_STRUCTURES(数据结构,44,146个样本)和ALGORITHMS(算法,约50,000个样本,持续生产中)等类别。所有样本采用ChatML/Alpaca指令格式,使用自然流畅的土耳其语编写。数据集还计划扩展至23个类别,包括函数式编程、文件I/O、数据库、Web基础、FastAPI、Flask、Django、网络、并发、异步编程、测试、安全、DevOps、Shell集成、性能优化、调试、消息中间件、系统工具和集成项目等。用户可以通过Hugging Face datasets库加载整个数据集或按token大小选择子集。该数据集基于MIT许可证开源。
This dataset is a large-scale Turkish Python instruction dataset containing over 448,531 unique samples, designed for training Turkish code assistants, LLM fine-tuning, and code generation. The dataset is modularly organized by software engineering topics and token sizes (128, 256, 386, 512). The current version covers categories including PY_CORE (Python core syntax, 205,585 samples), OOP (Object-Oriented Programming, 49,865 samples), DATA_STRUCTURES (Data Structures, 44,146 samples), and ALGORITHMS (Algorithms, about 50,000 samples, in continuous production). All samples follow the ChatML/Alpaca instruction format and are written in natural and fluent Turkish. The dataset also plans to expand to 23 categories, including functional programming, file I/O, databases, web basics, FastAPI, Flask, Django, networking, concurrency, asynchronous programming, testing, security, DevOps, shell integration, performance optimization, debugging, message middleware, system tools, and integrated projects. Users can load the entire dataset or select subsets by token size via the Hugging Face datasets library. This dataset is open-sourced under the MIT license.
🚀 Turkish Python Expert Dataset (450K+ / 0.5M Release)
数据集概述
这是一个专为土耳其语代码助手、LLM 微调和代码生成而设计的大规模土耳其语 Python 指令数据集,包含 448,531 个唯一示例。该数据集是涵盖 23 个不同类别(每类约 50,000 个示例)总计 1.15M 行的土耳其语 Python 掌握课程项目的扩展 2.0 版本。
基本信息
| 属性 | 值 |
|---|---|
| 语言 | 土耳其语 (tr) |
| 许可证 | MIT |
| 任务类型 | 文本生成 (text-generation) |
| 标签 | python, coding, instruction, turkish |
| 数据规模 | 100K < n < 1M |
| 总行数 | 448,531+ 条独立指令 |
| 数据格式 | ChatML / Alpaca Instruction Format |
📂 数据集类别分布
已发布类别
- PY_CORE(205,585 个示例):基础语法、内置函数、循环和逻辑结构,按 Token 大小模块化划分:
PY_CORE-original_128_token.jsonl:52,866 个示例PY_CORE-original_256_token.jsonl:130,369 个示例PY_CORE-original_386_token.jsonl:14,246 个示例PY_CORE-original_512_token.jsonl:8,104 个示例
- OOP(49,865 个示例):面向对象编程、类、继承、多态和架构设计
- DATA_STRUCTURES(44,146 个示例):列表、字典、集合、deque 和复杂数据结构
- ALGORITHMS(约 50K,生产中):排序、搜索、数据处理和动态规划算法
计划中的 19 个类别(目标:每类 50,000 个示例)
包括:函数式编程(函数式编程)、文件 I/O 与序列化、数据库与 ORM、Web 基础、FastAPI、Flask、Django、网络与套接字、并发与并行、异步编程、测试与质量、安全与认证、DevOps 与部署、Shell 集成、性能优化、调试与分析、通信与消息(消息队列)、系统工具、集成项目。
Token 模块化特性
数据集按照最大 Token 大小(128、256、386、512)进行模块化划分,同时也按照软件工程主题进行组织,方便用户根据需求选择特定规模的子数据集进行加载。
🐍 快速使用示例
python from datasets import load_dataset
1. 加载完整数据集(448,531 个示例)
dataset = load_dataset("bysismo/Turkish-Python-instruction-450k", data_files="original_488k.jsonl")
2. 模块化加载(例如:仅加载 PY_CORE 256 Token 包)
dataset_256 = load_dataset( "bysismo/Turkish-Python-instruction-450k", data_files="skill-1-PY_CORE/PY_CORE-original_256_token.jsonl" )
关联数据集
该团队还发布了以下其他开源土耳其语数据集:
- Temel-cumle-analizi-2.7M:270 万 ChatML 问答 & 5N1K 信息提取数据集
- 2k3n1d-Temel-cumle-analizi-284k:284K 结构化 5N1K 与情感分析数据集
- 3Milyon_Zengin_Sorular_Cevaplar:300 万形态学丰富问答数据集
- 100k_Tdk_zurriyet_dna_v6.jsonl:463K 词汇 TDK 形态 DNA 与词缀解析数据集




