遇见数据集

Turkish-Python-instruction-450k

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集是一个大规模的土耳其语Python指令数据集,包含超过448,531个独特样本,专为训练土耳其语代码助手、进行LLM微调和代码生成而设计。数据集按软件工程主题和token大小(128、256、386、512)进行模块化组织,当前版本涵盖PY_CORE(Python核心语法,205,585个样本)、OOP(面向对象编程,49,865个样本)、DATA_STRUCTURES(数据结构,44,146个样本)和ALGORITHMS(算法,约50,000个样本,持续生产中)等类别。所有样本采用ChatML/Alpaca指令格式,使用自然流畅的土耳其语编写。数据集还计划扩展至23个类别,包括函数式编程、文件I/O、数据库、Web基础、FastAPI、Flask、Django、网络、并发、异步编程、测试、安全、DevOps、Shell集成、性能优化、调试、消息中间件、系统工具和集成项目等。用户可以通过Hugging Face datasets库加载整个数据集或按token大小选择子集。该数据集基于MIT许可证开源。

This dataset is a large-scale Turkish Python instruction dataset containing over 448,531 unique samples, designed for training Turkish code assistants, LLM fine-tuning, and code generation. The dataset is modularly organized by software engineering topics and token sizes (128, 256, 386, 512). The current version covers categories including PY_CORE (Python core syntax, 205,585 samples), OOP (Object-Oriented Programming, 49,865 samples), DATA_STRUCTURES (Data Structures, 44,146 samples), and ALGORITHMS (Algorithms, about 50,000 samples, in continuous production). All samples follow the ChatML/Alpaca instruction format and are written in natural and fluent Turkish. The dataset also plans to expand to 23 categories, including functional programming, file I/O, databases, web basics, FastAPI, Flask, Django, networking, concurrency, asynchronous programming, testing, security, DevOps, shell integration, performance optimization, debugging, message middleware, system tools, and integrated projects. Users can load the entire dataset or select subsets by token size via the Hugging Face datasets library. This dataset is open-sourced under the MIT license.

创建时间:
2026-07-29
原始信息汇总

🚀 Turkish Python Expert Dataset (450K+ / 0.5M Release)

数据集概述

这是一个专为土耳其语代码助手、LLM 微调和代码生成而设计的大规模土耳其语 Python 指令数据集,包含 448,531 个唯一示例。该数据集是涵盖 23 个不同类别(每类约 50,000 个示例)总计 1.15M 行的土耳其语 Python 掌握课程项目的扩展 2.0 版本。

基本信息

属性
语言 土耳其语 (tr)
许可证 MIT
任务类型 文本生成 (text-generation)
标签 python, coding, instruction, turkish
数据规模 100K < n < 1M
总行数 448,531+ 条独立指令
数据格式 ChatML / Alpaca Instruction Format

📂 数据集类别分布

已发布类别

  • PY_CORE(205,585 个示例):基础语法、内置函数、循环和逻辑结构,按 Token 大小模块化划分:
    • PY_CORE-original_128_token.jsonl:52,866 个示例
    • PY_CORE-original_256_token.jsonl:130,369 个示例
    • PY_CORE-original_386_token.jsonl:14,246 个示例
    • PY_CORE-original_512_token.jsonl:8,104 个示例
  • OOP(49,865 个示例):面向对象编程、类、继承、多态和架构设计
  • DATA_STRUCTURES(44,146 个示例):列表、字典、集合、deque 和复杂数据结构
  • ALGORITHMS(约 50K,生产中):排序、搜索、数据处理和动态规划算法

计划中的 19 个类别(目标:每类 50,000 个示例)

包括:函数式编程(函数式编程)、文件 I/O 与序列化、数据库与 ORM、Web 基础、FastAPI、Flask、Django、网络与套接字、并发与并行、异步编程、测试与质量、安全与认证、DevOps 与部署、Shell 集成、性能优化、调试与分析、通信与消息(消息队列)、系统工具、集成项目。

Token 模块化特性

数据集按照最大 Token 大小(128、256、386、512)进行模块化划分,同时也按照软件工程主题进行组织,方便用户根据需求选择特定规模的子数据集进行加载。

🐍 快速使用示例

python from datasets import load_dataset

1. 加载完整数据集(448,531 个示例)

dataset = load_dataset("bysismo/Turkish-Python-instruction-450k", data_files="original_488k.jsonl")

2. 模块化加载(例如:仅加载 PY_CORE 256 Token 包)

dataset_256 = load_dataset( "bysismo/Turkish-Python-instruction-450k", data_files="skill-1-PY_CORE/PY_CORE-original_256_token.jsonl" )

关联数据集

该团队还发布了以下其他开源土耳其语数据集:

  • Temel-cumle-analizi-2.7M:270 万 ChatML 问答 & 5N1K 信息提取数据集
  • 2k3n1d-Temel-cumle-analizi-284k:284K 结构化 5N1K 与情感分析数据集
  • 3Milyon_Zengin_Sorular_Cevaplar:300 万形态学丰富问答数据集
  • 100k_Tdk_zurriyet_dna_v6.jsonl:463K 词汇 TDK 形态 DNA 与词缀解析数据集
搜集汇总
数据集介绍
Turkish-Python-instruction-450k 数据集图片
构建方式
该数据集是基于Türkçe Python Ustalık Müfredatı项目精心构建的大规模指令数据集,汇聚了448,531个独特样本,覆盖23个软件工程领域,当前已发布其中4个核心类别。数据集的构建遵循了系统化的方法论,将Python编程知识体系划分为基础核心、面向对象、数据结构与算法等模块,并依据指令的复杂度与任务需求,将样本按照128、256、386及512四种Token粒度进行精细划分,形成高度结构化的模块化档案。每条指令均采用ChatML与Alpaca双格式编撰,确保了与主流微调框架的兼容性。此外,数据构建者以母语者的语言直觉精心撰写了所有内容,确保了指令文本的自然性与流畅性,从而为土耳其语代码助手的训练提供了坚实的数据基础。
特点
该数据集的核心特性在于其显著的规模优势与模块化设计。其体量高达近五十万条指令,并规划扩展至每类约五万条、总计超过一百万条样本的宏伟蓝图,旨在为土耳其语代码生成及大型语言模型的领域适配提供充足的数据资源。数据集的模块化特性是其一大亮点,可根据编程主题或Token长度灵活切片,支持研究者按需选取特定技能或资源约束下的子集进行训练,极大提高了数据使用的灵活性。同时,数据内容完全贴合土耳其语的语言习惯,自然流畅,无翻译痕迹,且通过多文档格式(JSONL)与标准指令集结构,保障了数据的高可用性及与行业实践的无缝对接。
使用方法
该数据集的使用颇为便捷,专为Hugging Face生态系统优化,可通过datasets库一键加载。使用者既可加载包含全量样本的原始文件以获得全面的训练素材,亦可根据科研或工程需求,精准调用特定技能模块的Token子集,例如仅提取PY_CORE 256 Token版本,以实现对模型进行更细粒度的能力增强。其兼容ChatML与Alpaca指令格式,使得该数据集能够无缝适配包括LLaMA、Mistral等在内的各类主流模型架构,大幅降低了数据预处理的门槛。数据集的结构清晰,字段明确,使得从数据加载、预处理到模型微调的全流程均可高效执行,是开发高质量土耳其语代码智能助手的宝贵资源。
背景与挑战
背景概述
随着大型语言模型在多语言编程任务中的广泛应用,高质量的非英语指令数据成为提升模型多语言代码生成能力的关键。2025年,bysismo团队发布了土耳其语Python指令数据集Turkish-Python-instruction-450k,旨在填补土耳其语编程指令数据的空白。该数据集包含超过448,000条独特的土耳其语Python指令,涵盖23个软件工程类别,并按token长度(128至512)进行模块化划分,为土耳其语代码助手和LLM的微调提供了丰富资源。其研究问题聚焦于如何构建大规模、高质量、多样化的土耳其语编程指令数据,以支持多语言代码生成模型的训练与评估。该数据集的发布对于推动土耳其语自然语言处理与代码智能的交叉研究具有重要影响力,为相关领域的研究人员提供了宝贵的基准资源。
当前挑战
该数据集面临多维度挑战。在领域问题层面,土耳其语属于低资源语言,其编程指令数据匮乏,且语法结构复杂,形态变化丰富,导致数据构建难度大;同时,多语言代码生成模型在土耳其语上的性能评估缺乏统一基准,限制了模型优化。在构建过程中,挑战包括:1)确保指令的多样性和覆盖度,涉及23个类别、每个类别约5万样本的均衡生产,需平衡主题分布与难易程度;2)保持土耳其语的自然性和流畅性,避免机器翻译痕迹,要求人工审核与语言专家参与;3)数据规模庞大(448K+),需设计高效的生产流程和token分类策略,以支持模块化加载;4)后续扩展至更多类别和更新样本时,需维护数据一致性与质量。这些挑战促使团队不断迭代,优化数据构建方法。
常用场景
经典使用场景
该数据集为土耳其语Python指令微调领域提供了大规模、细粒度的训练语料,其核心使用场景聚焦于大型语言模型(LLM)的指令微调与代码生成任务。通过涵盖核心语法、面向对象编程、数据结构与算法等基础范畴,并依据128至512不等的token长度进行模块化切分,研究者得以针对不同上下文长度和计算资源的模型进行定制化训练,从而提升模型对土耳其语编程指令的理解与执行能力。该数据集的多级分类体系亦支持构建领域专家模型,例如专门针对算法或OOP的微调子模型,为多语言代码智能体的研发奠定了数据基础。
实际应用
该数据集在实际应用层面主要服务于土耳其语代码助手、教育平台及软件开发工具链的智能化升级。在工业界,它可用于微调代码补全引擎、自动缺陷修复系统以及技术文档生成器,使其能准确响应用土耳其语描述的编程需求。此外,面向初学者的编程教育场景中,该数据集的指令对(即问题与答案)可被整合进交互式学习系统,提供土耳其语语境下的示例讲解与练习反馈,有效弥合非英语母语者的编程学习鸿沟。企业亦能据此构建面向内部代码库的问答或审查辅助工具,提升开发效率并降低语言障碍带来的协作成本。
衍生相关工作
此数据集的发布催生了若干下游研究脉络:其一,研究者基于其模块化结构构建了多任务学习框架,将语法、OOP与算法指令联合用于多任务微调,以探索任务间知识的迁移效益。其二,该数据集被用作评估和改进多语言模型(如CodeLlama、StarCoder)在土耳其语上的零样本与少样本性能基准,衍生出针对低资源代码语言的评测集与微调策略研究。其三,其token-split设计启发了对动态长度指令建模的探索,相关衍生工作包括设计长度感知的注意力机制或动态批处理训练方案,以适配不同推理约束。这些续作不仅扩展了原始数据的应用边界,也反哺了多语言代码智能的基础研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务