遇见数据集

Turkish-Python-Expert-Dataset-PY_CORE-DATA_STRUCTURES-130k

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集是一个面向土耳其语使用者的 Python 专家指令数据集,包含约 130,000 条高质量指令对,用于自然语言代码生成和调试。V2 版本在原有 60,000 条基础 Python 指令基础上,新增了 70,000 条高级/专家级场景,涵盖网络架构、Python 内部机制及混合技能问题。数据集按渐进式软件工程课程设计,分为 27 个类别,包括基础语法、数据结构、算法、面向对象、函数式编程、文件 I/O、数据库、Web 框架、网络、并发、异步、测试、安全、DevOps、Shell、性能优化、调试、通信、系统工具、集成项目,以及 V2 新增的 Web 抓取、任务队列、高级类型系统和 Python 内部机制。数据格式为 ChatML/Alpaca 指令格式,语言为纯正土耳其语,无翻译痕迹。适用于训练土耳其语代码助手、高级系统机器人以及学术研究中的 Code-LLM 基准测试。数据集由 Hakan Ttkr (Bysismo) 设计,采用 MIT 许可证。

This dataset is a Python expert instruction dataset for Turkish speakers, containing approximately 130,000 high-quality instruction pairs for natural language code generation and debugging. The V2 version adds 70,000 advanced/expert-level scenarios on top of the original 60,000 basic Python instructions, covering network architecture, Python internals, and hybrid skill problems. The dataset is designed according to a progressive software engineering curriculum and is divided into 27 categories, including basic syntax, data structures, algorithms, object-oriented programming, functional programming, file I/O, databases, web frameworks, networking, concurrency, asynchronous programming, testing, security, DevOps, shell, performance optimization, debugging, communication, system tools, integrated projects, and V2 additions such as web scraping, task queues, advanced type systems, and Python internals. The data format is ChatML/Alpaca instruction format, and the language is pure Turkish without translation traces. It is suitable for training Turkish code assistants, advanced system bots, and Code-LLM benchmarks in academic research. The dataset is designed by Hakan Ttkr (Bysismo) and licensed under MIT.

创建时间:
2026-07-29
原始信息汇总

数据集概述

Turkish Python Expert Dataset - 130K (V2) 是一个面向土耳其语软件开发者和人工智能助手的高质量Python指令微调数据集,包含约130,000条训练数据,专注于自然语言下的Python代码生成与调试任务。

基本信息

  • 语言: 土耳其语 (tr)
  • 任务类型: 文本生成、问答
  • 标签: python、coding、networking、instruction-tuning、synthetic-data
  • 许可协议: MIT License(开放学术和商业使用)
  • 数据集格式: ChatML / Alpaca Instruction Format
  • 开发者: Hakan Ttkr (Bysismo)

版本与规模

  • V1(基础版): 包含60,000条“基础Python”问题
  • V2(更新版): 新增70,000条高级/专家级场景,涵盖网络架构、Python核心机制及“混合”技能场景
  • 当前总行数: 约130,000+ 行

核心内容与分类

本次发布聚焦于 PY_CORE(Python核心:基础语法、内置函数)和 DATA_STRUCTURES(数据结构:列表、字典、集合、deque等),包含14,000个独立问题。数据集设计的课程体系共涵盖27个类别,包括:

  • 基础层: PY_CORE、DATA_STRUCTURES、ALGORITHMS(进行中)
  • 进阶层: OOP、FUNCTIONAL、FILE_IO、DATABASE、WEB_BASICS
  • 框架层: FASTAPI、FLASK、DJANGO、NETWORKING、CONCURRENCY、ASYNC
  • 工程层: TESTING、SECURITY、DEVOPS、SHELL、PERFORMANCE、DEBUGGING
  • 专家层(V2新增): WEB_SCRAPING、TASK_QUEUES、ADVANCED_TYPING、PYTHON_INTERNALS

新增特性

  • 混合交叉引擎: V2引入了跨多类别组合的复杂架构问题(例如FastAPI + Celery + Pytest + eBPF组合场景)
  • 自然土耳其语: 所有内容以流畅、非翻译腔的土耳其语编写,模型可直接给出清晰答案

应用场景

  • 训练土耳其语代码助手(类似GitHub Copilot)的监督微调(SFT)阶段
  • 构建高级系统级AI模型,处理网络命名空间、eBPF、内存管理等CPython底层问题
  • 作为土耳其语Code-LLM性能基准测试的基础数据资源
搜集汇总
数据集介绍
Turkish-Python-Expert-Dataset-PY_CORE-DATA_STRUCTURES-130k 数据集图片
构建方式
该数据集是土耳其语Python专家数据集V2版本,由Hakan Ttkr(Bysismo)基于AI数据集架构原则构建。在V1版本60,000条基础Python问题之上,新增70,000条高级场景,使总规模达到130,000条。V2新增内容涵盖网络架构、Python内核(内部机制)以及跨多个技能领域的混合场景。数据集以ChatML/Alpaca指令格式组织,所有问题和答案均以自然流畅的土耳其语撰写,确保无翻译痕迹。构建过程采用系统化的课程设计,将问题按难度分层,并引入混合交叉引擎,将不同类别的知识(如FastAPI、Celery、Pytest等)整合到复杂的架构问题中,从而提升模型的综合推理能力。
使用方法
该数据集主要面向土耳其语代码助手和高级系统机器人的监督微调(SFT)阶段。研究人员可以使用它来微调模型,使其能够生成带有土耳其语注释的代码、回答复杂的Python问题,尤其是在网络命名空间、eBPF和内存管理等高级主题上。数据集常用于学术研究中的基准测试,以评估土耳其语代码语言模型的能力。使用时,数据需按照ChatML/Alpaca格式解析,并以指令-响应对的方式输入模型。该数据集支持Python生态的多个框架,如FastAPI、Django、Flask,适合用于构建特定领域的问答系统。用户可以通过HuggingFace平台直接下载,并依据MIT许可证自由使用在学术或商业项目中。
背景与挑战
背景概述
土耳其语Python专家数据集(Turkish-Python-Expert-Dataset-PY_CORE-DATA_STRUCTURES-130k)由Hakan Ttkr(Bysismo)于2026年8月发布,是旨在构建包含1000万条土耳其语Python编程指令的宏大课程体系中的第二阶段(V2)成果。该数据集专注于Python核心与数据结构主题,包含14,000个独特问题,并扩展至130,000条指令,涵盖从基础语法到高级并发、网络编程等23个类别,以及新增的网页抓取、任务队列、高级类型标注和Python内部机制等专家级(Tier 5)类别。其核心研究问题在于为土耳其语开发者与AI助手提供高质量、自然语言的代码生成与调试指令,以弥补非英语编程数据资源的匮乏。该数据集在土耳其语代码语言模型微调与学术基准测试中具有重要影响力,为跨语言编程教育和技术发展提供了基础资源。
当前挑战
该数据集面临的挑战主要源于领域问题与构建过程。领域问题方面,土耳其语编程资源稀缺,现有模型多基于英语数据,导致土耳其语代码生成与调试能力不足,尤其缺乏针对高级和专家级场景的指令数据。构建过程中,确保数据的高质量与自然性是一大挑战,要求避免机器翻译的痕迹,并生成流畅、准确的土耳其语技术文本。此外,数据集的规模扩展需平衡广度和深度,从V1的6万条基础问题到V2新增的7万条高级场景,需精心设计多类别交叉的混合问题,并确保语法正确性与逻辑一致性。同时,标注成本高,需依赖领域专家人工审核,而未来扩展至1000万条的目标更对数据生成效率和多样性提出了严峻考验。
常用场景
经典使用场景
该数据集专为土耳其语开发者、学生及人工智能助手精心打造,核心用途在于指令微调(Instruction Tuning)与文本生成任务的模型训练。其涵盖从Python核心语法到高级数据结构的14,000道独特问题,并延伸至网络编程、并发处理等23个主题类别。研究者可借此构建能够理解土耳其语自然语言指令并生成高质量Python代码的对话式AI系统,助力代码生成、调试及解释等经典任务的模型优化。
解决学术问题
该数据集着力解决非英语环境下代码语言模型(Code-LLM)训练数据匮乏的难题,为土耳其语领域提供了结构化的教学级数据。通过分阶段课程设计(从基础到专家级),它支持对模型在跨语言编程理解、代码生成准确性及调试能力上的系统性评估,填补了土耳其语代码智能研究的空白,为跨语言自然语言处理与程序合成研究提供了宝贵的基准资源。
实际应用
在实际应用中,该数据集可用于微调类Copilot的代码助手,使其能理解土耳其语注释与指令,生成符合语境的代码片段。同时,它能驱动高级系统管理机器人,解答关于CPython内部机制、内存管理等尖端问题。此外,该数据还能为土耳其语编程教育平台提供个性化练习生成,助力自动化代码审查系统,以及开发面向土耳其语用户的技术支持聊天机器人,显著提升本土化AI工具的实用性。
数据集最近研究
最新研究方向
随着土耳其语自然语言处理与代码生成研究的深度融合,Turkish-Python-Expert-Dataset-PY_CORE-DATA_STRUCTURES-130k作为一项大规模指令微调资源,正引领低资源语言编程助手的范式革新。该数据集以Python核心语法与数据结构为基石,构建了14,000道高质量问答对,覆盖内置函数、列表、字典、集合及deque等关键主题,为土耳其语Code-LLM提供了稀缺的监督微调语料。当前研究前沿聚焦于利用此类结构化指令集增强模型在代码生成、调试及解释任务中的语义理解能力,尤其注重消除机器翻译痕迹,确保输出流畅纯粹。该数据集的迭代扩展至130,000条目,并规划向千万级规模迈进,反映了区域语言模型从通用文本生成向领域专业化演进的趋势,对评测土耳其语代码智能水平、推动多语言编程教育技术及促进本地化软件开发具有里程碑意义,也为跨语言代码迁移学习提供了坚实基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务