Code-170k-kanuri
收藏资源简介:
Code-170k-kanuri是一个包含176,999个编程对话的数据集,这些对话是从英文数据集翻译成Kanuri语言的,旨在使Kanuri语使用者能够接受编码教育。对话涵盖了多种编程概念,适用于训练Kanuri语言的编码助手、构建教育工具、进行多语种代码生成研究、创建Kanuri语编程教程以及支持低资源语言的AI开发。
Code-170k-kanuri is a dataset consisting of 176,999 programming dialogues translated from an English-language dataset into the Kanuri language. It is developed to enable Kanuri-speaking users to access coding education. The dialogues cover diverse programming concepts, and can be applied to train Kanuri-language coding assistants, build educational tools, conduct multilingual code generation research, create Kanuri-language programming tutorials, and support AI development for low-resource languages.
Code-170k-kanuri 数据集概述
数据集基本信息
- 数据集名称:Code-170k-kanuri
- 数据集地址:https://huggingface.co/datasets/michsethowusu/Code-170k-kanuri
- 语言:卡努里语(kr)
- 许可证:Apache 2.0
- 数据规模:100K<n<1M
数据集内容
- 数据量:包含176,999个编程对话
- 数据来源:基于glaiveai/glaive-code-assistant-v2数据集翻译为卡努里语
- 数据格式:多轮对话形式
- 主题范围:算法、数据结构、调试、最佳实践等编程概念
数据结构
数据字段
conversations:对话列表,每个对话包含:from:说话者("human"或"gpt")value:卡努里语的消息内容
数据拆分
- 训练集:176,999个样本,317,920,387字节
主要用途
- 训练卡努里语编程助手
- 构建卡努里开发者教育工具
- 多语言代码生成研究
- 创建卡努里语编程教程
- 支持低资源语言AI开发
技术特性
- 适用于文本生成和问答任务
- 支持大语言模型的指令调优
- 专为低资源语言设计
- 多语言编程教育支持
使用方式
python from datasets import load_dataset dataset = load_dataset("michsethowusu/Code-170k-kanuri")




