Code-170k-shona
收藏资源简介:
Code-170k-shona是一个包含176,999个编程对话的数据集,这些对话是从glaiveai/glaive-code-assistant-v2翻译成Shona语言的,使得Shona语使用者能够接触编码教育。它包含纯Shona语言的对话,涵盖各种编程概念的多轮对话,适用于训练Shona语言的编码助手、构建教育工具、研究多语言代码生成、创建Shona语言的编程教程以及支持低资源语言的AI开发。
Code-170k-shona is a dataset consisting of 176,999 programming dialogues. These dialogues are translated from the glaiveai/glaive-code-assistant-v2 dataset into the Shona language, with the goal of making coding education accessible to Shona-speaking users. The dataset features purely Shona-language multi-turn conversations covering diverse programming concepts, and is applicable for training Shona-language coding assistants, building educational tools, conducting research on multilingual code generation, creating Shona-language programming tutorials, and supporting AI development for low-resource languages.
Code-170k-shona 数据集概述
数据集基本信息
- 数据集名称: Code-170k-shona
- 数据集地址: https://huggingface.co/datasets/michsethowusu/Code-170k-shona
- 许可证: Apache 2.0
- 语言: 绍纳语 (sn)
- 任务类别: 文本生成、问答
- 规模分类: 100K<n<1M
数据集规模
- 训练集样本数量: 176,999
- 训练集大小: 328,319,793 字节
- 下载大小: 164,159,896 字节
- 数据集总大小: 328,319,793 字节
数据集描述
Code-170k-shona 是一个突破性的数据集,包含 176,999 个编程对话,最初来源于 glaiveai/glaive-code-assistant-v2 并翻译成绍纳语,使绍纳语使用者能够接触编程教育。
主要特征
- 176,999 个高质量对话,涉及编程和编码
- 纯绍纳语 - 普及编程教育
- 多轮对话,涵盖各种编程概念
- 多样化主题: 算法、数据结构、调试、最佳实践等
- 适用于大型语言模型的指令调优
数据格式
数据字段
conversations: 对话轮次列表,每个轮次包含:from: 说话者("human" 或 "gpt")value: 绍纳语的消息内容
示例结构
python { "conversations": [ { "from": "human", "value": "[绍纳语问题]" }, { "from": "gpt", "value": "[绍纳语回答]" } ] }
使用场景
- 训练绍纳语编码助手
- 为绍纳开发者构建教育工具
- 研究多语言代码生成
- 创建绍纳语编程教程
- 支持低资源语言人工智能开发
标签
- code
- programming
- sn
- shona
- african-languages
- low-resource
- multilingual
- instruction-tuning




