Code-170k-swati
收藏资源简介:
Code-170k-swati是一个包含176,999个编程对话的数据集,这些对话最初来源于glaiveai/glaive-code-assistant-v2,并翻译成了Swati语,使得编码教育对Swati语使用者更加可及。该数据集适用于训练Swati语言的编码助手、构建教育工具、研究多语言代码生成、创建Swati语的编程教程以及支持低资源语言的AI发展。
Code-170k-swati is a dataset consisting of 176,999 programming conversations. Originally sourced from glaiveai/glaive-code-assistant-v2, these conversations were translated into Swati, thereby enhancing the accessibility of coding education for Swati-speaking users. This dataset is applicable for training Swati-language coding assistants, developing educational tools, conducting research on multilingual code generation, creating Swati-language programming tutorials, and supporting AI development for low-resource languages.
Code-170k-swati 数据集概述
基本信息
- 数据集名称:Code-170k-swati
- 发布年份:2025
- 发布平台:Hugging Face
- 许可证:Apache 2.0
- 语言:斯瓦蒂语(ss)
数据集规模
- 训练集样本数量:176,999
- 训练集大小:327,158,239字节
- 下载大小:163,579,119字节
- 规模分类:100K<n<1M
数据特征
数据结构
- 主要字段:conversations(对话列表)
- 对话结构:
- from:说话者身份("human"或"gpt")
- value:斯瓦蒂语消息内容
数据示例
python { "conversations": [ { "from": "human", "value": "[斯瓦蒂语问题]" }, { "from": "gpt", "value": "[斯瓦蒂语回答]" } ] }
内容特点
- 数据来源:基于glaiveai/glaive-code-assistant-v2翻译
- 内容类型:编程对话
- 对话形式:多轮对话
- 主题范围:算法、数据结构、调试、最佳实践等编程概念
应用场景
- 训练斯瓦蒂语编程助手
- 为斯瓦蒂开发者构建教育工具
- 多语言代码生成研究
- 创建斯瓦蒂语编程教程
- 支持低资源语言AI开发
技术特性
- 任务类别:文本生成、问答
- 标签:代码、编程、斯瓦蒂语、非洲语言、低资源、多语言、指令调优
- 适用模型:大语言模型指令调优
使用方式
python from datasets import load_dataset
dataset = load_dataset("michsethowusu/Code-170k-swati") train_data = dataset[train]




