Code-170k-luganda
收藏资源简介:
Code-170k-luganda是一个包含176,999个编程对话的数据集,这些对话最初来源于glaiveai/glaive-code-assistant-v2,并翻译成卢干达语,使卢干达语使用者能够接触编程教育。数据集包含多轮对话,涵盖各种编程概念,话题多样,包括算法、数据结构、调试、最佳实践等,并且适用于大型语言模型的指令微调。
Code-170k-luganda is a dataset containing 176,999 programming dialogues. Originally sourced from glaiveai/glaive-code-assistant-v2, these dialogues have been translated into Luganda to make programming education accessible to Luganda-speaking users. The dataset features multi-turn dialogues covering a wide range of programming concepts, with diverse topics including algorithms, data structures, debugging, best practices and more, and is suitable for instruction tuning of large language models.
Code-170k-luganda 数据集概述
基本信息
- 数据集名称: Code-170k-luganda
- 数据集地址: https://huggingface.co/datasets/michsethowusu/Code-170k-luganda
- 许可证: Apache 2.0
- 语言: 卢干达语 (lg)
数据集规模
- 训练集样本数量: 176,999
- 训练集大小: 342,380,442 字节
- 下载大小: 171,190,221 字节
核心特征
- 数据格式: 编程对话数据集
- 对话轮次: 多轮对话结构
- 内容类型: 编程和编码相关对话
- 语言特征: 纯卢干达语内容
数据结构
数据字段
conversations: 对话列表from: 说话者身份 ("human" 或 "gpt")value: 卢干达语消息内容
数据示例
python { "conversations": [ { "from": "human", "value": "[卢干达语问题]" }, { "from": "gpt", "value": "[卢干达语回答]" } ] }
任务类别
- 文本生成
- 问答系统
数据集标签
- 代码
- 编程
- 卢干达语
- 非洲语言
- 低资源语言
- 多语言
- 指令调优
使用方式
python from datasets import load_dataset dataset = load_dataset("michsethowusu/Code-170k-luganda") train_data = dataset[train]
数据来源
基于 glaiveai/glaive-code-assistant-v2 数据集翻译为卢干达语




