Code-170k-sango
收藏资源简介:
Code-170k-sango是一个包含176,999个编程对话的数据集,这些对话被翻译成了桑戈语,旨在使编码教育对桑戈语使用者更加容易获取。数据集覆盖了多种编程概念,并适用于训练桑戈语编程助手、构建教育工具等多种场景。
Code-170k-sango is a dataset consisting of 176,999 programming conversations translated into Sango, aiming to make coding education more accessible to Sango-speaking users. The dataset covers a wide range of programming concepts and is applicable to multiple scenarios such as training Sango-language programming assistants and building educational tools.
Code-170k-sango 数据集概述
基本信息
- 数据集名称: Code-170k-sango
- 数据集地址: https://huggingface.co/datasets/michsethowusu/Code-170k-sango
- 许可证: Apache 2.0
- 语言: 桑戈语 (sg)
- 规模分类: 100K<n<1M
数据集描述
Code-170k-sango 是一个包含 176,999 个编程对话的开创性数据集,原始数据来源于 glaiveai/glaive-code-assistant-v2,并翻译为桑戈语,使桑戈语使用者能够获得编程教育。
关键特性
- 176,999 个高质量对话,涵盖编程和编码主题
- 纯桑戈语 - 普及编程教育
- 多轮对话,涵盖各种编程概念
- 多样化主题: 算法、数据结构、调试、最佳实践等
- 适用于大型语言模型的指令调优
数据集结构
数据特征
- conversations: 对话轮次列表,每个轮次包含:
- from: 说话者 ("human" 或 "gpt")
- value: 桑戈语的消息内容
数据分割
- 训练集: 176,999 个样本,366,641,640 字节
数据示例
python { "conversations": [ { "from": "human", "value": "[桑戈语问题]" }, { "from": "gpt", "value": "[桑戈语回答]" } ] }
应用场景
- 训练桑戈语编码助手
- 为桑戈开发者构建教育工具
- 研究多语言代码生成
- 创建桑戈语编程教程
- 支持低资源语言AI开发
技术分类
- 任务类别: 文本生成、问答
- 标签: 代码、编程、桑戈语、非洲语言、低资源、多语言、指令调优
引用格式
bibtex @dataset{code170k_sango, title={Code-170k-sango: Programming Conversations in Sango}, year={2025}, publisher={Hugging Face}, url={https://huggingface.co/datasets/michsethowusu/Code-170k-sango} }




