amkyawdev/mm-llm-coder-dataset
收藏资源简介:
该数据集是一个双语(缅甸语和英语)的编程指令数据集,主要用于训练缅甸语编程语言模型(LLMs)。数据集包含400万条样本,其中缅甸语和英语各占一半。数据格式为Parquet,包含训练集。数据集的结构包括指令、消息(多轮对话)、类别、语言、难度和任务类型等字段。类别分为9种,难度分为初级、中级和高级。数据集的使用场景包括缅甸语编程助手训练、跨语言代码问答、指令调优、代码调试助手和特定主题微调等。
This dataset is a bilingual (Myanmar and English) coding instruction dataset designed primarily for training Myanmar language Coder LLMs. The dataset contains 4 million samples, with 2 million in Myanmar and 2 million in English. The data format is Parquet, including a training set. The dataset structure includes fields such as instruction, messages (multi-turn conversation), category, language, difficulty, and task type. There are 9 categories and 3 difficulty levels (beginner, intermediate, advanced). The dataset is intended for use cases such as Myanmar Coder LLM training, cross-lingual code Q&A, instruction tuning, code debugging assistants, and topic-specific fine-tuning.




