skilledu/Malaysian-SFT
收藏资源简介:
Malaysian-SFT 是一个用于监督微调(SFT)的多语言数据集,主要聚焦于马来西亚相关语言和文化内容。数据集包含马来语(ms)、英语(en)、泰米尔语(ta)、中文(zh)和印度尼西亚语(id)等多种语言。它由多个子数据集组合而成,包括公开数据集如 chatgpt4-malaysian-general-qa、llama3-70b-qa 等,以及额外组合的通用目的数据集。数据内容涵盖广泛的任务:通用问答、社交媒体问答、代码指令、方言处理、语法纠错、翻译(如爪夷文与马来语/英语互译)、政治演讲风格、安全响应等。数据集经过后处理,包括字符级和单词级去重、过滤俄语/西里尔字符、异常字符和保留关键词。此外,提供了将数据转换为聊天格式的代码示例,支持系统提示、用户和助理角色。该数据集旨在为大型语言模型提供多语言和多任务的微调样本,适用于马来西亚语境下的自然语言处理应用。
Malaysian-SFT is a multilingual dataset for supervised fine-tuning (SFT), primarily focusing on Malaysian-related languages and cultural content. It includes multiple languages such as Malay (ms), English (en), Tamil (ta), Chinese (zh) and Indonesian (id). The dataset is assembled from multiple sub-datasets, including public resources like chatgpt4-malaysian-general-qa and llama3-70b-qa, as well as additional general-purpose datasets. Its content covers a wide range of tasks: general question answering, social media question answering, code instructions, dialect processing, grammar error correction, translation (e.g., mutual translation between Jawi and Malay/English), political speech style-related tasks, safety response, etc. The dataset has undergone post-processing procedures, including character-level and word-level deduplication, filtering of Russian/Cyrillic characters and abnormal characters, as well as retention of key words. Additionally, code examples for converting the data into chat format are provided, supporting system prompts, user and assistant roles. This dataset aims to provide multilingual and multi-task fine-tuning samples for large language models, and is suitable for natural language processing (NLP) applications in the Malaysian context.




