AmkyawDev-Dataset
收藏资源简介:
AmkyawDev-Dataset 是一个用于 AI 语言模型训练的缅甸语(Burmese)对话数据集。该数据集包含多种类别的对话数据,包括常识、编程、问候语、翻译、对话、数学、角色扮演等。数据集采用 JSONL 格式,每条记录包含唯一的 ID、系统指令或提示、用户输入/查询、预期的 AI 响应、主类别、子类别、语气、正式程度、难度级别、语言代码、相关关键词、情感基调、响应长度、上下文需求、数据来源以及额外的元数据(如创建日期、作者、审核状态等)。数据集分为训练集、验证集和测试集,共计 29,100 条记录。该数据集适用于缅甸语对话 AI 模型的训练和评估,可通过 HuggingFace 的 datasets 库加载使用。数据集采用 bigscience-openrail-m 许可证,由 amkyawdev 创建和维护。
AmkyawDev-Dataset is a Burmese conversational dataset intended for AI language model training. This dataset covers multiple categories of conversational data, including common sense, programming, greetings, translation, general dialogue, mathematics, role-playing, and others. It is stored in JSONL format, with each record containing a unique ID, system instruction or prompt, user input/query, expected AI response, main category, subcategory, tone, formality level, difficulty level, language code, relevant keywords, emotional tone, response length, context requirement, data source, and additional metadata (such as creation date, author, review status, etc.). The dataset is split into training, validation and test sets, with a total of 29,100 records. This dataset is suitable for training and evaluating Burmese conversational AI models, and can be loaded and used via HuggingFace's datasets library. It is released under the bigscience-openrail-m license, and was created and maintained by amkyawdev.
AmkyawDev-Dataset 数据集概述
数据集简介
这是一个用于AI语言模型训练的缅甸语(Burmese)对话数据集。
数据集描述
该数据集包含缅甸语的对话数据,涵盖多种类别,包括通用知识、编程、问候语、翻译、对话、数学、角色扮演等。
数据集结构
数据格式
数据集采用JSONL格式,每行包含一个JSON对象。
字段说明
id: 每个条目的唯一标识符instruction: 系统指令或提示input: 用户输入/查询output: 预期的AI响应category: 主类别(问候语、编程、翻译等)sub_category: 用于更具体分类的子类别tone: 响应语气(polite_burmese、neutral_burmese等)formality: 正式程度(high、medium、low)difficulty: 难度级别(easy、medium、hard)language: 语言代码(my表示缅甸语)keywords: 相关关键词列表emotion: 响应的情感基调response_length: 预期响应长度(short、medium、long)context_required: 是否需要上下文source: 数据来源(human_generated、ai_generated)metadata: 附加元数据(日期、作者、审核状态)
数据集文件
train.jsonl: 9,700行,训练数据validation.jsonl: 9,700行,验证数据test.jsonl: 9,700行,测试数据
总计:29,100行
数据类别
- greeting: 问候语和日常对话
- coding: 编程/代码相关对话
- translation: 翻译任务
- conversation: 通用对话数据
- general: 通用知识问答
- math: 数学相关问题
- persona: 角色扮演对话
- conversational_greeting: 友好问候响应
语言
- 缅甸语(မြန်မာစာ)
使用方式
python from datasets import load_dataset dataset = load_dataset("amkyawdev/AmkyawDev-Dataset")
或加载特定拆分: python from datasets import load_dataset dataset = load_dataset("amkyawdev/AmkyawDev-Dataset", split="train")
许可证
bigscience-openrail-m
作者
amkyawdev




