justtherightsize/it-slama-10
收藏资源简介:
该数据集是一个多语言对话数据集,专为监督微调(SFT)设计,包含约46.7万个训练样本和约4,700个测试样本。数据集特征包括对话内容(角色和内容)、语言、来源、原始ID、指令类型(如问答、编码、创意写作、数学推理等)、指令是否翻译、输出类型、输出是否翻译、来源数据集(如EuroBlocks、Bactrian-X、OSCAR、WikiHow等)和语言组。数据覆盖多种任务类型和来源,支持多语言处理,适用于自然语言处理模型的训练和评估。
This dataset is a multilingual dialogue dataset designed for supervised fine-tuning (SFT), containing approximately 467,000 training samples and about 4,700 test samples. Features include conversations (role and content), language, origin, original ID, instruction type (e.g., question answering, coding, creative writing, mathematical reasoning), whether instruction is translated, output type, whether output is translated, origin dataset (e.g., EuroBlocks, Bactrian-X, OSCAR, WikiHow), and language group. It covers multiple task types and sources, supports multilingual processing, and is suitable for training and evaluating natural language processing models.




