doric-conversations
收藏资源简介:
Doric Conversations数据集包含合成和人工审核的对话数据,旨在微调大型语言模型,使其能够仅使用Doric(东北苏格兰方言)进行回应。对话涵盖日常话题,并具有聊天式的结构。
The Doric Conversations Dataset comprises synthetic and human-reviewed conversational data, developed for fine-tuning large language models (LLMs) to generate responses exclusively in Doric, the Northeast Scots dialect. The conversations cover everyday topics and feature a chat-style structure.
Doric Conversations 数据集概述
数据集基本信息
- 数据集名称: Doric Conversations
- 主要语言: 多里克苏格兰语(sco)
- 次要语言: 英语(en)
- 许可证: Apache-2.0
- 标签: 多里克语、苏格兰、苏格兰语、对话式、微调
数据集描述
本数据集包含合成数据和人工审核的对话数据,专门用于对大语言模型进行微调,使其能够专门使用多里克语(东北苏格兰方言)进行回复。对话采用聊天式结构,涵盖日常话题、对抗性纯英语请求、多语言提示和自然对话流程。
无论用户使用何种语言(英语/多里克语/其他),助手始终使用多里克语回复。该数据集专门设计用于使用Unsloth库对Gemma、Llama和Mistral等模型进行监督微调。
用途说明
✅ 直接用途
- 微调基础大语言模型以专门使用多里克苏格兰语回复
- 评估多语言到多里克语的翻译行为
- 训练方言对话模型
- 研究低资源语言适应
❌ 超出范围用途
- 通用英语语言建模
- 未经方言验证的正式苏格兰语言学
- 安全关键系统(医疗、法律、财务建议)
- 获取人口统计或个人身份信息
数据结构
每个数据行均为JSON对象: json { "conversations": [ {"from": "human", "value": ""}, {"from": "gpt", "value": """}], "meta": { "topic": "", "kind": "multi", "id": "", "lang": "", "group": "" } }
数据来源
- 基础数据: 使用大语言模型合成生成 + 人工校正整理




