Pollon-Instruct-MultiQA
收藏资源简介:
这是一个多语言对话数据集,旨在用于训练对话型AI模型。数据集包含英语、西班牙语和葡萄牙语的对话示例,涵盖了多种类别,如一般聊天、情感支持、任务管理、技术支持、健康与福祉以及教育话题。数据集以JSONL格式存储,每行代表一个对话示例。每个示例包含唯一的标识符、对话类型、类别、用户输入、助手输出和对话语言。
This is a multilingual dialogue dataset designed for training conversational AI models. The dataset contains dialogue examples in English, Spanish and Portuguese, covering various categories such as general chatting, emotional support, task management, technical support, health and well-being, and educational topics. It is stored in JSONL format, with each line representing a single dialogue instance. Each instance includes a unique identifier, dialogue type, category, user input, assistant output and dialogue language.
Pollon-Instruct-MultiQA 数据集概述
基本信息
- 许可证: Apache 2.0
- 任务类别:
- 文本生成
- 问答
- 语言:
- 葡萄牙语 (pt)
- 德语 (de)
- 英语 (en)
- 法语 (fr)
- 西班牙语 (es)
- 数据集名称: Pollon-QA-2775
- 数据规模: n<1K
数据集详情
- 格式: JSONL (JSON Lines)
- 语言:
- 英语 (en)
- 西班牙语 (es)
- 葡萄牙语 (pt)
- 类别:
conversational: 一般和非正式对话emotional_support: 情感支持对话task_management: 任务管理和组织对话technical_support: 技术支持对话health_wellness: 健康和福祉对话educational: 教育和学习对话
- 结构:
id: 对话示例的唯一标识符type: 对话类型category: 对话类别input: 用户初始输入或提示output: 助手的响应leng: 对话语言 (en, es, pt)
示例数据
json {"id": "01", "type": "conversational", "category": "conversational", "input": "Oi", "output": "Olá, como posso ajudar hoje?", "leng": "pt"} {"id": "02", "type": "conversational", "category": "conversational", "input": "Quem é você?", "output": "Sou seu assistente virtual. Como posso ajudar?", "leng": "pt"} {"id": "03", "type": "emotional_support", "category": "emotional_support", "input": "Estou muito triste hoje", "output": "Sinto muito por você estar se sentindo assim. Gostaria de falar sobre o que está te deixando triste? Estou aqui para ouvir.", "leng": "pt"} {"id": "04", "type": "educational", "category": "educational", "input": "Pode me explicar a Segunda Guerra Mundial?", "output": "Claro! A Segunda Guerra Mundial foi um conflito global que ocorreu entre 1939 e 1945, envolvendo a maioria das nações do mundo...", "leng": "pt"}
使用场景
- 用于训练和评估多语言和多领域的对话系统模型。
引用
@dataset{multilingual_conversational_dataset, title = {Multilingual Conversational Dataset}, author = {Gus}, year = {2023}, publisher = {HuggingFace}, doi = {10.5281/zenodo.XXXXXXX}, url = {https://huggingface.co/datasets/PollonTeam/Pollon-Instruct-MultiQA} }




