NaijaMed_QA_Dataset
收藏资源简介:
该数据集包含尼日利亚一个专门医疗论坛上的问题和由持牌医疗专业人员提供的回答。数据反映了尼日利亚背景下的健康问题,包括英语和当地口语。所有答案都是可靠的,因为平台限制了只有经过验证的医疗专业人员才能回复,确保了信息的质量和可信度。数据集包含336,681个GPT-2令牌,涵盖了1,731个问题和2,639个回复/评论。数据是从一个在线平台的开放论坛页面收集的,该平台在2018年至2022年间为尼日利亚公众提供免费建议和答案。数据经过去重、手动审查和标准化处理。数据集的结构包括线程ID、类别ID、类别名称、问题文本、问题令牌数、问题文本长度、问题语言概率、答案文本、答案令牌数、答案文本长度和答案语言概率。该数据集可用于自然语言处理、医疗分析和聊天机器人训练。
Nigerian Healthcare Forum Q&A Dataset
数据集概述
该数据集包含尼日利亚人在一个专门的医疗论坛上提出的问题以及由持牌和训练有素的医疗专业人员提供的回答。这些问题反映了尼日利亚背景下的健康问题,包括英语和当地口语。所有答案都是可靠的,因为平台限制了验证的医疗专业人员的回复,确保了信息的质量和可信度。数据集总共包含336,681个GPT-2令牌。
数据收集
数据从2018年至2022年间在一个在线平台的开放论坛页面上收集,该平台为尼日利亚公众提供免费建议和回答。数据包括:
- 1,731个问题
- 2,639个回复/评论 数据从平台关闭后的MySQL转储中提取。
数据清洗
清洗过程包括:
- 去重:删除重复条目以确保唯一性。
- 手动审查:验证数据的准确性和相关性。
- 标准化:标准化数据格式以匹配其他相关数据集的质量。
数据集结构
| 字段 | 类型 | 描述 |
|---|---|---|
thread_id |
string | 原始线程的ID |
category_id |
string | 类别的ID |
category_name |
string | 类别的对应名称 |
Question |
string | 提问的文本 |
Question_token_count |
integer | 问题文本中的GPT-2令牌数量 |
Question_text_length |
integer | 问题文本的长度(以字符为单位) |
Question_language_probability |
float | 语言检测算法的置信度分数 |
Answer |
string | 给出的回答文本 |
Answer_token_count |
integer | 回答文本中的GPT-2令牌数量 |
Answer_text_length |
integer | 回答文本的长度(以字符为单位) |
Answer_language_probability |
float | 语言检测算法的置信度分数 |
注:行包含问题及其答案/回复/评论(具有相同线程ID的多行)。因此,一个问题可能有多于一个答案/回复/评论。
使用方法
该数据集可用于:
- 自然语言处理(NLP):训练模型处理尼日利亚英语和当地口语。
- 医疗分析:了解尼日利亚普遍的健康问题。
- 聊天机器人训练:开发尼日利亚背景下的医疗支持AI助手。
许可证
MIT
引用
如果您在研究中使用此数据集,请引用为: @dataset {NaijaMed_QA_Dataset}, title = {Nigerian Healthcare Forum Q&A Dataset}, author = {Ayomide Owoyemi} year = {2024}, publisher = {Hugging Face Datasets}, version = {1.0.0}, url = {https://huggingface.co/datasets/Ayomidejoe/NaijaMed_QA_Dataset}, }




