遇见数据集

ghana-chat-corpus-en

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

Ghana Chat Corpus — English 是一个从ghananlpcommunity/ghana-chat数据集中提取的纯英文对话语料库,旨在作为翻译流程和多语言大语言模型训练的基础英文数据集。该数据集由Owusu, Mich-Seth和加纳NLP社区于2026年创建。数据集包含226,300个训练样本,每个样本代表一条对话。对话被结构化处理:将第一个用户消息单独提取为generated_question字段,而将所有助手回复连接起来(使用 分隔)形成text字段。此外,每个样本还包含source_type(标识来源类别,例如新闻、议会等)和source(原始来源名称)两个元数据字段,用于追溯数据出处。该数据集适用于构建对话系统、机器翻译以及训练需要加纳相关英文对话数据的多语言模型。

Ghana Chat Corpus — English is a pure English dialogue corpus extracted from the ghananlpcommunity/ghana-chat dataset, intended as a foundational English dataset for translation workflows and multilingual large language model (LLM) training. It was created in 2026 by Owusu, Mich-Seth and the Ghana NLP Community. The dataset contains 226,300 training samples, with each sample representing a single dialogue. Dialogues are structured such that the first user message is separately extracted as the `generated_question` field, while all assistant responses are concatenated (separated by ` `) to form the `text` field. Additionally, each sample includes two metadata fields: `source_type` (used to identify the source category, such as news, parliament, etc.) and `source` (the original source name), which serve to trace the data provenance. This dataset is applicable for building dialogue systems, machine translation, and training multilingual models that require English dialogue data related to Ghana.

创建时间:
2026-07-11
原始信息汇总

数据集概述:Ghana Chat Corpus — English

  • 数据集名称:Ghana Chat Corpus — English
  • 数据集地址:https://huggingface.co/datasets/ghananlpcommunity/ghana-chat-corpus-en
  • 语言:英语(en)
  • 许可协议:MIT(mit)
  • 标签:ghana, chat, nlp

数据来源与构建

该数据集是从 ghananlpcommunity/ghana-chat 数据集中提取的纯英文部分。每条对话被拆分为第一个用户消息(作为 generated_question)和所有助手回复(以 `

连接后作为text`)。

数据模式(Schema)

列名 描述
source_type 来源类别(如新闻、议会等)
source 原始来源名称
text 英语对话(所有助手回复连接在一起)
generated_question 对话中的第一条用户消息

数据规模

  • 数据集大小:401,345,393 字节
  • 下载大小:213,137,497 字节
  • 分割:仅包含训练集(train)
    • 训练集样本数:226,300
    • 训练集字节数:401,345,393

预期用途

该英文语料库用于翻译流水线和多语言大语言模型(LLM)训练。

引用

bibtex @software{ghana-chat-corpus, title = {Ghana Chat Corpus — English}, author = {Owusu, Mich-Seth and Ghana NLP Community}, year = {2026}, }

搜集汇总
数据集介绍
ghana-chat-corpus-en 数据集图片
构建方式
该数据集源于加纳NLP社区构建的多元对话语料库,从中提取并整合英语语言资源形成。构建过程中,原始对话被结构化处理,每段对话截取首位用户消息作为提问字段,并将所有助手回复以双换行符拼接成连续文本字段。同时保留源类别与原始来源名称等元信息,以支持后续的分类与溯源需求。最终形成涵盖22.6万条样本、约401MB规模的英文对话数据集。
使用方法
该数据集可直接用于英语对话建模、多语言翻译任务及多轮对话系统的预训练或指令微调。用户可通过HuggingFace的datasets库加载,按source_type字段筛选特定领域数据,或利用generated_question与text字段构建问答对。建议结合其他语言数据混合训练,以提升模型在低资源场景下的跨语言泛化能力。
背景与挑战
背景概述
加纳聊天语料库英文版(Ghana Chat Corpus — English)由Mich-Seth Owusu与加纳NLP社区于2026年创建,旨在为低资源语言场景下的自然语言处理研究提供高质量的英文对话数据。该数据集从更广泛的加纳聊天语料库中提取,保留了新闻、议会等多源类别,专为翻译流水线与多语言大语言模型训练设计。其核心研究问题聚焦于如何利用有限的英文数据增强非英语语言模型的表现,对非洲地区NLP研究具有重要推动作用,为跨语言迁移学习与对话系统构建提供了基础资源。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,加纳及其周边地区语言资源极度匮乏,英文对话数据虽然相对丰富,但将其有效用于翻译以支持本地语言模型训练仍存在语义保真度与领域适应性难题;2)构建过程中,从多源聊天数据中提取干净、一致性强的英文对话需要克服噪声过滤与对话结构标准化问题,而未来扩展至多语言场景时,还将面对对齐精度与覆盖度的挑战。
常用场景
经典使用场景
Ghana Chat Corpus English 数据集作为从加纳本地化对话数据中提取的纯英语子集,其经典应用场景主要聚焦于低资源语言环境下的自然语言处理基线构建。通过将原始多语言对话拆分为首轮用户问题与助手的连续回答,该数据集为面向非洲英语变体的对话系统提供了结构化的训练与评估素材。研究者常将其作为翻译流水线的源语言端,用于开发加纳本土语言(如契维语、加语)到英语的自动翻译模型,或是作为多语言大语言模型预训练时英语语料的补充,以提升模型对西非英语方言的理解能力。
解决学术问题
该数据集致力于缓解低资源语言环境下对话数据稀缺的学术困境,其核心意义在于为非洲英语的变体研究提供标准化基准。在学术层面,它解决了两个关键问题:一是填补了加纳本地语种与英语之间的跨语言对话对齐数据的空白,使得基于序列到序列的神经机器翻译模型能够获得高质量的训练对;二是通过提供来自新闻、议会等多样来源的对话内容,支持针对非标准英语口语特征(如代码混合、语法变异)的语言学分析与建模。这一数据集的发布显著推动了西非英语语料库的建设,为多语言NLP技术在欠发达地区的平等部署奠定了数据基础。
实际应用
在实际应用中,该数据集支撑了一系列面向西非用户的本地化AI服务开发。例如,它可用于训练加纳语境的客服聊天机器人,使系统能够理解当地英文表达中特有的词汇选择与句式结构,从而在银行、医疗或农业咨询场景中提供更精准的响应。此外,通过将该数据集与平行语料结合,开发者能够构建面向加纳多语社区的混合语言翻译引擎,在政务公开、教育资源共享等场景中打破语言隔阂。其在低算力设备上的轻量级微调能力,也使其成为移动端离线对话助手的理想训练源,助力非洲数字包容性的落地。
数据集最近研究
最新研究方向
该数据集聚焦于加纳语境的英文对话语料构建,服务于低资源语言地区的多语言大模型训练与机器翻译研究。通过从加纳本地新闻、议会等多元来源提取真实对话,并结构化拆分为用户问询与助手的连续回复,为跨语言对话系统提供基础训练数据。近期研究热点包括利用该语料进行本地化NLP模型微调、结合零样本翻译技术提升非洲语言覆盖面,以及评估通用大模型在加纳英语变体上的表现,其意义在于推动多语言AI的包容性发展,减少高端语言技术在该地区落地的资源壁垒。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务