遇见数据集

nouchi-lexicon

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

Nouchi Lexicon是一个专注于科特迪瓦城市俚语Nouchi的词典数据集。Nouchi是一种起源于20世纪70-80年代阿比让的城市混合语,融合了标准法语词汇、当地语言(如马林克语、巴乌莱语、贝特语)和流行创意表达,已发展成为真正的城市克里奥尔语。该数据集旨在记录和保存这种独特的语言现象,支持相关自然语言处理研究。数据集包含125个词条,每个词条提供以下结构化信息:Nouchi术语、法语翻译、使用示例、语法类别(名词、动词、形容词、表达、感叹词)、语言语境(常用、俚语、流行、口语化),以及可选的拼写变体和词源信息。数据分布以名词为主(45%),其次是动词(28%)、形容词(15%)、表达(8%)和感叹词(4%)。该数据集适用于多种自然语言处理任务,包括文本分类、机器翻译(Nouchi↔法语)、文本生成、命名实体识别、词嵌入和对话系统开发。数据通过实地观察、数字内容分析、音频转录和学术资料收集,并经过母语者和语言学家验证,确保语义有效性和分类准确性。数据集采用MIT许可证发布,支持社区贡献新词条。

Nouchi Lexicon is a lexical dataset focused on Nouchi, an urban slang from Côte dIvoire. Nouchi originated in Abidjan during the 1970s-1980s as a mixed urban language, blending standard French vocabulary, local languages (such as Malinke, Baoule, and Bete), and popular creative expressions, evolving into a true urban creole. This dataset aims to document and preserve this unique linguistic phenomenon, supporting natural language processing research. It contains 125 entries, each providing structured information: Nouchi term, French translation, usage examples, grammatical category (noun, verb, adjective, expression, interjection), linguistic context (common, slang, popular, colloquial), and optional spelling variants and etymological details. The data distribution is dominated by nouns (45%), followed by verbs (28%), adjectives (15%), expressions (8%), and interjections (4%). The dataset is suitable for various NLP tasks, including text classification, machine translation (Nouchi↔French), text generation, named entity recognition, word embeddings, and dialogue system development. Data was collected through field observations, digital content analysis, audio transcriptions, and academic sources, and validated by native speakers and linguists to ensure semantic validity and classification accuracy. It is released under the MIT license and supports community contributions of new entries.

创建时间:
2026-07-27
原始信息汇总

数据集概览

Nouchi Lexicon (Ivorian Slang) 是一个专注于科特迪瓦城市俚语 Nouchi 的词库数据集,旨在为自然语言处理(NLP)任务提供结构化的语言资源。

数据集核心信息

属性
数据集名称 Nouchi Lexicon (Ivorian Slang)
许可证 MIT
主要语言 法语(fr)、努奇语(nouchi)
标签 nouchi, ivory-coast, slang, nlp, dictionary, african-languages, code-switching, urban-linguistics
数据集大小 n<1K(训练集:125条示例)
任务类别 文本分类、词元分类、翻译、掩码填充

数据特征与结构

数据集包含以下特征字段:

字段名 数据类型 描述 示例
mot_nouchi string 努奇语词汇 "Gbô"
traduction_francais string 法语翻译/定义 "Travail, activité rémunérée"
exemple_usage string 用法示例 "Gbô là, on va au maquis ce soir !"
categorie enum 语法类别(名词、动词、形容词、表达、感叹词) "Nom"
contexte enum 语境/语域(日常、俚语、通俗、口语) "Argotique"
variantes_orthographiques string (可选) 其他拼写变体 "Gbo, Gboh"
origine_linguistique string (可选) 语言来源 "Baoulé"
date_ajout timestamp 添加日期 "2026-07-26"

数据集划分:仅包含训练集(train),共125条数据,文件大小为15,000字节。

数据样例

json [ { "mot_nouchi": "Gbô", "traduction_francais": "Travail, activité rémunérée, business", "exemple_usage": "Mon gbô là, ça rapporte bien cette semaine !", "categorie": "Nom", "contexte": "Argotique", "variantes_orthographiques": "Gbo, Gboh", "origine_linguistique": "Baoulé", "date_ajout": "2026-07-26" }, { "mot_nouchi": "Bluffer", "traduction_francais": "Mentir, exagérer, raconter des histoires", "exemple_usage": "Arrête de bluffer, on sait que cest pas vrai !", "categorie": "Verbe", "contexte": "Populaire", "variantes_orthographiques": "Blufé", "origine_linguistique": "Français (détournement)", "date_ajout": "2026-07-26" } ]

数据收集方法

数据通过以下途径收集并验证:

  • 实地观察:在阿比让及其街区进行田野调查。
  • 数字内容分析:分析社交媒体、音乐等网络资源。
  • 音频记录:记录自然对话。
  • 学术来源:参考论文和研究文章。
  • 多方验证:由母语者、语言学家进行交叉验证,并确保标注者间达成共识。

潜在应用场景

该数据集可用于多种NLP任务,包括但不限于:

  • 文本分类:语言检测、情感分析、内容审核。
  • 翻译:努奇语与法语之间的机器翻译、聊天机器人、语音助手。
  • 文本生成:创意内容生成、故事叙述。
  • 命名实体识别(NER):俚语提取、文化术语识别。
  • 词嵌入:语义向量表示、语言模型。
  • 对话系统:对话代理、自动回答。

使用方式

可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset dataset = load_dataset("kouame09/nouchi-lexicon")

扩展信息

  • 数据集地址:https://huggingface.co/datasets/princekouame1/nouchi-lexicon
  • 贡献方式:通过 Fork 仓库、创建分支、提交 Pull Request 的方式贡献新词条,需遵循指定的 YAML 格式,并满足真实性、准确性、完整性等验证标准。
搜集汇总
数据集介绍
nouchi-lexicon 数据集图片
构建方式
Nouchi Lexicon数据集系统性地收录了科特迪瓦阿比让地区自20世纪70至80年代兴起的都市克里奥尔语——努奇语(Nouchi)的核心词汇。该数据集通过田野调查、数字内容分析、自然对话录音及学术文献检索等多渠道采集原始语料,经由母语者与语言学家交叉验证,确保词条定义与分类的准确性。每个条目包含努奇词、法语释义、使用例句、语法类别及语域语境等信息,部分词条还标注了拼写变体与语言来源,最终以结构化表格形式呈现,并部署于Hugging Face平台。
特点
该数据集的突出特点在于其精细的标注体系与丰富的语言学信息。每个词条不仅涵盖努奇词及其法语翻译,还提供真实语境下的使用例句,并依据词性划分为名词、动词、形容词、表达与感叹词五类,同时根据语言正式程度区分为日常、俚语、流行与口语四种语境。此外,部分条目记录了拼写变体与词源信息,包括源自法语转义、本土语言借词或新造词等,为后续词源学研究提供了宝贵数据。
使用方法
该数据集可便捷地通过Hugging Face的datasets库加载,直接调用`load_dataset`函数即可获取所有词条。用户可按语法类别进行筛选,如提取所有动词条,或构建简单的努奇-法语翻译词典。在自然语言处理应用中,该数据可用于文本分类中的俚语检测、命名实体识别中的文化术语提取、以及努奇语与法语之间的机器翻译等任务,尤其适用于开发面向科特迪瓦青年群体的语料分析与人机对话系统。
背景与挑战
背景概述
Nouchi-lexicon数据集诞生于对西非科特迪瓦都市俚语Nouchi的系统性记录需求之中。该数据集由研究者kouame09于2026年7月创建,聚焦于一种自1970-1980年代在阿比让平民区萌芽、融合法语、马林克语、巴乌莱语等本土语言及民间创造力的城市克里奥尔语。其核心研究问题在于为这一长期被主流自然语言处理(NLP)体系忽视的边缘语言变体建立首个结构化、可计算的语言资源。作为全球范围内专门针对Nouchi的首个开放词典数据集,它填补了非洲城市俚语在数字人文与计算语言学交叉领域的空白,为低资源语言的技术赋能提供了重要范本,对推动多语种NLP的包容性发展具有不可忽视的奠基意义。
当前挑战
Nouchi-lexicon数据集所应对的领域挑战首先在于非洲城市俚语的数字化边缘化——这类语言变体缺乏标准正字法、稳定语料库及大规模标注工具,导致其在文本分类、命名实体识别、机器翻译等经典NLP任务中几乎缺席。构建过程中则面临三重具体挑战:其一,语义锚定的不确定性,Nouchi词汇常具有多源混成与语境依赖性,准确翻译与用例如法语的精确对应极为困难;其二,标注规范的制定,需在词性归类(如动词、名词)与语境层级的划分上达成跨地区访谈者间的高度共识;其三,数据稀疏性的克服,由于Nouchi以口头传播为主,从社交媒体、歌词、田野录音中提取的样本规模有限,需在设计上通过多轮母语者验证来保障词典的覆盖率与代表性。
常用场景
经典使用场景
在自然语言处理领域,Nouchi词表数据集主要用于构建面向科特迪瓦都市俚语的词嵌入模型与语言识别系统。研究者借助该数据集中标注的词条、法语翻译及使用示例,能够训练专门针对Nouchi语言的文本分类器,完成对该非标准法语变体的自动检测与语义解析。该词典收录了包含名词、动词、形容词等多种词性的词条,并附有语境等级与词源信息,为跨语言词义消歧、语码转换分析以及低资源语言的形态学建模提供了坚实的基准资源。通过该数据集,学界得以系统性地探索都市克里奥尔语的词汇化模式与语义演变机制。
衍生相关工作
基于Nouchi词表,研究社区已衍生出多项具有影响力的下游工作。在语言资源建设方面,该数据集启发了面向其他非洲都市俚语的词典构建项目,如塞内加尔的Wolof街头俚语词库与尼日利亚的Pidgin口语词汇集。在模型层面,研究者利用数据集的分类标签与使用示例,微调出首个专用于Nouchi的命名实体识别器与语码转换检测模型。同时,该数据集被用作跨语言词典对齐的评估标准,推动低资源语言术语库的自动构建技术发展。这些成果共同彰显了Nouchi词表作为西非数字人文研究基石的深远影响。
数据集最近研究
最新研究方向
当前,Nouchi Lexicon数据集的问世为非洲城市俚语的自然语言处理研究开辟了全新疆域。作为科特迪瓦阿比让都市青年文化的重要载体,Nouchi这一融合法语、地方语言与创造性表达的独特克里奥尔语,正借助该数据集在多个前沿方向获得突破性应用。研究者们正积极探索其在代码转换建模中的潜力——通过捕捉Nouchi与标准法语间的动态切换模式,为多语种对话系统的语义理解注入文化特异性;同时,该数据集也成为低资源语言词嵌入训练的宝贵素材,助力构建能够精准识别西非城市话语中俚语实体与社会文化语境的语言模型。随着非洲数字内容生态的蓬勃发展,Nouchi Lexicon不仅推动了濒危语言变体的数字化保存,更在情感分析、社交机器人等热点课题中彰显其独特价值,为跨文化自然语言理解提供了不可替代的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务