遇见数据集

BanglaCEH

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

BanglaCEH 是一个用于孟加拉语文化纠缠同形词消歧(Culturally Entangled Homograph, CEH)的基准数据集。该数据集来源于论文《When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs》。数据集关注孟加拉语中一个词既是人名又是具有文化内涵的普通名词的现象(例如“মায়া”既是女孩名也表示深情的慈悲)。数据集包含1,516个孟加拉语句子,每个句子中同一个词出现两次,分别具有不同的语义角色(如人名 vs. 概念)。每个出现位置被标注为六种文化类别之一:Name(人名)、Concept(概念)、Emotion(情感)、Emotional State(情感状态)、Collective State(集体状态)、Spiritual(精神)。总标注数为3,032个。数据集中还包含每处出现的文化解释和文化纠缠说明。数据构建过程包括:由母语者人工选词、三个大语言模型生成句子和解释、交叉模型验证、最后由两位母语专家人工审核(Cohens κ = 0.95)。数据集可用于评估孟加拉语和多语言大语言模型的文化理解能力、训练命名实体识别和共指消解、以及低资源语言的知识蒸馏研究。基准测试结果显示,模型在零样本下存在系统性的主导意义偏差(偏向普通名词),而通过文化链式推理(C-CoT)或知识蒸馏微调(QLoRA-KD)可显著降低偏差。该数据集采用CC-BY-4.0许可,大小在1K到10K样本之间。

BanglaCEH is a benchmark dataset for culturally entangled homograph disambiguation (CEH) in Bengali. It originates from the paper When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs. The dataset focuses on words in Bengali that are both personal names and culturally meaningful common nouns (e.g., মায়া is both a girls name and means compassionate affection). It contains 1,516 Bengali sentences, each featuring the same word appearing twice with different semantic roles (e.g., name vs. concept). Each occurrence is annotated into one of six cultural categories: Name, Concept, Emotion, Emotional State, Collective State, and Spiritual. The total number of annotations is 3,032. The dataset also includes cultural explanations and cultural entanglement descriptions for each occurrence. The data construction process includes: manual word selection by native speakers, sentence and explanation generation by three large language models, cross-model validation, and final manual review by two native experts (Cohens κ = 0.95). The dataset can be used to evaluate the cultural understanding ability of Bengali and multilingual large language models, train named entity recognition and coreference resolution, and study knowledge distillation in low-resource languages. Baseline results show that models exhibit systematic dominant sense bias (favoring common nouns) in zero-shot settings, while cultural chain-of-thought (C-CoT) or knowledge distillation fine-tuning (QLoRA-KD) can significantly reduce the bias. The dataset is licensed under CC-BY-4.0 and has a size between 1K and 10K samples.

创建时间:
2026-07-24
原始信息汇总

BanglaCEH:文化纠缠孟加拉语同形异义词基准数据集

数据集概述

BanglaCEH(Culturally Entangled Bangla Homographs)是一个专门用于孟加拉语中“文化纠缠同形异义词”(CEH)消歧的基准数据集。该数据集解决的核心问题是:许多孟加拉语词汇同时是人名和具有文化内涵的普通名词(如 মায়া 既是常见女孩名,又表示“深情 Compassion”;গগন 既是人名,又指“天空”),仅凭频率或分布线索无法正确区分其含义。

基本信息

属性 详情
语言 孟加拉语(bn,孟加拉文)
许可证 CC-BY-4.0
数据规模 1,516 个句子实例(1K < n < 10K)
标注数量 3,032 个词例(每句 2 个)
任务类型 词义消歧(token-classification、text-classification、text-generation)
发布形式 单文件 ceh_knowledge_distillation_final.json,含 train 分割

数据集结构

每个记录为一个 JSON 对象,包含:

  • id:实例编号
  • word_bangla / word_roman:目标词的孟加拉文和罗马化形式
  • category:纠缠类别(如“句内 Name↔Concept”)
  • input:孟加拉语叙事文本及两个标签(label_1、label_2)
  • token_labels:两个词例的标签
  • cultural_entanglement_note:文化纠缠注释
  • 完整 schema 还包括双语论证、文化纠缠段落和逐词例解释

标签体系

数据集包含 6 种文化标签: Name(人名)、Concept(概念)、Emotion(情感)、Emotional State(情绪状态)、Collective State(集体状态)、Spiritual(精神)

纠缠类别分布

类别 数量
人名 ↔ 概念 795
概念 ↔ 情感 193
人名 ↔ 精神 179
人名 ↔ 情感 178
情感 ↔ 状态 171
总计 1,516

词例级标签分布

标签 数量
Name 1,153
Concept 985
Emotional State 345
Collective State 202
Spiritual 187
Emotion 160
总计 3,032

数据集构建流程

  1. 词汇筛选:由一位母语人士手工挑选同时具有人名和文化名词双重含义的词汇
  2. 多模型生成:三种模型(Claude Fable 5、Kimi K3、Gemini 3.5 Flash)分别生成 690、480、344 个实例
  3. 交叉验证:不同模型间互相审核(Claude→Kimi、Kimi→Gemini、Gemini→Claude)
  4. 人工验证:两位母语孟加拉语专家校对,标注者间一致性 Cohens κ = 0.95

数据划分

完整数据集以单文件发布(1,516 条)。论文实验中采用 78% 训练 / 10% 验证 / 12% 测试 的固定随机种子划分。

基准实验结果

实验涵盖零样本、少样本、文化思维链(C-CoT)和 QLoRA 知识蒸馏微调四种模式,核心诊断指标为 Dominant-Bias(模型漏判人名标签、默认采用文化含义读法的频率):

模型 模式 EM ↑ Macro-F1 ↑ Hall. ↓ Bias ↓
Qwen2.5-1.5B 零样本 0.65 0.115 52.90 63.46
Qwen2.5-1.5B C-CoT 30.97 0.300 0.00 2.88
Qwen2.5-1.5B QLoRA-KD 85.16 0.737 1.65 0.00
Llama-3.2-3B 零样本 10.97 0.144 40.00 65.38
Llama-3.2-3B QLoRA-KD 82.42 0.722 1.10 2.80
gemma-3-1b-it 零样本 0.91 0.079 16.13 100.0
TituLLM-1B 零样本 0.11 0.005 100.0 100.0
TituLLM-1B QLoRA-KD 87.91 0.758 1.65 4.20
GPT-4o-mini 零样本 43.87 0.467 0.65 16.35
GPT-4o-mini 少样本 49.68 0.623 0.00 2.88

关键发现

  • 系统性主导含义偏见:零样本下所有开源模型默认采用普通名词含义,漏判人名词例,偏见率 62.5%~100%
  • 语言特定预训练不等于文化基础:孟加拉语专用模型 TituLLM 在零样本输入中 100% 产生幻觉
  • 对比推理有效但非普适:C-CoT 将 Qwen 偏见从 63.46% 降至 2.88% 且零幻觉,但对 Llama 反有负面效果
  • 蒸馏推理优于蒸馏标签:仅蒸馏标签的 EM 为 41.33%、偏见 34.56%;同时蒸馏标签与文化解释可达 EM 85.16%、零偏见
  • 长尾瓶颈:Micro 与 Macro-F1 的差距几乎完全集中在稀有的 Emotion 和 Spiritual 标签上

预期用途

  • 评估孟加拉语和多语言 LLM 的文化基础能力(与表面词汇能力区分)
  • 孟加拉语 NLP 流水线中的人名 vs 概念消歧任务(NER、共指消解、机器翻译)
  • 低资源语言推理蒸馏研究
  • 为其他存在名字-概念纠缠的语言构建类似基准提供模板

局限性

  • 单一策展人筛选词汇:覆盖范围受一人命名知识限制,可能遗漏地域性或小众名字
  • 模型生成文本:句子和解释由 LLM 初始生成,虽经人工验证但仍可能保留机器文本的微妙文体规律
  • 标注者池较小:虽然一致性高(κ=0.95),更多区域和语言背景的标注者会更稳健
  • 计算资源受限的微调:实验基于 1–3B 参数模型的参数高效微调,结果可能不完全适用于更大模型或全参数微调

伦理考量

数据集中的孟加拉语常用人名仅作为合成句子中的通用词项使用,不涉及真实个体。文化注释反映主流孟加拉命名惯例,不应视为对所有孟加拉语社区的穷尽性或权威性描述。

相关资源

  • 论文:https://arxiv.org/abs/2607.17828
  • 代码:https://github.com/ashuvo25/BanglaCEH
搜集汇总
数据集介绍
BanglaCEH 数据集图片
构建方式
BanglaCEH数据集的构建遵循了严谨的多阶段流程。首先,由一位母语为孟加拉语的研究者手工甄选出兼具人名与文化名词双重含义的词汇,如Maya、Asha与Gagan,以确保候选词具有真正的双重解读性。随后,利用三个互补的大型语言模型(Claude Fable 5、Kimi K3与Gemini 3.5 Flash)生成句子与相应的文化解释,并通过轮换交叉验证机制,使每个模型的输出由另一模型审查,从而筛除潜在错误。最后,由两位具有计算机科学背景且精通孟加拉语的专家进行人工核验,对标签、解释及文化推理的准确性进行修正,最终达成Cohen's κ=0.95的高一致性。
特点
该数据集的核心特征在于其聚焦'文化纠葛同形词'(Culturally Entangled Homographs, CEH)现象,即孟加拉语中大量词汇同时作为人名与特定文化概念存在,且两种含义在文化空间中相互交织,难以通过频率或分布特征加以区分。每个样本包含一个孟加拉语句子,其中同一词形出现两次,分别承载不同的语义角色,并标注六类细粒度标签(如Name、Concept、Emotion等)。此外,每条样本附带逐次出现的文化解释与纠缠性注释,为模型提供了丰富的监督信号。数据集的分布揭示了姓名与概念纠缠的普遍性,同时也涵盖了情感与精神等稀有类别,呈现出长尾特征,从而能够有效评估模型在低资源语言上的文化常识推理能力。
使用方法
该数据集的设计支持多种使用方式,便于研究者从不同维度评估与提升模型的孟加拉语文化理解能力。加载数据集时,可通过HuggingFace datasets库直接获取,并依据论文所述比例(78%训练、10%验证、12%测试)进行数据划分。主要使用场景包括:零样本与少样本评估,以检验模型对文化纠缠词义的默认偏向;文化思维链(C-CoT)提示,引导模型进行对比性推理,显著缓解主导意义偏置;以及基于知识蒸馏的微调,特别是将文化解释与标签一同蒸馏,已证明比仅蒸馏标签更能提升性能。此外,该数据集还可用于命名实体识别、指代消解与机器翻译等下游任务,为孟加拉语自然语言处理提供文化敏感的测试基准。
背景与挑战
背景概述
BanglaCEH数据集由孟加拉国联合国际大学的Md. Asaduzzaman Shuvo等人于2026年创建,旨在解决孟加拉语中文化纠缠同形异义词(CEH)的歧义消解问题。该数据集包含1,516个句子和3,032个标注实例,每个实例中同一词形出现两次,分别表示人名和文化概念。其核心研究问题是:在低资源语言模型中,如何识别和区分这类兼具人名与深层文化含义的词汇。该数据集填补了孟加拉语自然语言处理中文化语用知识缺乏的空白,为词义消歧、命名实体识别和低资源语言推理蒸馏研究提供了独特基准,对推动文化感知型NLP模型的发展具有重要意义。
当前挑战
该数据集面临的挑战包括:领域层面,传统词义消歧依赖频率和分布线索,而CEH的两种语义在同一文化空间中共存,需引入文化语用知识,现有模型普遍存在主导意义偏差,零样本下错误率高达100%;构建层面,词汇筛选依赖单一母语者的主观判断,难以覆盖地区性少见名字,且初始语料由多模型生成,虽经人工校验,仍可能残留机器文本的文体模式,标注团队规模小,虽有高一致性(κ=0.95),但地域多样性不足,此外,微调实验受限于1-3B参数模型的参数高效方法,结果可能不适用于更大模型。
常用场景
经典使用场景
BanglaCEH数据集聚焦于孟加拉语中文化纠缠同形词(CEH)的消歧任务,为低资源语言的自然语言处理提供了独特的评测基准。该数据集包含1516个孟加拉语句子,每个句子中同一词形出现两次且具有不同语义,要求模型区分名称与概念、情感、灵性等六类文化语义标签。其经典使用场景涵盖词义消歧(WSD)、命名实体识别(NER)以及文化感知的语言模型评估,尤其适用于检验模型在缺乏频率线索时的文化语用推理能力。研究人员可利用该数据集系统性地评估多语言及孟加拉语专用大语言模型(如Qwen、Llama、TituLLM)在文化纠缠语境下的表现,从而揭示模型在表面词汇能力与文化理解之间的差异。
实际应用
在实际应用中,BanglaCEH可用于改进孟加拉语自然语言处理管道,特别是在命名实体识别、指代消解和机器翻译等任务中,帮助模型准确区分人名与普通名词,避免歧义错误。该数据集还可用于训练和评估多语言模型在文化敏感场景下的表现,例如孟加拉语聊天机器人、信息抽取系统以及跨文化文本分析工具。此外,数据集中包含的文化解释和纠缠注释可作为知识蒸馏的监督信号,用于优化低资源语言模型的微调流程,提升其在真实世界应用中的鲁棒性。这一基准也为其他存在名称-概念纠缠的语言(如印地语、泰米尔语)提供了构建类似资源的范式。
衍生相关工作
该数据集的发布催生了多项后续研究,主要集中在低资源语言的文化感知推理与知识蒸馏方法上。例如,论文中提出的文化链式思维(C-CoT)提示策略,显著降低了模型的主导偏见,激发了关于对比推理在文化消歧中作用的进一步探索。QLoRA知识蒸馏实验表明,蒸馏文化解释而非仅标签可大幅提升性能,这一发现推动了“解释蒸馏”技术在NLP领域的应用。此外,该基准还启发了跨语言类比数据集的构建,如针对阿拉伯语和乌尔都语的名称-概念纠缠研究。其标注流程和评估框架被后续工作采用,用于开发文化接地性评估指标,并促进了针对低资源语言的参数高效微调方法(如LoRA变体)的改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务