Culturally Entangled Homograph (CEH) benchmark
收藏资源简介:
该数据集是由联合国际大学构建的孟加拉语文化纠缠同形异义词基准,旨在评估语言模型在低资源文化语境下的语义消歧能力。数据集包含1,516个经过专家验证的句子实例,总计3,032个标记化标注,数据来源于通过Claude、Kimi和Gemini等先进模型生成并经过人工交叉验证的孟加拉语语句。其构建过程采用多模型生成与双阶段验证机制,确保文化注释的准确性与解释的合理性,专门用于解决孟加拉语中同一词汇同时作为人名与文化负载普通名词时产生的语义歧义问题,推动语言模型在文化接地性方面的研究与发展。
This dataset is a Bengali culturally entangled homonym benchmark constructed by United International University, aimed at evaluating the semantic disambiguation capabilities of language models in low-resource cultural contexts. It contains 1,516 expert-validated sentence instances, with a total of 3,032 tokenized annotations. The data is sourced from Bengali sentences generated by advanced models such as Claude, Kimi, and Gemini, followed by manual cross-verification. Its construction adopts a multi-model generation and two-stage verification mechanism to ensure the accuracy of cultural annotations and the rationality of interpretations. It is specifically designed to address semantic ambiguity in Bengali that arises when a single word functions simultaneously as a personal name and a culturally loaded common noun, and to advance research and development of language models in the area of cultural grounding.
数据集概述:Culturally Entangled Homograph (CEH) 基准数据集
数据集简介
该数据集专注于孟加拉语中文化纠缠同形异义词(CEH)的消歧任务。许多孟加拉语词汇同时用作人名和文化负载的普通名词,例如“মায়া (Maya)”既是常见女性名字,也表示“深情的慈悲”。模型需要根据句子上下文,区分同一词汇两次出现的不同语义角色。
数据集规模
| 统计项 | 数值 |
|---|---|
| 已验证实例 | 1,516 条 |
| 标注出现次数 | 3,032 次(每个实例包含两个标注点) |
| 文化类别 | 6 类(名称、概念、情感、情绪状态、集体状态、精神) |
| 标注者间一致性 | Cohens κ = 0.95 |
纠缠类别分布
| 纠缠类型 | 数量 |
|---|---|
| 名称 ↔ 概念 | 795 |
| 概念 ↔ 情感 | 193 |
| 名称 ↔ 精神 | 179 |
| 名称 ↔ 情感 | 178 |
| 情感 ↔ 状态 | 171 |
数据构成
每个实例包含:
- 词级标签:两个出现位置的标注
- 自然语言解释:说明每个位置为何被赋予该标签
- 文化纠缠说明:描述连接两种语义的命名惯例
数据构建流程
- 词汇筛选:由母语人士人工筛选具有双重语义的词汇
- 多模型生成:使用三个互补模型(Claude Fable 5、Kimi K3、Gemini 3.5 Flash)生成句子与文化解释
- 交叉验证:模型间相互校验(不审核自身输出)
- 人工验证:两位母语孟加拉语标注者逐条人工审核
主要实验结果
在保留测试集上的精确匹配(EM)和主导偏差(Bias)表现:
| 模型 | 零样本 EM | 少样本 EM | C-CoT EM | QLoRA-KD EM | KD 偏差↓ |
|---|---|---|---|---|---|
| Qwen2.5-1.5B | 0.65 | 8.39 | 30.97 | 85.16 | 0.00 |
| Llama-3.2-3B | 10.97 | 22.58 | 15.16 | 82.42 | 2.80 |
| TituLLM-1B 🇧🇩 | 0.11 | 0.31 | 1.14 | 87.91 | 4.20 |
| GPT-4o-mini (闭源) | 43.87 | 49.68 | — | — | — |
所有微调的1-3B开放模型均大幅超越了GPT-4o-mini的最佳提示结果(49.68% EM)。
关键发现
- 主导意义偏见:大型语言模型系统性默认选择普通名词义项,忽视人名义项(零样本偏见率高达100%)
- 语言≠文化:孟加拉语专用模型TituLLM在所有提示策略下均失败,表明仅语言预训练不足以提供文化理解
- 文化思维链(C-CoT):一种对比提示变体,强制模型在确定答案前先论证两种候选语义,将Qwen的偏见率从63.46%降至2.88%
- 推理蒸馏获胜:基于文化解释(而非仅标签)的QLoRA微调,使1-3B模型达到82–88%精确匹配,偏见率≤4.2%
仓库结构
├── data/ │ ├── ceh_train.json # 78% 训练集 │ ├── ceh_val.json # 10% 验证集 │ └── ceh_test.json # 12% 测试集 ├── prompts/ │ ├── zero_shot.txt │ ├── few_shot.txt │ ├── ccot.txt # 文化思维链模板 │ └── llm_judge.txt # 大模型裁判评分标准 ├── src/ │ ├── evaluate.py # 标签与推理评价指标 │ ├── train_qlora_kd.py # QLoRA知识蒸馏微调 │ └── inference.py └── models/ # 已发布微调适配器
许可与伦理
- 基准专注于文化理解,不涉及个人数据;所有人名均为孟加拉语常见通用名称,不指向真实个人
- 句子由大模型生成并经两位母语志愿者验证
- 许可协议:MIT




