遇见数据集

Culturally Entangled Homograph (CEH) benchmark

收藏
arXiv2026-07-20 更新2026-07-22 收录
数据链接:
官方服务:

资源简介:

该数据集是由联合国际大学构建的孟加拉语文化纠缠同形异义词基准,旨在评估语言模型在低资源文化语境下的语义消歧能力。数据集包含1,516个经过专家验证的句子实例,总计3,032个标记化标注,数据来源于通过Claude、Kimi和Gemini等先进模型生成并经过人工交叉验证的孟加拉语语句。其构建过程采用多模型生成与双阶段验证机制,确保文化注释的准确性与解释的合理性,专门用于解决孟加拉语中同一词汇同时作为人名与文化负载普通名词时产生的语义歧义问题,推动语言模型在文化接地性方面的研究与发展。

This dataset is a Bengali culturally entangled homonym benchmark constructed by United International University, aimed at evaluating the semantic disambiguation capabilities of language models in low-resource cultural contexts. It contains 1,516 expert-validated sentence instances, with a total of 3,032 tokenized annotations. The data is sourced from Bengali sentences generated by advanced models such as Claude, Kimi, and Gemini, followed by manual cross-verification. Its construction adopts a multi-model generation and two-stage verification mechanism to ensure the accuracy of cultural annotations and the rationality of interpretations. It is specifically designed to address semantic ambiguity in Bengali that arises when a single word functions simultaneously as a personal name and a culturally loaded common noun, and to advance research and development of language models in the area of cultural grounding.

提供机构:
联合国际大学
创建时间:
2026-07-20
原始信息汇总

数据集概述:Culturally Entangled Homograph (CEH) 基准数据集

数据集简介

该数据集专注于孟加拉语中文化纠缠同形异义词(CEH)的消歧任务。许多孟加拉语词汇同时用作人名文化负载的普通名词,例如“মায়া (Maya)”既是常见女性名字,也表示“深情的慈悲”。模型需要根据句子上下文,区分同一词汇两次出现的不同语义角色。

数据集规模

统计项 数值
已验证实例 1,516
标注出现次数 3,032 次(每个实例包含两个标注点)
文化类别 6 类(名称、概念、情感、情绪状态、集体状态、精神)
标注者间一致性 Cohens κ = 0.95

纠缠类别分布

纠缠类型 数量
名称 ↔ 概念 795
概念 ↔ 情感 193
名称 ↔ 精神 179
名称 ↔ 情感 178
情感 ↔ 状态 171

数据构成

每个实例包含:

  • 词级标签:两个出现位置的标注
  • 自然语言解释:说明每个位置为何被赋予该标签
  • 文化纠缠说明:描述连接两种语义的命名惯例

数据构建流程

  1. 词汇筛选:由母语人士人工筛选具有双重语义的词汇
  2. 多模型生成:使用三个互补模型(Claude Fable 5、Kimi K3、Gemini 3.5 Flash)生成句子与文化解释
  3. 交叉验证:模型间相互校验(不审核自身输出)
  4. 人工验证:两位母语孟加拉语标注者逐条人工审核

主要实验结果

在保留测试集上的精确匹配(EM)和主导偏差(Bias)表现:

模型 零样本 EM 少样本 EM C-CoT EM QLoRA-KD EM KD 偏差↓
Qwen2.5-1.5B 0.65 8.39 30.97 85.16 0.00
Llama-3.2-3B 10.97 22.58 15.16 82.42 2.80
TituLLM-1B 🇧🇩 0.11 0.31 1.14 87.91 4.20
GPT-4o-mini (闭源) 43.87 49.68

所有微调的1-3B开放模型均大幅超越了GPT-4o-mini的最佳提示结果(49.68% EM)。

关键发现

  • 主导意义偏见:大型语言模型系统性默认选择普通名词义项,忽视人名义项(零样本偏见率高达100%
  • 语言≠文化:孟加拉语专用模型TituLLM在所有提示策略下均失败,表明仅语言预训练不足以提供文化理解
  • 文化思维链(C-CoT):一种对比提示变体,强制模型在确定答案前先论证两种候选语义,将Qwen的偏见率从63.46%降至2.88%
  • 推理蒸馏获胜:基于文化解释(而非仅标签)的QLoRA微调,使1-3B模型达到82–88%精确匹配,偏见率≤4.2%

仓库结构

├── data/ │ ├── ceh_train.json # 78% 训练集 │ ├── ceh_val.json # 10% 验证集 │ └── ceh_test.json # 12% 测试集 ├── prompts/ │ ├── zero_shot.txt │ ├── few_shot.txt │ ├── ccot.txt # 文化思维链模板 │ └── llm_judge.txt # 大模型裁判评分标准 ├── src/ │ ├── evaluate.py # 标签与推理评价指标 │ ├── train_qlora_kd.py # QLoRA知识蒸馏微调 │ └── inference.py └── models/ # 已发布微调适配器

许可与伦理

  • 基准专注于文化理解,不涉及个人数据;所有人名均为孟加拉语常见通用名称,不指向真实个人
  • 句子由大模型生成并经两位母语志愿者验证
  • 许可协议:MIT
搜集汇总
数据集介绍
Culturally Entangled Homograph (CEH) benchmark 数据集图片
构建方式
Culturally Entangled Homograph (CEH)基准数据集的构建始于对孟加拉语中同时作为人名和具有文化负载的普通名词的词汇进行专家遴选。随后,利用Claude Fable 5、Kimi K3和Gemini 3.5 Flash三种大语言模型生成包含这些词汇的句子及对应的文化解释,以提升数据的多样性。生成内容通过模型间的循环交叉验证,初步筛选出标签或解释不一致的候选错误。最终,由两名母语为孟加拉语的专家对每条实例进行人工审核,纠正文化推理不准确之处,确保每条数据包含词级别的文化类别标签和自然语言推理说明。最终数据集共包含1,516条经过验证的孟加拉语句子,对应3,032个标注词位。
特点
该数据集的核心特点在于聚焦“文化纠缠同形词”这一语言现象,即同一个词形在单一句子中同时出现两次,分别承担人名与抽象文化概念(如情感、精神、集体状态等)两种不同的语义角色。这种设计剥离了表面词汇频率和分布线索的干扰,直接考验模型的文化语用知识。数据集的标注体系包含六种文化类别,并附有详尽的推理说明,揭示了模型普遍存在的“主导意义偏差”——即倾向于将人名误判为普通名词。此外,一个孟加拉语专用模型在该任务上的全面失败,有力证明了语言特异性预训练本身并不等同于文化接地性。
使用方法
使用该数据集时,研究者可将每条孟加拉语句子和其中的目标同形词作为输入,要求模型输出每个词位对应的六类文化标签之一。评测支持零样本、少样本、对比思维链和知识蒸馏微调四种范式。其中,对比思维链提示需模型在决策前先论证两种候选语义的合理性,以直接对抗主导意义偏差。知识蒸馏微调则以完整的文化推理说明为监督信号,引导小模型学习从文化语境出发进行合理推理,而非仅记忆标签映射。数据已按78%训练、10%验证、12%测试的比例划分,便于开展标准化评估。
背景与挑战
背景概述
在自然语言处理领域,词义消歧始终是一项基础而棘手的挑战,尤其当同一词汇同时承载人名与深厚文化内涵时,问题变得更加复杂。孟加拉语中广泛存在此类现象:诸如 "মায়া"(Maya)既是一个常见女性名字,又意为“深情的慈悲”,其解读完全依赖于文化语境而非表层词汇统计。然而,现有大语言模型受限于以西方为中心的高资源预训练数据,在面对低资源语言时往往暴露出文化理解的显著缺失。为填补这一空白,孟加拉国联合国际大学的 Md. Asaduzzaman Shuvo 及其团队于2026年提出“文化纠缠同形词”(CEH)消歧任务,并构建了包含1,516条专家验证句子(共3,032个标注实例)的孟加拉语基准数据集。该数据集聚焦于同一词汇在同一句子中以不同含义(人名与文化概念)出现的特殊场景,旨在精准检测模型的文化扎根能力,对推动低资源语言的文化敏感型自然语言理解具有重要意义。
当前挑战
CEH基准所面对的挑战具有双重维度。就领域问题而言,传统词义消歧依赖频率或分布线索,但文化纠缠同形词的两重解读共存于同一文化空间,模型无法通过表面统计区分人名与文化概念,导致普遍存在“主导含义偏差”——模型倾向于将所有人名误判为常见名词,且封闭源模型即使表现较好仍存在一定偏差。在数据集构建过程中,挑战同样严峻:词汇选择需由母语者手工甄别那些兼具双重身份的真实词汇,而非依赖固定名称库,这既保证了针对性也牺牲了覆盖面;句子与解释最初由大语言模型生成,必须经过两轮交叉模型校验和两位母语专家的独立审核(标注者间一致性高达Cohen's κ=0.95),方能在语料规模有限与风格偏差之间取得平衡,确保标注的文化推理准确且可靠。
常用场景
经典使用场景
在自然语言处理与文化计算的交叉领域中,Culturally Entangled Homograph (CEH) benchmark最经典的使用场景是对低资源语言模型进行文化接地性的压力测试。该数据集聚焦于孟加拉语中一类特殊的多义词——同一个词形同时承载个人姓名与文化负载普通名词的双重含义。研究者通过让模型在同一句子中区分同一词形的两种不同解读,精准评估模型是否具备超越统计共现表象的深层文化推理能力。这一场景尤其适合衡量预训练语言模型在面对非西方、低资源文化语境时的真实理解水平,为检验语言模型是否只是表面流畅而实际缺乏文化常识提供了极具诊断价值的测试平台。
解决学术问题
CEH benchmark系统性地揭示了当前大语言模型在文化词义消歧任务中存在的核心学术问题——主导意义偏见(dominant-meaning bias)。研究发现,无论是开源还是闭源模型,均倾向于将同时具有姓名和普通名词含义的孟加拉语词默认解读为普通名词,而完全忽视其作为姓名的可能性。这一偏见在孟加拉语专用模型中尤为严重,验证了语言特定的预训练本身并不足以赋予模型文化接地性。该数据集的提出,使学术界得以量化这一盲区,并推动了对文化推理而非单纯词汇匹配的深入研究,其影响在于将文化理解从语言能力的附属议题提升为独立且亟需关注的评估维度。
衍生相关工作
CEH benchmark的提出催生了一系列围绕文化消歧与小型模型推理增强的经典工作。研究者基于该数据集探索了对比思维链(Contrastive Chain-of-Thought)提示方法,通过强制模型在输出最终标签之前分别论证每种候选解读,显著降低了主导意义偏见。更进一步,基于知识蒸馏的微调范式被证明能将文化推理能力迁移至仅有1–3B参数的小型模型中,使它们在消歧准确率上超越更大规模的闭源模型。这些衍生工作共同勾勒出一条清晰的技术路线:利用高质量、带文化解释的标注数据,通过参数高效的微调手段,将文化推理能力注入原本缺乏文化接地性的小型语言模型,为低资源语言的文化感知NLP开辟了新的实践方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务