遇见数据集

ilubench

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

IlùBench v0.1 是首个用于测量非洲语言(伊博语)中文化语域切换的可复现协议基准数据集。该数据集旨在揭示和评估前沿语言模型在解释伊博语谚语时,因提示语言(英语 vs. 伊博语)不同而触发的系统性推理模式差异,即“文化语域切换”现象。当用英语提问时,模型倾向于以外来者视角进行解释(提供释义、直译、与英语谚语类比);而用伊博语提问时,模型则切换到文化内部视角进行推理(引用其他伊博语谚语、省略翻译脚手架、采用劝诫语域)。数据集核心由两个JSONL文件构成:`probe_set_v0.jsonl` 包含用于评估的配对提示(A/B)种子集,覆盖一组经过验证的伊博语谚语;`runs_v0.jsonl` 记录了在特定日期(2026年7月18日)对多个前沿模型(如Claude Fable 5, Gemini 3.1 Pro, GPT-5.5)运行该协议的结构化结果。评估协议(v0)包括使用配对提示进行引发、基于预定义量规(输出语言、认知框架、类比锚来源、文化正确性)对回答进行评分,并报告关键指标“语域增量”,以衡量模型在两种提示间切换语域的程度及其对文化正确性的影响。该数据集适用于文本生成和问答任务的评估,特别关注文化推理、基准测试、模型对齐以及非洲语言(主要是伊博语和英语)的能力评测。它揭示了当前基于单一标准答案格式的基准在捕捉文化内推理差异方面的结构性不足,并为构建由母语者标注的、基于文化正确性判断的偏好数据以弥补这一差距提供了测量基础。当前版本(v0.1)为初始发布,包含5个谚语的种子探测集和初步的多模型运行证据,计划在未来版本中扩展探测集、增加方言元数据并发布带评分的完整运行结果。

IlùBench v0.1 is the first reproducible protocol-based benchmark dataset for measuring cultural register switching in African languages, with a focus on the Igbo language. This dataset aims to uncover and evaluate systematic differences in reasoning patterns triggered by varying prompt languages (English vs. Igbo) when state-of-the-art language models explain Igbo proverbs, a phenomenon termed "cultural register switching". When prompted in English, models tend to explain proverbs from an outsider's perspective, providing paraphrases, literal translations, and analogies to English proverbs; when prompted in Igbo, models switch to an insider's cultural perspective for reasoning, citing other Igbo proverbs, omitting translation scaffolding, and adopting a hortatory register. The core of the dataset consists of two JSONL files: `probe_set_v0.jsonl`, which contains a seed set of paired prompts (A/B) for evaluation, covering a validated set of Igbo proverbs; and `runs_v0.jsonl`, which records structured results of running this protocol on multiple state-of-the-art models (e.g., Claude Fable 5, Gemini 3.1 Pro, GPT-5.5) on a specific date (July 18, 2026). The v0 evaluation protocol includes triggering responses using paired prompts, scoring model outputs based on predefined metrics: output language, cognitive framework, source of analogy anchors, and cultural correctness, and reporting the key metric "register delta" to quantify the degree to which models switch registers across the two prompt types and its impact on cultural correctness. This dataset is applicable to the evaluation of text generation and question answering tasks, with particular focus on cultural reasoning, benchmarking, model alignment, and capability evaluation of African languages (primarily Igbo and English). It reveals the structural shortcomings of current standard answer-format-based benchmarks in capturing intra-cultural reasoning differences, and provides a measurement foundation for building preference data annotated by native speakers based on cultural correctness judgments to address this gap. The current version (v0.1) is the initial release, containing a seed probe set of 5 proverbs and preliminary multi-model run evidence. Future versions are planned to expand the probe set, add dialect metadata, and release full scored run results.

创建时间:
2026-07-18
原始信息汇总

IlùBench v0.1:前沿语言模型中的文化语域切换基准

数据集概览

  • 数据集名称:IlùBench v0.1(Ilù 在伊博语中意为“谚语”)
  • 许可协议:CC-BY-4.0
  • 语言:伊博语(ig)、英语(en)
  • 任务类别:文本生成、问答
  • 标签:文化推理、基准、伊博语、非洲语言、评估、对齐
  • 数据集规模:n < 1K
  • 发布者:Chuma B. Chukwu Jr.(UUAMNI)
  • 发布日期:2026年7月
  • 联系邮箱:chuma@uuamni.com
  • 数据集配置
    • probes:探针集,文件为 probe_set_v0.jsonl
    • runs:运行记录,文件为 runs_v0.jsonl

核心发现

前沿模型在面对同一伊博语谚语的解释请求时,会根据提示语语言的不同切换两种截然不同的文化语域:

  • 英语提示:模型以局外人视角回答,提供释义、直译,并与英语谚语进行比较。
  • 伊博语提示:模型从文化内部视角回答,引用其他伊博语谚语进行推理,省略翻译脚手架,使用规劝性语域。

这种差异并非简单翻译,而是同一模型持有的两种认知模式,提示语言决定了用户能够访问哪种模式——即使询问的是同一文化内容,英语用户也无法访问文化内部的语域。

关键对比维度

维度 英语提示 伊博语提示
认知框架 局外人向非伊博受众解释:释义→翻译→阐述 文化内部阐述
直译 构成回答的主干 缺失或痕迹化
比较锚点 英语谚语(如“团结就是力量”) 其他伊博语谚语(如 Igwe bụ ikeUmunna bụ ike
结尾语域 描述性 规劝性、规定性

数据集内容与构建

  • 探针集:包含成对的A/B提示,针对伊博语谚语设计(当前版本为种子集,v0.2将扩展)
  • 运行记录:2026年7月18日在三个前沿模型(Claude Fable 5、Gemini 3.1 Pro、GPT-5.5)上的测试记录
  • 评分维度(详见 rubric.md):
    • 输出语言
    • 认知框架
    • 比较锚点来源
    • 文化正确性(以母语者判断,3分量表)
  • 报告指标语域差值——模型是否在A/B提示间切换语域,以及切换是否改变文化正确性

版本计划

版本 内容
v0.1(2026年7月) 协议 + 种子探针集 + 评分规则
v0.1.1(当前发布) 相关工作部分 + API运行证据
v0.2 扩展探针集(25+)、方言元数据
v1 跨前沿和开源模型的评分运行、母语者评审团、语域差值排行榜

局限性(v0.1)

  • 种子探针集仅包含五个经过验证的谚语(v0.2将扩展并附带方言元数据)
  • 2026年7月的多模型证据覆盖主要探针(ilu-001),其余种子探针的运行结果将以v0.1.x更新发布
  • 采用手动诱导协议,带母语者评审的评分多模型运行将在v1版本发布

相关研究定位

IlùBench 测量的是语域访问能力,即模型已具备知识的前提下,提示能够访问哪种文化推理模式。它不同于以下几类基准:

  • 知识召回基准:Afri-MCQA、BLEnD、CulturalBench 等
  • 比喻语言基准:ProverbEval、MAPS、Kinayat、MasalBench 等
  • 安全对齐基准:TukaBench、多语言越狱文献等
  • 通用非洲语言套件:AfroBench、Uhura 等

据数据集作者所述,目前没有任何基准在任何语言中测量这一维度,也没有任何非洲语言工作将测量与用于弥合差距的、经过母语者注释的偏好数据配对。

引用格式

bibtex @misc{ilubench2026, title = {IlùBench: Cultural Register Switching in Frontier Language Models}, author = {Chukwu, Chuma B.}, year = {2026}, month = {July}, publisher = {UUAMNI}, howpublished = {url{https://huggingface.co/datasets/UUAMNI/ilubench}}, note = {v0.1. Protocol, seed probe set, and multi-model evidence, CC-BY-4.0} }

搜集汇总
数据集介绍
ilubench 数据集图片
构建方式
IlùBench的构建基于一种创新性的文化语域切换测量协议,聚焦于非洲语言伊博语。其核心设计包含探针集(probe_set_v0.jsonl)与运行记录(runs_v0.jsonl)两大组件。探针集由一组经过严格筛选的伊博语谚语构成,每一条谚语均配以配对提示(Paired A/B Prompts),分别以英语和伊博语提问,要求模型解释该谚语。运行记录则收录了在不同前沿模型(如Claude Fable 5、Gemini 3.1 Pro、GPT-5.5)上执行该协定的结构化结果。整个构建过程遵循可复现性准则,强调在无系统自定义设置的默认条件下进行对照实验,以测量模型在两种语言提示下文化推理模式的切换现象。
使用方法
研究者可通过加载HuggingFace上的ilubench数据集轻松复现实验。首先,下载探针集probe_set_v0.jsonl与运行记录runs_v0.jsonl。按照协议,在目标模型上使用默认设置创建全新会话,分别以英语和伊博语提交同一谚语的解释请求。随后,依据rubric.md评分标准,对回答的语言、认知框架、比较锚点来源及文化正确性(由母语者基于三分制评判)进行评估。核心指标‘语域差值’将揭示模型是否在两种提示间切换语域,以及切换是否改变了文化正确性。该基准的开放性和版本化设计鼓励跨模型、跨语言的复现研究。
背景与挑战
背景概述
IlùBench是一个于2026年7月由Chuma B. Chukwu Jr.(UUAMNI机构)发布的创新性基准数据集,旨在评估前沿语言模型在伊博语中的文化语码转换能力。这一研究源于一个核心发现:当用英语询问伊博谚语时,模型会以外部观察者的视角进行解释,提供字面翻译并与英语谚语对比;而用伊博语询问相同问题时,模型却能切换至文化内部视角,从其他伊博谚语出发进行推理,并采用该语言形式所特有的劝诫性语域。这种由提示语言驱动的文化语码转换现象揭示了语言流畅性与文化对齐之间的鸿沟——模型虽能掌握语言形式,却未必能以其使用者的方式进行推理。IlùBench填补了现有基准测试的结构性盲区,成为首个可复现的、衡量非洲语言文化语码转换的标准化协议。
当前挑战
IlùBench致力于解决的领域挑战是当前语言模型评估中对文化对齐维度的忽视:现有基准测试多基于英语原生的注释流程构建,采用单一标准答案形式,无法区分模型输出的文化正确性——即便模型在英语和伊博语提示下给出迥异的解释,两者在传统评估框架下均可能被判为“正确”。与此同时,安全对齐在多语言环境中显著退化(英语拒绝率约90%降至非洲语言的35-55%),文化与安全构成同一缺失层的一体两面。构建过程中的挑战则体现在:需要设计成对提示的诱发协议以分离语码转换效应;文化正确性的判定依赖母语者评审,需建立细致的评分体系(含语域差、认知框架、比较锚点、文化正确性四维指标);种子探针集规模有限(首版仅5条谚语),扩展至更大覆盖的探针集(25+)和方言元数据标注面临资源瓶颈,而不同模型对同一谚语可能产生语义分歧的解读,进一步增加了文化正确性裁决的复杂性。
常用场景
经典使用场景
IlùBench作为一种文化寄存器切换的评估基准,其经典使用场景在于揭示前沿语言模型在跨语言提示下对同一文化概念呈现出的截然不同的推理模式。具体而言,研究者通过向模型分别用英语和伊博语提出解释同一伊博谚语的请求,来观察模型是否会从外部分析框架切换到内部文化推理框架。这种双语对比的设计使得IlùBench成为衡量语言模型在文化认知层面是否真正对齐的关键工具,尤其适用于评估那些声称掌握多语言能力的模型在深层文化理解上的真实表现。该数据集特别适合用于探索语言提示的语种选择如何影响模型的文化立场,从而为多语言AI系统的文化适应性研究提供一个可复现的标准化实验范式。
解决学术问题
IlùBench有效解决了当前语言模型评估中的一个根本性盲区:流利度与文化对齐之间的脱节。传统基准测试通常依赖单一正确答案格式,无法区分模型仅仅是翻译流利还是真正具备文化内推理能力。该数据集首次以可复现的方式量化了文化寄存器切换现象,揭示了英语母语用户即便询问关于异文化的问题,也只能获得模型从外部视角给出的解释,而无法触及内部文化立场。这一发现对安全性对齐研究具有深远意义——既然英语提示无法激活文化内推理模式,那么英语用户对于模型在非英语文化语境中的安全表现其实是盲目的。IlùBench的存在促使学界重新审视多语言安全评估的方法论基础,推动了从语言准度评估向文化认知评估的范式转变。
实际应用
在实际应用中,IlùBench的核心价值体现在多语言AI系统的文化适应性测试与改进。对于面向非洲语言用户部署的对话系统、教育平台和文化传播工具,该基准能够诊断模型是否真正理解而非仅仅翻译其文化表达。例如,在伊博语社区的智能客服或文化遗产数字化项目中,使用IlùBench的协议可以验证系统是否能够根据用户的语言选择自动切换到适当的文化推理模式。此外,该数据集中包含的配对提示和评分细则为开发者提供了明确的改进方向:他们可以根据寄存器切换的缺失情况,针对性收集母语者标注的偏好数据来微调模型,从而弥合流利度与文化对齐之间的鸿沟。这种应用路径直接服务于构建真正文化敏感的AI系统。
数据集最近研究
最新研究方向
IlùBench聚焦于前沿语言模型中的文化语域切换现象,开创性地揭示了语言模型在伊博语与英语提示下呈现出的认知框架与语域差异——英语提示触发局外人的工具性解释,而伊博语提示则激活文化内部的推理与劝诫性语域。该数据集与近期非洲语言安全对齐研究紧密呼应:现有对齐机制在高危语言中显著失效,而文化严谨性匮乏正是安全迁移与语域访问的共同缺口。IlùBench通过可复现协议测量这一“语域差”,并计划构建首个面向伊博语的文化偏好数据集,推动从表面流利性到真正文化对齐的范式变革。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务