遇见数据集

somosnlp-hackathon-2026/che-boludo-benchmark

收藏
Hugging Face2026-06-17 更新2026-06-14 收录
官方服务:

资源简介:

Che Boludo Bench 是一个针对西班牙语Rioplatense变体(主要来自阿根廷地区)的实用对齐基准数据集。当前语言模型在解释西班牙语文化变体时存在重要限制:它们倾向于过度字面化处理语言,并对特定语言社区的俚语表达进行过度调节。这一问题在Rioplatense西班牙语中尤为明显,因为日常交流高度依赖讽刺、反讽、隐含语境、俚语、情感代码和表演性攻击幽默。在阿根廷,包含侮辱或文本攻击性的表达在社会中常作为信任、亲近或幽默的展示,但许多现有模型错误地将其分类为真实毒性。数据集旨在评估模型如何理解Rioplatense西班牙语对话中的攻击性、讽刺和社交意图,具体测量模型何时:错误检测不存在的毒性、将侮辱误解为真实攻击而非情感代码、以及对使用俚语的日常查询做出不合理的说教或拒绝响应。数据集结构遵循经典的偏好优化(DPO/RLHF)格式,每条记录包含:prompt(来自本地社区如Reddit Argentina的Rioplatense西班牙语短语或对话上下文)、chosen(展示实用对齐的理想响应,识别幽默、不过度调节、以文化自然方式回应)、rejected(未对齐的响应,通常是企业过度调节类型,如无法处理攻击性语言或过度字面化解释)以及pragmatica(详细注释,包括言语行为、真实意图、极性及真实敌意/情感水平)。创新点在于提出文化感知的安全对齐视角,即关注本地文化和实用规范的对齐方法,探索主要基于英语数据集训练的调节系统在与高度情境化语言社区(如阿根廷)互动时可能产生的误报。预期影响包括:促进多文化对齐研究、情境化调节、减少实用偏见、保护西班牙语文化变体以及开发拉丁美洲本地化人工智能。此外,该基准可作为未来微调、安全对齐、社会语言评估和计算语用学研究的基础。结果预期是提供一个可复现的基准,能够测量Rioplatense西班牙语中的过度调节、评估上下文实用理解、展示当前模型的文化缺陷,并作为未来文化对齐AI系统的评估工具。

Che Boludo Bench is a pragmatic alignment benchmark dataset for the Rioplatense Spanish variant (primarily from Argentina). Current language models present a significant limitation in interpreting cultural varieties of Spanish: they tend to process language overly literally and over-moderate colloquial expressions specific to certain linguistic communities. This problem is particularly evident in Rioplatense Spanish, where much of daily communication depends on sarcasm, irony, implicit context, slang, affective codes, and performative aggressive humor. In Argentina, expressions containing insults or textual aggressiveness often function socially as displays of trust, closeness, or humor, but many current models erroneously classify them as actual toxicity. The dataset aims to evaluate how models interpret aggressiveness, sarcasm, and social intent in Rioplatense Spanish conversations, specifically measuring when a model: detects toxicity where none exists, misinterprets insults as real attacks rather than affective codes, and responds with unwarranted sermons or refusals to everyday queries using slang. The dataset structure follows the classic preference optimization (DPO/RLHF) format, with each record containing: prompt (a phrase or conversational context in Rioplatense Spanish, mainly extracted from local communities like Reddit Argentina), chosen (the ideal or target response demonstrating pragmatic alignment, recognizing humor, not over-moderating, responding with cultural naturalness), rejected (the misaligned response, typically corporate over-moderation such as I cannot process offensive language or an overly literal interpretation), and pragmatica (detailed annotations on speech act, real intent, polarity, and levels of real hostility/affectivity). The innovation lies in proposing a culturally-aware safety alignment perspective, i.e., an alignment approach sensitive to local cultural and pragmatic norms, exploring how moderation systems trained mainly on English datasets can generate false positives when interacting with highly contextual linguistic communities like Argentina. The expected impact includes contributing to research in multicultural alignment, contextualized moderation, reduction of pragmatic biases, preservation of Spanish cultural variants, and development of localized AI for Latin America. Additionally, the benchmark can serve as a basis for future work in fine-tuning, safety alignment, sociolinguistic evaluation, and computational pragmatics. The expected outcome is a reproducible benchmark capable of measuring over-moderation in Rioplatense Spanish, evaluating contextual pragmatic understanding, demonstrating cultural flaws in current models, and serving as an evaluation tool for future culturally aligned AI systems.

搜集汇总
数据集介绍
somosnlp-hackathon-2026/che-boludo-benchmark 数据集图片
构建方式
该数据集遵循优化偏好(DPO/RLHF)的经典结构体系构建,其数据源自阿根廷当地Reddit社区的日常对话文本。每一笔记录均包含精心设计的提示语(prompt),以及成对呈现的偏好回答(chosen)与拒绝回答(rejected),前者展现文化语用对齐的理想回应,后者则体现过度规制的失准输出。数据集还附有详尽的语用标注字段(pragmatica),涵盖言语行为、真实意图、字面与实际极性、敌意与情感强度等维度,为模型评估提供了多层次的语义支撑。
使用方法
该数据集主要用作衡量模型在拉普拉塔河西班牙语语境下语用对齐能力的基准评测工具。研究者可将其作为测试集,评估现有模型在识别真实敌意与情感代码之间的差异,从而量化过度规制的程度。同时,该数据集也可用于进行微调与安全对齐的实际操作,通过将‘chosen’和‘rejected’作为训练信号,使模型学习到更具文化适应性的回应策略,进而减少对非正式、高频情感表达的错误过滤与不当拒绝。
背景与挑战
背景概述
随着大型语言模型在全球范围内的广泛应用,其对于非主流文化语言变体的理解能力成为亟待探究的前沿课题。Che Boludo Bench(CBB)数据集正是在此背景下,由致力于多文化对齐的研究团队于近期创建,旨在评估并提升模型对阿根廷拉普拉塔西班牙语(español rioplatense)的语用理解。该数据集聚焦于一个核心研究问题:当前基于英语语料库训练的安全对齐模型,在面对大量依赖讽刺、隐晦语境、俚语及情感编码(如以攻击性语言表达亲昵)的拉普拉塔西班牙语交流时,是否会产生过度规训(over-moderation)或字面化解读的误判。通过构建包含提示、理想回应与错误回应的三元组,CBB为衡量模型的文化感知对齐(culturally-aware safety alignment)提供了首个系统性基准,对推动多语言、多文化语境下的AI安全研究具有重要影响。
当前挑战
CBB数据集所应对的领域挑战在于,现有语言模型的安全对齐机制普遍存在文化盲区,其毒性检测策略基于英语社区的交流规范,导致在面对拉普拉塔西班牙语中常见的‘情感性攻击’(如‘Qué hacés, hijo de puta’用于表达亲密)时,无法区分字面攻击性与真实社交意图,从而产生大量假阳性误判。构建过程中,团队面临的核心挑战包括:如何从Reddit等本土社区的海量语料中精确提取具有复杂语用功能的表达;如何建立一套既包含言语行为、真实意图、字面与真实极性、真实敌意等维度,又能忠实反映本地文化细微差别的标注体系;以及如何确保人工标注者能克服自身偏见,一致地判别模棱两可的语用现象(如‘Dale campeón’中的讽刺语气),从而生成高质量且文化真实的‘chosen’与‘rejected’对照样本。
常用场景
经典使用场景
Che Boludo Bench作为一项专为评估语言模型在里奥普拉腾斯西班牙语环境下语用对齐能力的基准测试,其经典使用场景聚焦于衡量模型对文化特异性的理解深度。通过设计包含俚语、讽刺、隐含语境及情感代码的对话样本,该基准能够系统性地检测模型是否错误地将非恶意表达识别为攻击性内容,从而避免因过度审查而导致的文化误解。这一场景对于研究多语言模型的本地化适配具有关键价值,尤其适用于需要在中低资源语言变体中实现细腻语用判断的应用前沿。
解决学术问题
该数据集主要解决了当前自然语言处理领域一个被长期忽视的学术问题:语用对齐中的文化偏见。现有安全对齐方法多源自以英语为中心的语料库,在处理如阿根廷等高度依赖语境和情感暗示的社区时,常因过度泛化而引发大量误判。Che Boludo Bench通过提供标注详细语用特征(如真实意图、情感极性、敌意程度)的样本,使研究者能够量化模型在理解方言、幽默及人际情感代码方面的偏差。其意义在于推动了多文化对齐的理论发展,并为建设包容性更强的安全评估体系奠定了实证基础。
实际应用
实际应用中,该数据集可嵌入对话系统的本地化部署流程,成为评估和微调AI助手文化敏感度的关键工具。例如,面向拉美用户设计的客服机器人或社交平台内容审核系统,可通过该基准检验其在处理带有俚语和讽刺的日常对话时,能否避免不恰当的警告或拒绝。同时,该数据集可为教育领域的语言教学AI提供范例,使其精准捕捉里奥普拉腾斯西班牙语中语用歧义与情感传递的微妙之处,进而输出更符合本地交流习惯的回应,显著提升用户体验。
数据集最近研究
最新研究方向
聚焦于西班牙语拉普拉塔方言的语用对齐与文化敏感安全机制,Che Boludo Bench 开创性地构建了一个衡量大语言模型在区域性口语语境下过度审查、误判冒犯性表达及忽视隐性沟通意图的评估基准。该数据集直指当前主流对齐技术多依赖英语语料的局限,通过大量富含嘲讽、亲昵辱骂、黑话及情感表演的真实对话样本,系统揭示模型在非字面含义理解、情感极性反转与社交意图识别上的偏差。其核心价值在于推动‘文化感知对齐’(Culturally-aware Safety Alignment)这一前沿方向,促使语言模型从机械的安全过滤转向对人类复杂语用逻辑的深层解构,为拉丁美洲本土化AI治理及多语种社会语言计算提供了关键方法论与评估工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务