遇见数据集

somosnlp-hackathon-2026/somosnlp-2026-aerospace

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集专为伊比利亚美洲地区的语言模型(LLMs)进行文化、语言和对齐评估而设计,特别关注航空航天、技术、科学和历史领域。它包含1,716个多轮对话交互,分布在多个西班牙语和葡萄牙语国家(如拉丁美洲、西班牙、巴西、阿根廷、墨西哥等),旨在评估模型在理解技术、历史或科学参考上下文的同时,能够使用区域方言、俚语或变体(如智利、墨西哥、阿根廷的西班牙语或巴西葡萄牙语)自然回应,同时保持事实准确性并尊重相关文化动态。数据集结构包括id、type、prompt、target_decision、subcategory和country字段,其中prompt包含参考上下文、用户对话和助手响应。关键用例包括评估语言灵活性(方言)、技术历史上下文处理和文化鲁棒性基准测试。数据集适用于自动化或手动评估流程,用于比较模型响应与提供的助手文本,确保数据保真度和语言自然性。

This dataset is specifically designed for the cultural, linguistic, and alignment evaluation of Language Models (LLMs) in the Ibero-American context, with a special focus on aerospace, technical, scientific, and historical history. It contains 1,716 conversational multi-turn interactions distributed across multiple Spanish and Portuguese-speaking countries. The main objective is to measure the models ability to understand technical, historical, or scientific reference contexts and respond in a linguistically natural manner, adopting regional idioms, jargons, or dialectal variants (such as Chilean, Mexican, Argentine Spanish, or Brazilian Portuguese) without losing factual accuracy and respecting the cultural dynamics of the associated territory.

搜集汇总
数据集介绍
somosnlp-hackathon-2026/somosnlp-2026-aerospace 数据集图片
构建方式
该数据集专为评估大语言模型在伊比利亚美洲地区的文化、语言及对齐能力而设计,聚焦航空航天、技术、科学及历史领域。其构建基于多轮对话形式,包含1716个交互样本,每个样本由唯一标识符、交互类型、提示词(含参考语境、用户方言提问及期望助手回应)、验证决策、文化子类别及地域锚点组成。数据覆盖西班牙语和葡萄牙语多个国家,如智利、墨西哥、阿根廷及巴西,通过人工精心设计对话模板,融入当地习语与方言变体,并确保事实准确性,从而形成一套结构化的文化评估基准。
使用方法
使用该数据集进行评测时,需从提示词列中提取参考语境和用户问题,输入待评估的语言模型。随后将模型输出与提供的助手标准回答进行定性或定量比较,关注两方面:一是回答是否忠实于语境中的技术历史事实;二是语言表达是否自然契合指定区域的文化身份,避免过度模仿或生硬拼凑。该流程支持自动化或人工评估,适用于多轮对话场景下的对齐与安全性测试,为开发者优化模型的跨文化适应能力提供实证依据。
背景与挑战
背景概述
该数据集名为somosnlp-2026-aerospace,由伊比利亚美洲研究团队于2026年创建,专注于大语言模型在航空航天、技术与历史语境下的文化对齐评估。核心研究问题在于考察多语言模型在跨区域西班牙语和葡萄牙语变体(如智利、阿根廷、巴西等方言)中,能否在不牺牲事实准确性的前提下,自然融入当地习语与文化规范。数据集涵盖1716次多轮对话,覆盖拉美、西班牙、巴西等16个地区,子类别统一为“文化偏好/规范”,为LLM的文化鲁棒性评测提供了稀缺的基准资源,对推动多语言模型的地域化安全对齐研究具有重要影响。
当前挑战
该数据集主要应对两大挑战。领域问题层面,现有LLM在面对不同文化背景时,常出现事实混淆、刻板印象强化或语言风格生硬等缺陷,尤其在地域化航空航天与技术历史话题中,模型难以兼顾专业精准与方言自然度。构建过程中,挑战在于设计涵盖复杂技术上下文(如卫星任务、生态灾难)的多轮对话,同时确保方言表达(如“cachai”“quedó la escoba”)不偏离科学事实,且避免带有文化偏见的负面模仿,这对数据采集与验证的严谨性提出了极高要求。
常用场景
经典使用场景
该数据集专用于伊比利亚美洲地区大型语言模型的文化与语言对齐评估,涵盖航天、科技与历史等多轮对话场景。通过嵌入地区性俚语与方言表达,如智利西班牙语中的“cachai”或阿根廷变体,检验模型在保持科学事实准确性的前提下,能否自然融入当地交际模式,是衡量模型跨文化语用能力的经典基准。
解决学术问题
该数据集旨在解决大语言模型在非英语、区域性文化语境下的事实性与语言自然度失衡问题。传统评估常忽略地区性语言变异与文化规范,导致模型在伊比利亚美洲场景中出现事实错位或刻板印象强化。通过结构化多轮对话与精细化的地域锚定,该数据集为推动跨文化语言模型对齐研究提供了关键评估资源。
实际应用
在实际应用中,该数据集可用于开发面向拉丁美洲、西班牙及巴西用户的对话系统,如区域性客服机器人、航天知识问答助手与文化教育平台。它能帮助优化模型在方言混杂、科技历史交织的复杂交流中的响应质量,避免因文化盲区引发误解,提升用户体验与产品的地域适应性。
数据集最近研究
最新研究方向
该数据集聚焦于伊比利亚美洲航空航天与文化对齐的交叉前沿,通过1,716组多轮对话评估大型语言模型在地域性方言、技术历史及文化规范上的融合能力。研究热点在于利用拉美地区标志性航天事件(如智利FASat卫星、巴西空间探测)与生态议题(如西班牙Prestige油轮灾难)构建精细语境,检验模型能否在保持科学事实准确性的同时,自然融入”cachai“等本土习语,避免文化刻板印象。这一方向深刻揭示了跨文化AI对齐中地域敏感性的关键挑战,为开发更具包容性的多语言、多文化LLM基准提供了实证基础,推动了安全性与本土化评估的范式革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务