遇见数据集

somosnlp-2026-aerospace

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

Aerospace Cultural Benchmark (LatAm) 是一个专门用于评估大型语言模型在专业领域表现的数据集。其核心目标是衡量模型在拉丁美洲(特别是智利)航空航天与文化语境下,生成教育性、技术性且文化连贯的回答的能力。该数据集包含100个经过人工审核的开放式问题,这些问题由claude-sonnet-4-20240515模型合成生成,并经过严格筛选以确保质量和可重用性。每个数据样本包含12个字段,除了问题本身和由LLM生成并审核的参考答案外,还附带了丰富的模拟用户人口统计信息,如年龄(15-63岁)、性别(男性、女性、非二元)、智利所属地区、教育水平、收入阶层、音乐偏好和职业,旨在为评估模型针对不同受众的语境适应能力提供多维背景。数据集内容覆盖智利卫星技术、天文台、空间机构、国际合作以及航天领域的社会经济影响等多个技术主题,并强调文化本地化。它被设计为一个基准测试工具,适用于模型评估、微调、文化适应性分析、偏见检测以及作为生成新数据集的模板。数据集的局限性在于其地理焦点主要限于智利,参考答案可能存在细微的不准确性,并且对拥有天文台的智利北部地区存在地理偏见。

Aerospace Cultural Benchmark (LatAm) is a dataset specifically designed for evaluating the performance of large language models in professional domains. Its core objective is to measure the models ability to generate educational, technical, and culturally coherent responses in the aerospace and cultural context of Latin America, particularly Chile. The dataset contains 100 manually reviewed open-ended questions, which are synthesized and generated by the `claude-sonnet-4-20240515` model and rigorously screened for quality and reusability. Each data sample includes 12 fields, encompassing the question itself, reference answers generated and reviewed by LLMs, and rich simulated user demographic information such as age (15-63), gender (male, female, non-binary), region in Chile, education level, income class, music preferences, and occupation, aiming to provide multi-dimensional context for evaluating the models contextual adaptation to different audiences. The dataset content covers multiple technical topics, including Chilean satellite technology, observatories, space agencies, international cooperation, and the socio-economic impact of the aerospace field, with an emphasis on cultural localization. It is designed as a benchmark tool suitable for model evaluation, fine-tuning, cultural adaptability analysis, bias detection, and as a template for generating new datasets. Limitations of the dataset include its geographical focus primarily limited to Chile, potential subtle inaccuracies in reference answers, and geographical bias towards northern Chile, which has observatories.

创建时间:
2026-05-25
原始信息汇总

数据集名称:Aerospace Cultural Benchmark (LatAm)

描述

该数据集包含 100 道精选开放性问题,聚焦航空航天领域,并具有强烈的拉丁美洲(特别是智利)文化本地化特征。旨在提供一个高质量基准,用于评估大型语言模型在专业背景下生成教育性、技术性和文化一致性回答的能力。所有问题均使用 claude-sonnet-4-20250514 生成,并由人工逐一审查。

数据集结构

该数据集包含 12 列

列名 类型 描述
id int 唯一标识符 (1-100)
pais str 上下文国家 (智利)
pregunta str 关于航空航天/天文学的开放性问题
respuesta str 参考回答 (由 LLM 生成,经人工审查)
edad int 模拟用户档案的年龄
genero str 档案性别 (男性,女性,非二元)
region str 智利地区
educacion str 教育水平 (基础、中等、技术、大学、研究生)
nivel_ingresos str 社会经济收入水平 (低、中、中高、高)
musica_favorita str 档案音乐偏好 (用于人口统计分析)
vocacion str 档案的职业/志向
modelo_gen str 用于生成问题和回答的 LLM 模型

数据集摘要

该数据集与传统基准测试不同,它使用开放、可复用的问题,可用于多个数据集或不同上下文。问题被设计用于评估:

  • 情境知识:对拉丁美洲背景下航空航天产业的理解。
  • 技术推理:解释复杂概念而不使之过于简化的能力。
  • 文化一致性:使语言风格适应本地受众。
  • 可迁移性:足够通用,能在其他数据集中使用的问题。

质量验证

  • 所有问题均使用 claude-sonnet-4-20250514 生成。
  • 每行包含 modelo_gen 列作为生成模型的标识符。
  • 每个问题和回答均经过人工审查。
  • 100% 的问题为开放性和可复用性问题。
  • 用需要推理和论证的问题替换了 12 道封闭式(琐事型)问题。

创建方法

问题依据以下规则设计:

  1. 问题开放性:允许多个有效答案,展示对主题的理解、批判性分析、技术推理和历史或文化视角。
  2. 文化情境化:地理重点在智利、拉丁美洲和特定区域;包含100个不同年龄、性别、教育背景和收入的多样化人口档案;包含本地音乐和职业偏好以进行人口统计分析。
  3. 技术领域:涵盖智利卫星及航天技术 (SSOT, SUCHAI, FASat)、天文学及观测站 (ALMA, ESO, Paranal, La Silla, CTIO)、航天机构与国际合作、航天领域的社会经济与教育影响、天文观测与科学发现。
  4. 人类质量:确保非琐碎性、中立性、文化多元性和可验证性。

涵盖维度

维度 描述
知识 关于拉丁美洲背景下航空航天/天文学的技术知识
推理 解释“为什么”和“为了什么”的能力
情境化 适应特定人口档案的能力
文化一致性 使用适合拉丁美洲的语言风格
可迁移性 在其他数据集中的可复用性

数据集分布

  • 总记录数:100
  • 国家:智利 (拉丁美洲地区)
  • 覆盖地区:智利15个大区
  • 年龄范围:15-63岁
  • 教育水平:5个级别
  • 性别分布:男性,女性,非二元

用例

  1. 在专业背景下评估 LLM。
  2. 多语言基准测试(评估拉丁美洲西班牙语的一致性)。
  3. 微调模型以利用区域视角回答航空航天主题。
  4. 分析模型如何根据不同人口统计信息调整回答。
  5. 检测关于拉丁美洲、STEM领域女性、原住民的偏见。
  6. 将问题用作模板来创建新数据集。

局限性

  • 数据集仅聚焦于拉丁美洲内一个特定国家(智利),无法覆盖该地区的全部多样性。
  • 参考回答由 LLM 生成,虽经人工审查,仍可能存在细微不准确或偏见。
  • 存在地理偏见,偏向于拥有天文观测站的地区(智利北部)。
  • 未涵盖补充性的航空航天学科(如火箭工程、拉丁美洲私营航天产业)。

许可和归属

  • 数据许可:Apache 2.0。
  • 生成内容归属:问题和回答由 Anthropic 的 Claude (claude-sonnet-4-20250514) 生成,使用条款允许在其他 LLM 的训练中使用其输出。数据集中包含 modelo_gen 列,并且每个问题/回答均经过人工审查。

版本

  • v1.0 (2026年1月):包含100个经过验证问题的初始版本。重组了12个问题以确保开放性和可复用性。包含 modelo_gen 列以实现可追溯性。为100个记录提供了完整的人口统计档案。已完成人工质量验证。
搜集汇总
数据集介绍
somosnlp-2026-aerospace 数据集图片
构建方式
该数据集的构建始于对拉丁美洲航空航天与天文领域知识的系统梳理,尤其聚焦于智利这一具有鲜明地缘特色的国家。所有100道开放式问题均借助Claude Sonnet-4-20250514模型进行合成生成,并经过严格的人工逐条审核与修订,以确保每道问题兼具教育性、技术准确性与文化适应性。特别是在构建过程中,团队剔除了12道事实性琐碎问题,将其重构为能够激发批判性思维与论证能力的推理型提问,从而强化了数据集的评测深度与可复用性。每一条记录均包含完整的元数据字段,如国家、地区、教育水平及模拟用户画像,为多维度评估提供了坚实的数据基础。
使用方法
研究者可直接通过Hugging Face Hub以datasets库加载该数据集,获取包含问题、参考答案及丰富人口统计学特征的完整表格。在实际评测中,可将每一道问题输入待评估的LLM,获取其生成的答案后,与数据集中的人工审核参考答案进行语义相似度或分维度的能力映射比较,以衡量模型在技术推理、文化适配与知识迁移方面的表现。该数据集亦支持分组分析,例如按教育水平或地区对模型输出进行分层统计,从而发现潜在的偏见与盲区。此外,其开放式问题设计允许被用作数据增强的模板,辅助构建面向航天科普或地区文化研究的定制化数据集。
背景与挑战
背景概述
该数据集名为 Aerospace Cultural Benchmark (LatAm),由 SomosNLP 团队于 2026 年 1 月创建,专注于拉丁美洲(尤其是智利)航空航天与天文学领域的文化适应性评估。其核心研究问题在于如何构建一个兼顾技术深度与区域文化背景的开放问答基准,以衡量大语言模型在特定领域中的知识储备、推理能力与文化连贯性。该数据集通过 100 道经人工审核的开放问题,覆盖智利卫星技术、天文观测设施(如 ALMA、ESO)及国际协作等主题,弥补了传统基准测试缺乏地域语境与文化敏感性的不足,对推动多语言、多文化场景下的 LLM 评估具有重要参考价值。
当前挑战
该数据集首要应对的领域挑战在于:传统基准测试多聚焦于去语境化的知识问答,难以评估模型在拉美特定文化背景下的技术推理与文化适配能力,而航空航天领域在拉丁美洲的发展具有独特的地缘政治与历史轨迹,需要模型具备非中心化的知识理解。在构建层面,挑战包括如何将原本为封闭式事实问答的 12 道题目转化为能激发深度推理的开放问题,同时避免引入政治或性别偏见;此外,虽然所有问答均由 Claude Sonnet-4 生成并人工审核,但受限于单一模型输出,参考回答可能隐含细微不准确或视角局限,且数据集仅包含智利一国样本,难以覆盖整个拉丁美洲的多元文化图景,从而限制了其泛化性与地域代表性。
常用场景
经典使用场景
该数据集作为面向拉丁美洲航空航天领域的文化基准,其经典使用场景在于评估大语言模型在专业且文化本地化的开放问答任务中的综合能力。与常规问答基准不同,该数据集精心设计了100道开放性问题,覆盖智利及拉丁美洲的卫星技术、天文观测、空间政策等多个子领域,并融合了地域文化特征与多样化的人口统计信息。研究者可利用此数据集衡量模型在技术知识、逻辑推理、文化适配以及语言迁移性等多维度上的表现,为开发更具区域包容性的智能系统提供标准化的评测平台。
解决学术问题
该数据集有效回应了当前学术研究中对语言模型区域文化适配性评估不足的突出问题。传统基准通常依赖脱离语境的简单事实问答,难以衡量模型在非英语地区、特别是拉丁美洲传统文化语境下的推理与表达能力。该数据集通过引入丰富的区域性人口统计属性,如地理区域、教育水平、收入层级和文化偏好,使研究者能够系统性地探查模型在回答中是否存在文化偏差、性别刻板印象或地域理解偏差,为推进更公平、更具文化包容性的人工智能评估体系提供了理论依据与实证基础。
实际应用
在实际应用层面,该数据集为面向拉丁美洲用户的语言模型本地化部署提供了重要支撑工具。企业或科研机构可利用数据集对模型进行精细调优与多轮迭代,以提升其在航空航天科普、区域教育咨询、面向特定群体的技术传播等场景中的表现。结合数据集中丰富的用户画像信息,开发者还可以定制个性化的回答风格与内容深度,从而在智能客服、虚拟教育助手、博物馆导览等实际产品中实现更为自然且符合当地文化习惯的人机交互体验。
数据集最近研究
最新研究方向
该数据集聚焦于拉丁美洲(尤其智利)航天领域的文化适配性基准测试,前沿研究方向在于评估大语言模型在区域性专业知识、技术推理与文化一致性方面的综合表现。结合拉美航天产业崛起与智利在天文观测领域的全球地位,该基准通过开放性问题设计,系统考察模型对地方性技术叙事(如本国卫星项目、天文台合作)的语义理解与语境迁移能力,为多语言、多文化背景下的LLM鲁棒性评估提供了可复用的评测框架与人口统计控制样本,对推动包容性人工智能和减少地域性知识鸿沟具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务