遇见数据集

dataset_aeroespacial_cultural_completo.csv

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

LATAM航空航天文化问答数据集是一个文化对齐的对话数据集,专门用于西班牙语和葡萄牙语的伊比利亚美洲航空航天历史。该数据集旨在解决现有公共训练数据集中拉丁美洲、西班牙和葡萄牙航空航天历史代表性不足的问题,这些问题包括英语内容主导、自动翻译缺乏文化背景、缺乏方言多样性以及对话不自然。数据集包含1716个多轮对话示例,覆盖西班牙语和葡萄牙语,并代表18个国家。内容聚焦于伊比利亚美洲的航空航天历史,涵盖卫星和太空任务、国家太空计划(如CONAE、INPE、AEB、FACH)、火箭历史、技术地缘政治与冷战、区域合作(如巴西-中国合作、CBERS)以及拉丁美洲和西班牙的科学遗产。每个示例遵循文化偏好对话格式,包含唯一标识符、交互类型、提示(由事实背景和用户/助手对话组成)、质量评估(接受/拒绝)、文化子类别及关联国家。数据集通过手动策划(80个高质量示例,含真实区域习语)和从西班牙语及葡萄牙语维基百科严格过滤提取(1636个示例)的方法构建,注重融入真实方言变体,如智利口语、里奥普拉特方言、墨西哥方言、古巴方言和巴西葡萄牙语。适用于多种任务,包括西班牙语和葡萄牙语的监督微调、文化对齐的指令调优、航空航天历史教育聊天机器人、多语言跨文化问答基准测试、大型语言模型的文化对齐评估以及利用历史检索增强生成。

The LATAM Aerospace Cultural Q&A Dataset is a culturally aligned conversational dataset dedicated to Ibero-American aerospace history in Spanish and Portuguese. This dataset aims to address the underrepresentation of aerospace history related to Latin America, Spain, and Portugal in existing public training datasets, including issues such as the dominance of English-language content, lack of cultural context in automatic translations, insufficient dialectal diversity, and unnatural dialogues. The dataset contains 1716 multi-turn dialogue examples covering Spanish and Portuguese, spanning 18 countries. Its content focuses on Ibero-American aerospace history, covering satellites and space missions, national space programs (such as CONAE, INPE, AEB, FACH), rocket history, technological geopolitics and the Cold War, regional cooperation (such as Brazil-China cooperation, CBERS), and the scientific legacies of Latin America and Spain. Each example follows a culturally preferred dialogue format, including a unique identifier, interaction type, prompt (composed of factual background and user/assistant dialogues), quality assessment (accepted/rejected), cultural subcategory, and associated countries. The dataset is constructed through two methods: manual curation (80 high-quality examples containing authentic regional idioms) and strict filtering and extraction from Spanish and Portuguese Wikipedia (1636 examples), placing emphasis on integrating authentic dialectal variants such as Chilean colloquial speech, Rioplatense Spanish, Mexican Spanish dialects, Cuban Spanish dialects, and Brazilian Portuguese. It is applicable to a variety of tasks, including supervised fine-tuning for Spanish and Portuguese, culturally aligned instruction tuning, aerospace history educational chatbots, multilingual cross-cultural Q&A benchmark tests, cultural alignment evaluation for large language models (LLMs), and historical retrieval-augmented generation (RAG).

创建时间:
2026-05-24
搜集汇总
数据集介绍
dataset_aeroespacial_cultural_completo.csv 数据集图片
构建方式
该数据集聚焦于伊比利亚美洲航空航天文化领域,旨在弥补现有公开数据集中该区域历史与方言表达严重缺失的短板。构建过程分为两个阶段:首先通过人工精心策划80个高质量样本,这些样本融入了真实的地域习语并经过历史准确性与对话自然度的双重验证;随后从西班牙语和葡萄牙语维基百科语料库中,利用严格的关键词过滤机制(确保标题包含航空航天关键词且正文至少出现三次相关提及)提取出1,636个补充样本。最终形成了包含1,716个多轮对话样本的数据集,覆盖18个国家,语种涵盖西班牙语和葡萄牙语。
使用方法
该数据集适用于多种场景,尤其适合监督式微调(SFT)与文化对齐的指令微调,可显著提升西班牙语和葡萄牙语模型在航空航天历史问答中的文化适切性。用户可直接利用对话式prompt字段进行序列建模训练,或基于target_decision字段开展质量偏好学习。研究者还可将其构建为多语言跨文化问答基准,用于评估LLMs的文化感知能力,或结合上下文信息实现基于检索增强生成(RAG)的历史知识问答系统。数据集采用apache-2.0许可证,方便学术与工业界自由使用。
背景与挑战
背景概述
该数据集名为LATAM Aerospace Cultural QA,创建于2026年,由研究人员AngelGabrielTroncoso在#HackathonSomosNLP 2026黑客松中开发,旨在回应“LLMs是否真正具有多元文化”这一核心研究问题。拉丁美洲、西班牙与葡萄牙的航空航天历史在主流训练数据中长期被英文内容主导,且常依赖缺乏文化语境的机器翻译,导致该区域的历史贡献与语言多样性被严重边缘化。该数据集通过精心整理的1,716条多轮对话样本,覆盖18个国家和方言变体,首次系统性地将伊比利亚美洲的航空航天遗产引入自然语言处理研究,为评估和提升大语言模型的文化对齐能力提供了宝贵基准,对推动多语言、多文化AI研究具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于:当前大语言模型在非英语、非主流文化场景中表现欠佳,缺乏对伊比利亚美洲航空航天历史的真实文化嵌入和方言理解,导致生成的回复机械化且脱离当地语境。构建过程亦面临多重挑战:首先,历史资料分布不均,许多国家(如葡萄牙、古巴)的公开记录有限,导致覆盖不均衡;其次,确保方言的真实性与历史准确性之间需精巧平衡,手动校验的80条高质量样本虽富地域特色,但大规模依赖维基百科提取的1,636条事实性回答却难以即时代入地道语感;最后,如何处理无明确国别的“拉美”通用内容,以避免泛化信息对训练质量的稀释,也是一项关键难题。
常用场景
经典使用场景
该数据集最经典的使用场景在于为西班牙语和葡萄牙语的大型语言模型提供文化对齐的监督式微调(SFT)与指令微调(Instruction Tuning)训练数据。其以多轮对话形式呈现,每个样本包含详尽的上下文提示与目标决策标签,能够有效引导模型学习伊比利亚美洲地区独特的航空航天历史叙述风格与地域性表达习惯。研究者常借助该数据集对预训练模型进行领域内文化适配微调,从而在问答系统与对话生成任务中产出符合拉美及伊比利亚文化语境的输出。
解决学术问题
该数据集着力解决当前公开训练语料库中拉丁美洲、西班牙及葡萄牙航空航天历史内容严重匮乏的学术困境。现有资源多由英语主导且依赖机器翻译,缺失真实的伊比利亚美洲方言多样性和文化背景,导致模型在多语言、跨文化场景下产生机械生硬的回答。通过提供1716个经人工审核的对话样本,该数据集为评估和改进LLM的文化对齐能力提供了量化基准,推动了多语言问答评测(Benchmark QA)及文化适应性研究的发展,其意义在于弥补非英语语系科技史语料的空白。
实际应用
在实际应用中,该数据集可赋能教育领域,用于开发面向伊比利亚美洲学生的航空航天历史智能问答系统或聊天机器人,使其能够以自然的口语化形式(如智利俚语、墨西哥俗语)互动学习本地航天成就。同时,它可作为检索增强生成(RAG)管道的知识源,辅助构建历史人物或事件的智能客服助手。此外,数据集还能支撑企业级跨国文化敏感度测试工具,帮助评估和优化面向西葡语用户的产品对话界面,提升用户体验的区域化适配水平。
数据集最近研究
最新研究方向
该数据集聚焦于伊比利亚美洲航空航天历史文化遗产在大型语言模型中的低资源表征问题,通过构建包含18个国家、西班牙语与葡萄牙语多方言变体(如智利口语、拉普拉塔河方言、墨西哥俚语)的1,716条多轮对话样本,旨在矫正当前主流数据集以英语为中心、缺乏文化语境与方言多样性的偏差。其前沿研究方向体现在两个维度:一是利用人工精修与维基百科过滤相结合的双阶段方法论,在保证历史准确性的同时嵌入真实口语化表达,为低资源语言的精细指令微调与多语种QA评测提供高价值基准;二是响应2026年SomosNLP黑客松‘LLMs是否真正具备多文化能力?’的核心议题,推动模型在航空航天史问答中实现从表层翻译到深层文化规约对齐的跨越,填补伊比利亚美洲科技叙事在全球AI生态中的结构性空缺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务