遇见数据集

somosnlp-hackathon-2026/paraguay-cultural-alignment

收藏
Hugging Face2026-06-26 更新2026-07-22 收录
官方服务:

资源简介:

这是一个用于巴拉圭文化对齐的西班牙语数据集,支持监督微调(SFT)和直接偏好优化(DPO)两种训练模式。数据集旨在教导模型生成符合文化对齐的文本续写,遵循一个结构化的四块模式:起始块(inicio)、基础块(base)、链接块(link)和文化块(cultural)。其中,链接块必须包含cultura guaraní短语,文化块则精确引用巴拉圭瓜拉尼语料库的片段。数据集来源于两个公开数据集:thinkPy/ultrachat-es-30k-topics(西班牙语对话)和thinkPy/corpus-cultura-paraguaya(文化语料库)。它包含三种配置:sft(用于监督微调,含训练和验证集)、dpo(用于DPO,含训练、验证和测试集)和full(完整DPO数据集)。每个样本都附带主题、文化片段和基于语义相似度与主题相关性的评分。数据集适用于学术和研究用途,促进文化对齐的语言模型训练。

A Spanish dataset for Paraguayan cultural alignment, with two training modalities: SFT (Supervised Fine-Tuning) and DPO (Direct Preference Optimization). Designed to teach models to generate culturally aligned continuations following a structured four-block pattern that connects base text with the Paraguayan Guarani corpus. The dataset includes configurations for SFT (single responses), DPO (preference pairs with train/validation/test splits), and a full DPO set. Each continuation is formatted into four sequential blocks: inicio (opening phrase), base (extracted from the prompt), link (narrative bridge requiring cultura guaraní), and cultural (exact text from the cultural corpus). The dataset is derived from public sources: thinkPy/ultrachat-es-30k-topics and thinkPy/corpus-cultura-paraguaya, and includes scores based on semantic similarity and topic relevance. It is intended for academic and research use in cultural alignment of language models.

搜集汇总
数据集介绍
somosnlp-hackathon-2026/paraguay-cultural-alignment 数据集图片
构建方式
该数据集基于两个核心来源构建而成:一是收录了带有主题与评分标签的西班牙语对话数据集 ultrachat-es-30k-topics,二是包含巴拉圭瓜拉尼文化参考文本的语料库 corpus-cultura-paraguaya。在构建过程中,研究人员以另一语言模型生成的回答作为文本基础(prompt),并从中提取具体语境细节作为base块内容。随后,通过从预先设计的约25种开场白库中选取inicio块,强制在link块中嵌入“cultura guaraní”这一自然叙事桥梁,最终从文化语料库中选取精确的文本片段作为cultural块,从而形成包含四个连续模块的完整续写。在DPO配置中,通过计算prompt与文化片段之间的语义相似度并结合主题权重,构建出评分体系,以此筛选出高相关性的chosen样本与低相关性的rejected样本。
特点
该数据集的一大特色在于其结构化的四块续写模式:inicio块的邀请式开场白、base块的情境复现、link块的自然文化桥梁以及cultural块的精准文化片段引用,使得生成的文本兼具叙事流畅性与文化深度。数据集提供了三种配置以满足不同训练需求——sft配置包含2700条训练样本和300条验证样本,用于监督微调;dpo配置提供1500条训练、200条验证及300条测试的偏好对,便于偏好优化实验;full配置则汇聚了5000条完整偏好对,适合大规模训练。每个样本均附带有主题标签、文化片段原文以及基于语义相似度和主题权重计算得出的综合评分,为模型的精细调优提供了丰富的监督信号。
使用方法
研究者可通过Hugging Face的datasets库便捷加载该数据集,根据训练阶段选择相应配置。在监督微调阶段,可加载sft配置,直接使用prompt作为输入、response作为目标输出,训练模型学会生成符合四块模式的文化对齐续写。在偏好优化阶段,可加载dpo配置,利用其预设的chosen与rejected对,配合TRL库中的DPOTrainer进行直接偏好优化训练,其中prompt字段充当输入,chosen与rejected字段分别代表偏好的正向与负向续写。也可加载full配置获得最大规模的偏好数据。数据加载后,各字段如topic、cultural_chosen等可辅助进行细致的数据分析与评估,确保模型产出在语义和文化层面均达到预期标准。
背景与挑战
背景概述
在大型语言模型快速演进的浪潮中,文化对齐已成为衡量模型智能水平与实用价值的关键维度。然而,现行绝大多数高质量对齐数据集均以英语为中心,对非英语、尤其是南美原住民文化语境的覆盖几乎空白,导致模型在处理瓜拉尼语等少数族裔语言与文化知识时表现出显著的偏见与能力缺失。2026年,由somosnlp-hackathon-2026团队创建的paraguay-cultural-alignment数据集应运而生,旨在填补这一结构性空白。该数据集以巴拉圭瓜拉尼文化为锚点,通过构建包含SFT与DPO双模态的精细化训练样本,专门训练模型生成符合瓜拉尼语语境与叙事范式的文本延续。其核心研究问题在于:如何通过结构化四段式生成模式——起始、基文、纽带与文化段——将离散的文化知识模块无缝嵌入模型应答,从而在保证语言流畅性的同时实现深层文化价值对齐。该数据集的出现为多文化语言模型的伦理设计与评估提供了开创性的基准,尤其对拉美地区本土语言文化的数字化存续具有里程碑意义。
当前挑战
该数据集所致力解决的领域挑战主要源于主流语言模型在文化多元性上的系统性缺失:现有模型普遍缺乏对瓜拉尼语系及其文化隐喻、叙事结构的理解能力,在涉及巴拉圭本土语境时往往生成语义不当或文化冒犯性内容,严重制约模型在区域化应用中的可信度与接受度。构建过程中,团队面临多重严峻挑战:首先,文化知识源的稀缺,巴拉圭瓜拉尼文化语料大多以非结构化口语形式存在,难以直接提取为可训练的机器文本;其次,语义对齐难度极高,需确保prompt与所引用文化片段之间的语义桥梁自然连贯,而非生硬拼贴;再次,评分机制的设计需要兼顾主题关联性、文化段落的语义相似度及人工经验权重三者之间的动态平衡,以避免高分低质样本污染训练效果。此外,数据规模受限于标注人才与瓜拉尼语母语者的匮乏,最终仅形成千级样本库,如何在小样本条件下保障模型泛化能力,也是当前亟待突破的技术瓶颈。
常用场景
经典使用场景
在跨文化自然语言处理研究浪潮中,paraguay-cultural-alignment 数据集致力于弥合通用大语言模型与巴拉圭本土文化之间的鸿沟。其经典使用场景聚焦于引导模型生成遵循“四段式”结构(引入、基底、衔接、文化)的文本延续,将通用语料与瓜拉尼文化语料无缝融合,进而实现语言模型在文化层面的对齐与微调。
衍生相关工作
该数据集衍生的相关工作集中体现在文化偏好对齐和跨语言微调方法的交叉领域。基于其 DPO 配置,研究者可结合 TRL 框架训练带有文化偏好的语言模型;而 SFT 配置则为后续模块化文化注入策略提供基线。类似地,围绕“基底-衔接-文化”四段式结构,催生了在文化语义评分机制、人工主题权重分配以及低资源语料硬约束条件下的生成质量评估等一系列方法论探索。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在低资源语言与文化背景下的对齐研究,创新性地将巴拉圭瓜拉尼文化与西班牙语语料融合,构建了包含SFT与DPO两阶段训练范式的文化对齐数据集。前沿方向体现在通过四段式生成结构(起始句-基础-连接-文化)迫使模型在延续文本时嵌入瓜拉尼文化片段,并利用语义相似度与主题权重计算偏好分数,实现跨文化语境下的精确生成控制。这一方法不仅回应了多语言AI中文化保留缺失的热点关切,更为其他土著语言的文化对齐提供了可复现的基准方案,对推动包容性人工智能与语言多样性保护具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务