somosnlp-hackathon-2026/paraguay-cultural-alignment
收藏资源简介:
这是一个用于巴拉圭文化对齐的西班牙语数据集,支持监督微调(SFT)和直接偏好优化(DPO)两种训练模式。数据集旨在教导模型生成符合文化对齐的文本续写,遵循一个结构化的四块模式:起始块(inicio)、基础块(base)、链接块(link)和文化块(cultural)。其中,链接块必须包含cultura guaraní短语,文化块则精确引用巴拉圭瓜拉尼语料库的片段。数据集来源于两个公开数据集:thinkPy/ultrachat-es-30k-topics(西班牙语对话)和thinkPy/corpus-cultura-paraguaya(文化语料库)。它包含三种配置:sft(用于监督微调,含训练和验证集)、dpo(用于DPO,含训练、验证和测试集)和full(完整DPO数据集)。每个样本都附带主题、文化片段和基于语义相似度与主题相关性的评分。数据集适用于学术和研究用途,促进文化对齐的语言模型训练。
A Spanish dataset for Paraguayan cultural alignment, with two training modalities: SFT (Supervised Fine-Tuning) and DPO (Direct Preference Optimization). Designed to teach models to generate culturally aligned continuations following a structured four-block pattern that connects base text with the Paraguayan Guarani corpus. The dataset includes configurations for SFT (single responses), DPO (preference pairs with train/validation/test splits), and a full DPO set. Each continuation is formatted into four sequential blocks: inicio (opening phrase), base (extracted from the prompt), link (narrative bridge requiring cultura guaraní), and cultural (exact text from the cultural corpus). The dataset is derived from public sources: thinkPy/ultrachat-es-30k-topics and thinkPy/corpus-cultura-paraguaya, and includes scores based on semantic similarity and topic relevance. It is intended for academic and research use in cultural alignment of language models.




