遇见数据集

dpo-icelandic-interpreted

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是冰岛语版本的直接偏好优化(DPO)配对数据,源自原始数据集 argilla/ultrafeedback-binarized-preferences-cleaned。所有数据经过翻译和文化适应,以贴合冰岛语习惯和本地文化。生成过程中使用了 kimi-k3 模型,并采用专门的提示策略,避免产生直译腔或机械翻译。具体而言,该模型被指示将提示和首选回答高度本地化,同时刻意生成一个质量低下的拒绝回答,其中包含糟糕的翻译、过多的英语借词(冰英混杂)或美国中心幻觉。这种设计旨在为 DPO/RLHF 训练提供高质量、针对性强的信号,引导模型偏好地道、文化契合的冰岛语,而非死板的词典翻译。数据集包含以下字段:prompt(文化适应的冰岛语提示)、chosen(高质量地道冰岛语回答)、rejected(低质量翻译回答)、language(目标语言,此处为冰岛语)。许可证沿用源数据集的 MIT 许可证。

This dataset is an Icelandic version of Direct Preference Optimization (DPO) paired data, derived from the original dataset argilla/ultrafeedback-binarized-preferences-cleaned. All data has been translated and culturally adapted to align with Icelandic language habits and local culture. The generation process used the kimi-k3 model with a specialized prompting strategy to avoid translationese or machine translation. Specifically, the model was instructed to highly localize the prompt and chosen response, while deliberately generating a low-quality rejected response containing poor translation, excessive English loanwords (Icelandic-English mixing), or American-centric hallucinations. This design aims to provide high-quality, targeted signals for DPO/RLHF training, guiding the model to prefer natural, culturally appropriate Icelandic over rigid dictionary translations. The dataset includes the following fields: prompt (culturally adapted Icelandic prompt), chosen (high-quality, natural Icelandic response), rejected (low-quality translated response), language (target language, here Icelandic). The license follows the original datasets MIT license.

创建时间:
2026-09-23
原始信息汇总

DPO Icelandic Interpreted 数据集概述

数据集基本信息

  • 数据集地址:https://huggingface.co/datasets/jonasaise/dpo-icelandic-interpreted
  • 语言:冰岛语(is)
  • 许可证:MIT
  • 标签:dpo、rlhf、ultrafeedback、synthetic、kimi-k3、icelandic
  • 配置名称:default
  • 数据文件路径:data/**/*.parquet
  • 数据划分:train

数据集描述

该数据集包含从原始数据集 argilla/ultrafeedback-binarized-preferences-cleaned 翻译并进行文化适配为冰岛语的直接偏好优化(DPO)配对数据。

来源与方法论

  • 源数据集:argilla/ultrafeedback-binarized-preferences-cleaned
  • 用于合成的模型:kimi-k3(通过本地端点)
  • 翻译策略:数据集使用专门设计的提示词生成,以防止“翻译腔”和直接直译。kimi-k3 模型被指示对提示词和被选回答进行深度本地化,以贴合冰岛文化和习语。此外,该模型特意生成一个被拒回答,该回答存在翻译质量差、过多英语外来词(Swenglish/Ice-lish)或美国中心主义的幻觉内容。这为 DPO/RLHF 提供了高质量、有针对性的信号,用于教导模型偏好真实、具有文化根基的冰岛语,而非机械的字典式翻译。

数据结构

数据集包含以下字段:

  • prompt:经过文化适配的冰岛语提示词。
  • chosen:高质量、地道的冰岛语回答。
  • rejected:翻译质量差、未经校准的回答。
  • language:该行的目标语言。

许可证

该数据集继承其源数据集 argilla/ultrafeedback-binarized-preferences-cleaned 的许可证(MIT)。

搜集汇总
数据集介绍
dpo-icelandic-interpreted 数据集图片
构建方式
在直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)日益成为对齐大语言模型核心范式的背景下,该数据集以argilla/ultrafeedback-binarized-preferences-cleaned为源语料,借助本地部署的kimi-k3模型完成合成。构建过程采用专门设计的提示,以抑制翻译腔与逐字直译,要求模型将提示与优选回答深度本地化,使其贴合冰岛文化语境与惯用表达;同时刻意生成带有劣质翻译、过量英语借词或美国中心幻觉的拒绝回答,从而形成高质量的偏好信号对。
特点
该数据集以冰岛语为目标语言,聚焦真实、具文化根基的表达与机械式词典翻译之间的偏好分野。其核心特征在于偏好对并非简单译自英文,而是经由文化适配后重构,优选回答体现地道冰岛语惯用法,拒绝回答则暴露出翻译生硬、借词泛滥或文化错位等缺陷。数据字段涵盖prompt、chosen、rejected与language,配置简洁,仅含训练划分,以parquet格式存储,便于直接加载。
使用方法
该数据集适用于DPO或RLHF训练流程,可直接通过HuggingFace datasets库加载默认配置,读取train划分中的parquet文件。使用时将prompt作为输入,chosen与rejected分别作为正负偏好样本,引导模型在冰岛语生成中偏向文化地道、表达自然的回答,抑制直译与借词滥用。训练中可结合标准DPO损失函数,对模型进行偏好对齐,提升其在冰岛语语境下的生成质量与本地化程度。
背景与挑战
背景概述
随着大语言模型在多语言场景中的广泛应用,低资源语言的偏好对齐已成为制约其全球化部署的关键瓶颈。冰岛语作为仅有约三十余万使用者的脆弱语言,长期缺乏高质量的偏好优化数据,模型输出常呈现翻译腔或英语化倾向。为此,研究者依托argilla/ultrafeedback-binarized-preferences-cleaned源数据集,借助kimi-k3模型进行文化适配与转译,构建了dpo-icelandic-interpreted数据集,旨在为冰岛语模型提供直接偏好优化信号。该数据集通过精心设计的提示词抑制直译痕迹,并刻意生成带有翻译缺陷和英语借词的劣质回复,从而推动模型习得地道且文化根植的冰岛语表达,对低资源语言对齐研究具有示范意义。
当前挑战
该数据集所应对的领域问题在于,主流偏好优化数据多集中于英语等高资源语言,低资源语言因缺乏母语标注者而难以获得高质量对齐信号,冰岛语模型因此易陷入翻译腔与英语借词泛滥的困境。构建过程中的挑战尤为突出:如何在缺乏大规模母语语料的前提下,通过合成方式生成兼具文化适配性与语言地道性的偏好对;如何设计提示词以避免翻译腔,同时确保劣质回复能够提供有效的负向信号;以及如何平衡合成数据与真实语言使用之间的差距,防止模型习得虚假的文化幻觉。上述挑战共同构成了该数据集在低资源语言偏好对齐中的核心难点。
常用场景
经典使用场景
在低资源语言对齐研究中,该数据集最经典的用途是执行直接偏好优化(DPO)训练,使冰岛语大模型习得对本土化表达的偏好。其核心机制在于每一组样本均呈现同一提示下的高质量冰岛语回应与带有翻译腔或英语借词的低质回应,模型通过对比二者概率分布,逐步校准生成策略,从而抑制机械直译与美式文化幻觉,培育出贴合冰岛语用习惯的回应风格。
实际应用
在冰岛语自然语言处理落地场景中,该数据集可直接服务于本地化对话系统、内容生成工具与教育辅助平台的模型微调。通过训练模型偏好地道冰岛语表达,能够提升政府公共服务、新闻摘要与客户支持等应用的语言亲和力,减少因直译导致的理解偏差,从而增强用户体验,并为冰岛语数字生态的语言技术产品提供可靠的数据支撑。
衍生相关工作
该数据集衍生了多项围绕低资源语言偏好优化的经典工作,包括冰岛语指令微调模型的DPO变体、跨语言文化适配的偏好数据合成方法,以及针对翻译腔检测的评估基准。研究者基于此进一步探索了合成偏好对在其他北欧语言中的迁移策略,并推动了ultrafeedback框架在极低资源语言中的适应性改进,形成了一系列语言特异性对齐的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务