遇见数据集

mkd-hossain/keural-dpo-dataset

收藏
Hugging Face2026-05-13 更新2026-05-31 收录
官方服务:

资源简介:

Keural DPO数据集是一个为Keural 14.8B语言模型的直接偏好优化(DPO)训练编译的双语韩语-英语偏好数据集。该数据集包含233,227个样本,格式为提示词、首选回答和拒绝回答的组合,支持韩语和英语两种语言。数据来源于三个精选数据集:HuggingFaceH4/ultrafeedback_binarized(英语,60,630个样本,高质量AI反馈偏好对)、Anthropic/hh-rlhf(英语,159,872个样本,有帮助和无害偏好对)和Ja-ck/Orca-DPO-Pairs-KO(韩语,12,725个样本,韩语指令偏好对)。数据集旨在用于DPO对齐训练,以优化语言模型的响应质量,减少幻觉、重复、有害输出、低质量回答和错误语言响应等问题。语言分布显示英语样本占94.5%,韩语样本占5.5%。数据集遵循多个许可证,包括MIT和Apache 2.0。

Keural DPO Dataset is a merged bilingual Korean-English preference dataset compiled for DPO (Direct Preference Optimization) training of the Keural 14.8B language model. It contains 233,227 samples in a prompt-chosen-rejected format, supporting both Korean and English languages. The dataset is sourced from three curated datasets: HuggingFaceH4/ultrafeedback_binarized (English, 60,630 samples, high-quality AI feedback preference pairs), Anthropic/hh-rlhf (English, 159,872 samples, helpful and harmless preference pairs), and Ja-ck/Orca-DPO-Pairs-KO (Korean, 12,725 samples, Korean instruction preference pairs). It is designed for DPO alignment training to improve language model responses by addressing issues such as hallucination, repetitive outputs, harmful content, low-quality answers, and wrong language responses. The language distribution is 94.5% English and 5.5% Korean. The dataset is licensed under MIT and Apache 2.0 from its sources.

提供机构:
mkd-hossain
二维码
社区交流群
二维码
科研交流群
商业服务