style-adjustment-dpo_de
收藏资源简介:
Style Adjustment DPO (DE) 是一个德语直接偏好优化(DPO)数据集,旨在补充已通过LoRA微调的模型。该数据集包含三元组:提示(prompt)、首选回答(chosen)和拒绝回答(rejected)。首选回答来自基础数据集,经过手动整理,代表了期望的简洁、直接的风格;拒绝回答则是由特定模型检查点(CP273)自动生成的,反映了模型在建议、列表等方面的弱点。数据集采用JSONL格式,包含对话上下文,适用于已进行LoRA微调的模型的DPO训练,不适合单独训练。数据集由Sebastian Elsner整理,采用MIT许可证。
Style Adjustment DPO (DE) is a German Direct Preference Optimization (DPO) dataset intended to supplement models that have already undergone LoRA fine-tuning. This dataset comprises three components: prompt, chosen response, and rejected response. The chosen responses are derived from a base dataset, which has been manually curated to embody the desired concise and straightforward style. The rejected responses are automatically generated by a specific model checkpoint (CP273), reflecting the model's weaknesses in areas such as generating suggestions and structured lists. The dataset is stored in JSONL format and includes conversational context. It is designed for DPO training of LoRA-fine-tuned models and is not suitable for standalone training. This dataset was curated by Sebastian Elsner and is released under the MIT License.
数据集概述
数据集基本信息
- 数据集名称: Style Adjustment DPO (DE)
- 主要语言: 德语 (de)
- 许可协议: MIT
- 任务类别: 文本生成
- 数据规模: 1K < n < 10K
- 配置文件: default
- 数据文件: 2026-03-01_style-adjustment-dpo_de.jsonl
数据集简介
这是一个德语直接偏好优化数据集,旨在作为 sebelsn/style-adjustment-dataset_de 数据集的补充。它包含三元组:提示、偏好答案和被拒绝答案,用于对已经通过LoRA进行微调的模型进行风格精炼。
数据集详情
数据构成
- 偏好答案: 直接来源于基础数据集,经过人工整理,代表目标风格:简短、直接、不提供建议、不使用列表。
- 被拒绝答案: 由LoRA训练的第273个检查点自动生成,该检查点通过vLLM API以temperature=0设置进行查询。这些答案体现了模型的不期望行为,如建议反射、编号列表、使用“Es kann hilfreich sein”等短语,作为负面示例。
- 对话上下文: 与基础数据集不同,本数据集提取对话中的所有连续轮次,提示包含先前的对话历史,为偏好学习提供更多基础。
创建信息
- 策划者: Sebastian Elsner
- 生成模型: Kassandra CP273 (基于 Mistral 7B Instruct v0.3 的 LoRA)
- 生成语言: 德语
数据集用途
直接用途
适用于对已使用基础数据集进行微调的模型进行DPO训练。不建议用于独立训练。
推荐使用方式
在合并后的Kassandra模型上使用LoRA进行DPO训练。
超出范围的用途
- 没有事先进行LoRA微调的独立训练。
- 知识构建或事实学习。
- 基准测试或性能评估。
数据结构
数据集为JSONL格式,每个条目包含prompt、chosen和rejected字段。来自对话的提示包含完整的对话上下文。
生成与训练
生成方法
使用脚本 kassandra-dpo-gen.py 生成,输入为基础数据集,输出为本DPO数据集。生成时使用并行处理和预热请求以避免模型冷启动问题。
训练方法
使用脚本 kassandra-dpo-train.py 进行DPO训练。观察表明,秩为4时,经过3个周期训练后效果较好。
偏差、风险与限制
- 被拒绝的答案反映了CP273检查点的特定弱点。
- 该数据集是针对特定模型架构创建的,不易直接迁移到其他架构。
- 随着基础数据集的增长,本数据集的规模可能近乎指数级增长。
版本历史
版本 1 (2026-03-01)
- 首个DPO数据集,包含1389个配对。
- 偏好答案来自 style-adjustment-dataset_de v4。
- 被拒绝答案由Kassandra CP273通过vLLM生成。
- 提取了所有包含上下文的对话轮次。
- 根据提示进行了去重处理。
数据集作者
Sebastian Elsner



