teacher_train
收藏官方服务:
资源简介:
Reasoning Traces for SFT & DPO
适用于监督微调(Supervised Fine-Tuning,SFT)与直接偏好优化(Direct Preference Optimization,DPO)的推理轨迹
创建时间:
2026-01-12

Reasoning Traces for SFT & DPO
适用于监督微调(Supervised Fine-Tuning,SFT)与直接偏好优化(Direct Preference Optimization,DPO)的推理轨迹