W-61/qwen3-8b-base-new-dpo-ultrafeedback-4xh200-batch-128-q_t-0.4-s_star-0.6-margin
收藏资源简介:
该数据集是一个关于New-DPO训练运行过程中每一步的边缘摘要统计数据的集合。数据集包含了多个特征,如epoch、step、batch_size、mean、std、min、p10、median、p90、max、pos_frac、sample和npy等。这些特征记录了训练过程中的各种统计信息。数据集的来源是一个名为W-61/qwen3-8b-base-new-dpo-ultrafeedback-4xh200-batch-128-q_t-0.4-s_star-0.6的训练运行,基于模型jackf857/qwen3-8b-base-sft-ultrachat-4xh200-batch-128。训练过程中使用了特定的参数,如beta、f_divergence_type、f_alpha_divergence_coef、s_star、eta和q_t等。数据集还包含了数据集混合器的信息,使用了HuggingFaceH4/ultrafeedback_binarized数据集。
This dataset is a collection of per-step margin summary statistics exported from a New-DPO training run. The dataset includes multiple features such as epoch, step, batch_size, mean, std, min, p10, median, p90, max, pos_frac, sample, and npy, which record various statistical information during the training process. The dataset originates from a training run named W-61/qwen3-8b-base-new-dpo-ultrafeedback-4xh200-batch-128-q_t-0.4-s_star-0.6, based on the model jackf857/qwen3-8b-base-sft-ultrachat-4xh200-batch-128. Specific parameters were used during training, such as beta, f_divergence_type, f_alpha_divergence_coef, s_star, eta, and q_t. The dataset also includes information about the dataset mixer, which uses the HuggingFaceH4/ultrafeedback_binarized dataset.




