CL-From-Nothing/RLVE-Eval20-Qwen3-4B-SSD-N20-SFT-Train
收藏数据链接:
官方服务:
资源简介:
该数据集是针对Qwen3-4B模型进行简单自蒸馏(SSD)训练的自生成监督微调(SFT)语料库。它基于800个经过筛选的RLVE Eval20提示,每个提示生成20个自样本,总计16,000行数据。数据采样自冻结的Qwen3-4B模型(使用vLLM推理库,最大令牌数为16384,并启用了思考功能)。数据以VERL MultiTurnSFTDataset的parquet格式存储,包含messages列,适用于多轮对话的文本生成任务。
Self-generated SFT corpus for Simple Self-Distillation (SSD) with Qwen/Qwen3-4B. Contains 800 filtered RLVE Eval20 prompts, each with 20 self-samples, totaling 16,000 rows. Sampled from frozen Qwen3-4B (using vLLM, max_tokens=16384, with thinking enabled). Stored as VERL MultiTurnSFTDataset parquet format with a messages column, suitable for multi-turn text generation tasks.
提供机构:
CL-From-Nothing


