遇见数据集

longertime/sn120-dpo-training

收藏
Hugging Face2026-03-26 更新2026-03-29 收录
官方服务:

资源简介:

# SN120 LoRA DPO Training Package LoRA DPO training to beat the top miner on Bittensor Subnet 120. ## Data - `data/dpo_train.jsonl` — 5,983 deduped DPO pairs from real validator scores - Strategy: best-of-all-miners (up to 3 unique chosen x 3 unique rejected per task) - Covers all 6 environments: GAME (1,014), LGC-v2 (983), PRINT (765), LIVEWEB (1,166), NAVWORLD (1,545), SWE-INFINITE (510) ## Quick Start on GPU VPS (8x H200) ```bash # 1. Upload this folder to your GPU VPS scp -r /root/sn120-dpo-training root@GPU_VPS_IP:/root/ # 2. SSH into GPU VPS ssh root@GPU_VPS_IP # 3. Get your base model (choose one): # Option A: Pull top miner # af pull 103 --model-path /root/BaseModel # Option B: Download from HF # huggingface-cli download EdmondMillion/affine-28-5CSriXZUwkoqdKBF4kqgRPBgrRiyPbLEo6TBaR3rW3u5qo4T \ # --local-dir /root/BaseModel --token YOUR_HF_TOKEN # Option C: Use your own model # export BASE_MODEL_PATH=/path/to/your/model # 4. Run training (~1 hour total: 30-60 min train + 20 min merge) cd /root/sn120-dpo-training bash train_dpo.sh # 5. Upload trained model huggingface-cli upload YOUR_USER/Affine-SN120-DPO ./model_output_dpo # 6. Back on your VPS, deploy: af chutes_push --repo YOUR_USER/Affine-SN120-DPO --revision SHA af commit --repo YOUR_USER/Affine-SN120-DPO --revision SHA --chute-id ID ``` ## Training Details | Setting | Value | |---------|-------| | Method | LoRA DPO (PEFT) | | LoRA rank | 64 | | LoRA alpha | 128 | | LoRA targets | q_proj, k_proj, v_proj, o_proj | | Trainable params | ~80M (0.25% of 32B) | | Learning rate | 5e-5 | | DPO beta | 0.1 | | Batch size | 1 x 8 grad_accum x 8 GPUs = 64 effective | | Epochs | 2 | | Max length | 4096 | | Precision | bfloat16 | | DeepSpeed | ZeRO-3 | | Est. time | ~30-60 min train + 20 min merge | ## DPO Data Per Environment | Env | Tasks w/ Signal | DPO Pairs | Chosen Threshold | |-----|----------------|-----------|-----------------| | GAME (3x) | 159 | 1,014 | >= 0.5 | | LGC-v2 | 198 | 983 | >= 1.0 | | PRINT | 122 | 765 | >= 1.0 | | LIVEWEB | 193 | 1,166 | >= 0.5 | | NAVWORLD | 187 | 1,545 | >= 0.5 | | SWE-INFINITE | 126 | 510 | >= 1.0 | | **Total** | **985** | **5,983** | | ## Why LoRA Instead of Full Fine-Tuning - 5,983 pairs / 32B params = extreme overfitting risk with FFT - 5,983 pairs / 80M LoRA params = healthy ratio, natural regularization - Base model knowledge preserved (frozen weights) - Faster (30-60 min vs 2-3 hrs), cheaper (~$8 vs $20) - Merged model is identical architecture -- no inference overhead

# SN120 LoRA DPO 训练套件 本套件用于开展LoRA DPO训练,旨在击败Bittensor子网120(Bittensor Subnet 120)中的顶级矿工节点。 ## 数据集 - 数据集文件`data/dpo_train.jsonl`:包含5983条去重后的DPO样本对,数据来源于真实验证节点的评分结果 - 训练策略:全矿工最优选择策略(每个任务最多选取3条独特的优选样本与3条独特的弃选样本) - 覆盖全部6类测试环境:GAME(1014条)、LGC-v2(983条)、PRINT(765条)、LIVEWEB(1166条)、NAWWORLD(1545条)、SWE-INFINITE(510条) ## 搭载8张H200显卡的GPU虚拟专用服务器(GPU Virtual Private Server,简称GPU VPS)快速启动指南 bash # 1. 将本文件夹上传至你的GPU VPS scp -r /root/sn120-dpo-training root@GPU_VPS_IP:/root/ # 2. 通过SSH连接至GPU VPS ssh root@GPU_VPS_IP # 3. 获取基础模型(三选一): # 选项A:拉取顶级矿工模型 # af pull 103 --model-path /root/BaseModel # 选项B:从Hugging Face(HF)下载 # huggingface-cli download EdmondMillion/affine-28-5CSriXZUwkoqdKBF4kqgRPBgrRiyPbLEo6TBaR3rW3u5qo4T # --local-dir /root/BaseModel --token YOUR_HF_TOKEN # 选项C:使用自定义模型 # export BASE_MODEL_PATH=/path/to/your/model # 4. 启动训练(总耗时约1小时:训练耗时30-60分钟,模型合并耗时20分钟) cd /root/sn120-dpo-training bash train_dpo.sh # 5. 上传训练完成的模型 huggingface-cli upload YOUR_USER/Affine-SN120-DPO ./model_output_dpo # 6. 返回至GPU VPS,执行部署: af chutes_push --repo YOUR_USER/Affine-SN120-DPO --revision SHA af commit --repo YOUR_USER/Affine-SN120-DPO --revision SHA --chute-id ID ## 训练详情 | 配置项 | 参数值 | |---------|-------| | 训练方法 | LoRA DPO(参数高效微调,Parameter-Efficient Fine-Tuning,简称PEFT) | | LoRA秩 | 64 | | LoRA缩放系数 | 128 | | LoRA适配目标层 | q_proj、k_proj、v_proj、o_proj | | 可训练参数量 | 约8000万(占320亿总参数量的0.25%) | | 学习率 | 5e-5(5×10^-5) | | DPO超参数β | 0.1 | | 有效批次大小 | 1×8梯度累积×8GPU = 64 | | 训练轮次 | 2 | | 最大序列长度 | 4096 | | 训练精度 | bfloat16 | | 分布式训练框架 | DeepSpeed ZeRO-3 | | 预计耗时 | 训练约30-60分钟,模型合并约20分钟 | ## 各测试环境DPO数据集详情 | 测试环境 | 带标注信号的任务数 | DPO样本对数量 | 优选样本阈值 | |-----|----------------|-----------|-----------------| | GAME(3倍采样) | 159 | 1014 | ≥0.5 | | LGC-v2 | 198 | 983 | ≥1.0 | | PRINT | 122 | 765 | ≥1.0 | | LIVEWEB | 193 | 1166 | ≥0.5 | | NAVWORLD | 187 | 1545 | ≥0.5 | | SWE-INFINITE | 126 | 510 | ≥1.0 | | **总计** | **985** | **5983** | | ## 为何选用LoRA而非全量微调 - 5983条样本对 / 320亿总参数量:采用全量微调会存在极高的过拟合风险 - 5983条样本对 / 8000万LoRA参数量:参数比例合理,具备天然的正则化效果 - 保留基础模型的预训练知识(权重冻结) - 训练速度更快(30-60分钟 vs 2-3小时),成本更低(约8美元 vs 20美元) - 合并后的模型架构与原模型完全一致,无推理开销

提供机构:
longertime
二维码
社区交流群
二维码
科研交流群
商业服务