遇见数据集

video-lens

收藏
魔搭社区2026-07-15 更新2026-07-15 收录
官方服务:

资源简介:

# VimLens 训练包(新服务器部署) GRPO 训练 Qwen3-VL-4B 做联合(文本+视觉)证据选择(MemLens)。本包自带环境、代码、数据、模型, 在新服务器上 `bash setup.sh` 即可跑。 ## 包内容 ``` . ├── setup.sh # 一键部署(解环境/装verl/修路径/自检) ├── README.md ├── env/nips-2026.tar.gz # conda 打包环境(torch2.9+cu128/vllm0.13/flash_attn2.8.1/bitsandbytes0.49.2) ├── verl/ # VERL 源码(setup.sh 里 editable 安装) ├── videolens/vediosifter/ # 训练代码 + data/(train_0.parquet 9.4万 + videomme_val 900) └── models/ ├── Qwen3-VL-4B-Instruct/ # 被训练的策略模型 └── Qwen3.5-27B/ # 答题门控模型(本地起服务用) ``` ## 前提 - GPU:A100/A800 等,**驱动支持 CUDA 12.x**(`nvidia-smi` 右上角 CUDA ≥ 12.0 即可,靠次版本兼容跑 cu128)。 - 已装 conda(miniforge/miniconda 均可,用于激活解包出来的环境)。 - 磁盘 ≥ 80GB 空闲(解包后环境+模型展开)。 ## 部署步骤 ```bash # 1. 解包(假设 bundle.tar.gz 传到新机) tar -xzf videolens_train_bundle.tar.gz && cd videolens_train_bundle # 或你的解包目录 # 2. 一键安装(解环境、装 verl、把脚本里的路径改到本包、自检 cu128+matmul) bash setup.sh # 3. 每次用前激活环境 source env/nips-2026/bin/activate ``` `setup.sh` 第 5 步会实测一步 GPU matmul —— **打印 `matmul_ok:` 就说明 cu128 在本机驱动上能跑**。 ## 训练:先起门控,再起训练 门控(reward 主信号)在**一张单独的卡**上跑本地 27B(setup.sh 已把 gate_endpoints.txt 指向 `127.0.0.1:8000`): ```bash # ① 27B 门控(如 GPU0);参数 max-len 16k / max-seqs 128,可用 env 覆盖 CUDA_VISIBLE_DEVICES=0 bash videolens/vediosifter/serve_gate_27b.sh > /tmp/gate27b.log 2>&1 & curl -s http://127.0.0.1:8000/v1/models | head -c 200 # 测活 # ② 训练(从 videolens/ 目录跑;下面是 3 卡) cd videolens CUDA_VISIBLE_DEVICES=1,2,3 bash vediosifter/run_train_3gpu.sh > /tmp/train_3gpu.log 2>&1 ``` ### 训练脚本选择 | 脚本 | 卡数 | 说明 | |---|---|---| | `run_train_3gpu.sh` | 3 | 主用:配 1 卡门控 + 3 卡训练;标准 AdamW 全参 / 关 offload / ZeRO-2 | | `run_train_4gpu.sh` | 4 | 同上,batch 更大 | | `run_train_8gpu.sh` | 8 | 全节点,最快 | | `run_train_8bit_1gpu.sh` | 1 | 单卡(80G 装不下标准全参 → 用 8-bit Adam)| ### 选卡建议(NVLink 拓扑) - 训练卡尽量同 NUMA(`nvidia-smi topo -m` 看,NUMA0={0,1,2,3}/NUMA1={4,5,6,7}),组内 NVLink+PXB 快、跨组 SYS 慢。 - 每张训练卡需 ~75GB 空闲(关 offload + vLLM 0.55);门控 27B 卡需 ~65GB 空闲。 - 显存紧:训练脚本前加 `GPU_MEM_UTIL=0.4` 或 `RESHARD_AFTER_FWD=True`(ZeRO-3) 降每卡占用。 ## 监控 ```bash tensorboard --logdir videolens/vediosifter/logs/tb --port 6006 # 关键指标:critic/rewards/mean(总奖励,涨说明在学); # 验证时 val-aux/vediosifter/{score,rank,fmt,gate,answer,calib}/mean@1(分项) # gate 放行率看训练日志里 [gate] open_rate;骤降到 0 = 门控服务异常。 ``` ## 驱动 / 兜底 - 若 `setup.sh` 自检报 `CUDA 不可用` 或 matmul 崩:本机驱动太旧,cu128 的次版本兼容不成立。 - **首选**:新机 root 更新 NVIDIA 驱动到 R550+(支持 CUDA 12.8)。 - **兜底**:不用打包环境,按 `videolens/vediosifter/requirements-rl-lock.txt` 在新机 pip 重建 (新机需联网;flash_attn 可能要编译)。 - 门控连不上/想换更小答题模型:改 `serve_gate_27b.sh` 的 `ANSWER_MODEL_PATH`(如换 Qwen3.5-9B 提并发), 或临时 `export ANSWER_GATE=0` 退回纯 NDCG+format(少了答题验证信号)。 ## 备注 - 数据/reward/prompt 与原机一致;路径已由 setup.sh 自动改到本包。 - ckpt 存到 `videolens/vediosifter/models/<experiment_name>/`,`resume_mode=auto` 支持断点续训。

提供机构:
maas
创建时间:
2026-06-03
二维码
社区交流群
二维码
科研交流群
商业服务