voxmindlabs
收藏资源简介:
# SmartGlasses 统一环境推理 + 评测流水线 | 镜像说明 |组成部分 | |----------------------------------------|----------------------------------------------------------------------------------------------------------------------| | 服务运行硬件服务器配置和软件包版本环境: | A100_80G_ubuntu22.04-cuda12.8.1-py311-torch2.9.0-vllm0.13.0-modelscope1.33.0-swift3.12.5 | | 镜像 | 服务运行环境&原生模型:Qwen3-Omni-30B-A3B-Captioner & 微调模型 Qwen3-Omni-30B-A3B-Captioner_track2 | | 镜像组成 | smartglass.tar.part-000 smartglass.tar.part-001 smartglass.tar.part-002 | | 镜像运行工作空间 | docker_workspace.tar.gz | 镜像工作空间树: └── mnt └── workspace ├── logs ├── results │ ├── hyp_track1.stm │ ├── hyp_track2.stm │ └── track1 ├── scripts │ ├── eval_slu_submit.py │ ├── eval_track1.py │ ├── eval_track2.py │ ├── README.md │ ├── run2infer.sh │ ├── Run2Pred2SubmitStm.sh │ ├── run2sat.sh │ ├── run2slu.sh │ ├── run2slu_track_test.sh │ ├── slu_hybrid_utils.py │ ├── split_wav_by_silence.py │ ├── text_normalization.py │ └── vllm_server.sh └── SmartGlaasesTests ├── SmartGlasses_Test_QA_Phase2 ├── track1 └── track2 拉取docker镜像:python脚本: from modelscope.hub.api import HubApi from modelscope.hub.snapshot_download import dataset_snapshot_download api = HubApi() api.login("ms-51b91e56-b089-4c35-a219-00c0e7afa2b2") dataset_dir = dataset_snapshot_download( dataset_id="liqiang4113/voxmindlabs", local_dir="./voxmindlabs" ) print("下载完成:", dataset_dir) # 1. 合并 split 分割的 Docker 镜像 cat smartglass.tar.part-000 smartglass.tar.part-001 smartglass.tar.part-002 >smartglass.tar # 2. 导入 Docker 镜像 docker load -i smartglass.tar # 3. 查看导入后的镜像名称 docker images # 3. 启动容器 docker run -it \ --gpus all \ --ipc=host \ -v docker_workspace/mnt:/mnt \ -v track1_audio:/mnt/workspace/SmartGlaasesTests/Track1/audio \ -v track2_audio:/mnt/workspace/SmartGlaasesTests/Track2/audio \ modelscope-registry.cn-hangzhou.cr.aliyuncs.com/modelscope-repo/modelscope:04-cuda12.8.1-py311-torch2.9.0-vllm0.13.0-modelscope1.33.0-swift3.12.5_smartglass \ bash | 项目 |赛道一二说话人日志任务 |实现功能介绍| |--------------|----------------------------------------|--------------------------------------------------------| | shell脚本 | run2sat.sh | 一键启动脚本 | | python脚本 | run2infer.sh | 模型推理服务启动&评测脚本生成中间结果TextGrid | | python脚本 | split_wav_by_silence.py | 音频切片 | | python脚本 | eval_track1.py/eval_track2.py | 评测脚本生成中间结果TextGrid | | python脚本 | text_normalization.py | 文本正则化转换 | | shell脚本 | Run2Pred2SubmitStm.sh | 预测 TextGrid -> 官方提交 STM(原始格式)-> 文本正则化 | 整体流程: ``` 音频 wav.lst ↓ run2infer.sh(vLLM + split_wav_by_silence.py +eval.py / eval_track2.py) TextGrid 预测(RESULT_DIR/*.TextGrid) ↓ Run2Pred2SubmitStm.sh(to_stm + meeteval) DER / cpWER / tcpWER + score_eval_details.txt ``` | 项目 |赛道一二slu任务 |实现功能介绍 | |---------------|-------------------------------|----------------------------------------------------------| | shell脚本 | run2slu.sh | 一键启动脚本 | | shell脚本 | vllm_server.sh | 模型推理服务启动 | | shell脚本 | host_run_slu_track_test.sh | 不同赛道slu任务评测,测试集 SLU 问答 -> hyp.json 提交格式 | | python脚本 | slu_hybrid_utils.py | text + timestamped audio clips | | python脚本 | eval_slu_submit.py | STM transcript -> hyp.json submission |



