记录日期:2026-08-26 | GPU 机 192.168.31.25(RTX 5060 Ti 16GB / 32GB RAM) 相关:
破限版27B部署实测-20260826.md(llama.cpp 96K 方案主记录)
~/Downloads/freetoken-venv(Python 3.12 venv),ft 0.1.2-i https://mirrors.aliyun.com/pypi/simple/)快download.pytorch.org/whl/cu130/ 手动下载 wheel 后 pip install <file>(注意 wheel 文件名必须规范,否则 pip 报 "Invalid wheel filename")/tmp 下的启动脚本会被清理,必须用 ~/Downloads/ 下脚本 + setsid nohup 模式lyf/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-NVFP4(HauhauCS 破限)~/Downloads/freetoken-models/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-NVFP4/症状:
ft serve --moe-backend offload → CUDA OOM(加载时把全部 23GB 权重物化到 GPU)ft checkpoint(转 FTW)→ Missing MoE expert source layers: {'gate_up': [...0-39], 'down': [...]}根因(源码级对比 FreeToken qwen3_5_moe/weight.py + loader.py):
| lyf 破限版(HauhauCS) | FreeToken 预期 | |
|---|---|---|
| 权重前缀 | language_model.model.layers.N... | model.language_model.layers.N... |
| 专家权重 | experts.E.down_proj.weight_packed | experts.E.down_proj.weight/.weight_scale |
| 量化格式 | nvfp4-pack-quantized(compressed-tensors) | modelopt NVFP4 |
→ FreeToken 的专家识别正则全部失配,offload 模式无法识别专家层,把 23GB 全当 dense 塞 GPU → OOM。
FreeToken 官方支持的是 nvidia/Qwen3.6-35B-A3B-NVFP4(modelopt 格式,~30GB,非破限)。 破限版 bf16(如 RobinsonLabs)兼容但 70GB,超 32G 内存。
C. llama.cpp + Qwen3.8-27B 破限版(Bucoid MTP)
~/Downloads/start-llamacpp-qwen38-heretic.sh(自动释放 llmster 显存)model loaded,显存 15.5G,API 正常(破限生效)~/Downloads/stop-llamacpp-qwen38-heretic.sh~/Downloads/freetoken-venv(6.9G)~/Downloads/freetoken-models/(22G)/home/zyw/Downloads/hf-dl/freetoken/(23.35G,本机副本)range_server.js + 端口 8898(若未关)保留还是清理,按需决定;venv 保留可在 FreeToken 更新兼容格式后复用。
之前失败是模型格式问题(lyf 破限版 compressed-tensors pack 与 FreeToken 不兼容)。 换 nvidia 官方 modelopt 版后一次成功:
~/Downloads/freetoken-models/nvidia-Qwen3.6-35B-A3B-NVFP4/# 启动(offload 模式:专家驻留内存 + GPU 只放缓存)
/home/zyw/Downloads/freetoken-venv/bin/ft serve \
--model /home/zyw/Downloads/freetoken-models/nvidia-Qwen3.6-35B-A3B-NVFP4 \
--host 0.0.0.0 --port 8081 --moe-backend offload --memory-ratio 0.9
# 封装脚本:~/Downloads/start_ft_nvidia.sh
| 指标 | 数值 |
|---|---|
| 速度 | 33.4 tok/s(200 tokens / 5.98s,流式) |
| 显存 | 14.9G / 16G(专家缓存 5701 slots + KV 0.16G) |
| 内存 | 20G used(专家池驻留内存,available 11G)✅ 32G 够 |
| 首次请求 | ~6 分钟(专家冷启动 + serial bank build) |
| 后续请求 | 4-6 秒(专家缓存热了) |
| 架构 | Qwen3.6-35B-A3B MoE(每 token 只激活 3B) |
| FreeToken + 官方 35B MoE | llama.cpp + 破限 27B | |
|---|---|---|
| 速度 | 33.4 tok/s | 26-27 tok/s |
| 上下文 | 8271 tokens(KV 很小) | 96K(KV Q4_0) |
| 破限 | ❌ 官方版非破限 | ✅ 破限 |
| 显存 | 14.9G | 15.5G |
| 内存 | 20G | ~3G |
~/Downloads/start_ft_nvidia.sh(FreeToken 8081 端口)~/Downloads/start-llamacpp-qwen38-heretic.sh(llama.cpp 8081 端口)