FreeToken破限版探索结论.md

FreeToken 探索结论 + 最终方案(Qwen3.8-27B 破限版)

记录日期:2026-08-26 | GPU 机 192.168.31.25(RTX 5060 Ti 16GB / 32GB RAM) 相关:破限版27B部署实测-20260826.md(llama.cpp 96K 方案主记录)

一、FreeToken 探索(最终结论:放弃)

安装完成(耗时约 1.5h,网络是主要瓶颈)

模型下载(23.35GB 破限 NVFP4)

❌ 核心结论:破限版 NVFP4 与 FreeToken 不兼容

症状:

  1. ft serve --moe-backend offload → CUDA OOM(加载时把全部 23GB 权重物化到 GPU)
  2. ft checkpoint(转 FTW)→ Missing MoE expert source layers: {'gate_up': [...0-39], 'down': [...]}

根因(源码级对比 FreeToken qwen3_5_moe/weight.py + loader.py):

lyf 破限版(HauhauCS)FreeToken 预期
权重前缀language_model.model.layers.N...model.language_model.layers.N...
专家权重experts.E.down_proj.weight_packedexperts.E.down_proj.weight/.weight_scale
量化格式nvfp4-pack-quantized(compressed-tensors)modelopt NVFP4

→ FreeToken 的专家识别正则全部失配,offload 模式无法识别专家层,把 23GB 全当 dense 塞 GPU → OOM。

FreeToken 官方支持的是 nvidia/Qwen3.6-35B-A3B-NVFP4(modelopt 格式,~30GB,非破限)。 破限版 bf16(如 RobinsonLabs)兼容但 70GB,超 32G 内存。

二、最终选定方案(✅ 已部署)

C. llama.cpp + Qwen3.8-27B 破限版(Bucoid MTP)

为什么 FreeToken 不适合当前需求

三、FreeToken 残留(可清理,约 29G)

保留还是清理,按需决定;venv 保留可在 FreeToken 更新兼容格式后复用。


✅ 更新(2026-08-26 深夜):FreeToken 成功部署官方版!

关键突破:换官方 nvidia modelopt 版后完全跑通

之前失败是模型格式问题(lyf 破限版 compressed-tensors pack 与 FreeToken 不兼容)。 换 nvidia 官方 modelopt 版后一次成功:

模型

服务运行(✅ 已部署)

# 启动(offload 模式:专家驻留内存 + GPU 只放缓存)
/home/zyw/Downloads/freetoken-venv/bin/ft serve \
  --model /home/zyw/Downloads/freetoken-models/nvidia-Qwen3.6-35B-A3B-NVFP4 \
  --host 0.0.0.0 --port 8081 --moe-backend offload --memory-ratio 0.9
# 封装脚本:~/Downloads/start_ft_nvidia.sh

实测结果(RTX 5060 Ti 16GB / 32GB RAM)

指标数值
速度33.4 tok/s(200 tokens / 5.98s,流式)
显存14.9G / 16G(专家缓存 5701 slots + KV 0.16G)
内存20G used(专家池驻留内存,available 11G)✅ 32G 够
首次请求~6 分钟(专家冷启动 + serial bank build)
后续请求4-6 秒(专家缓存热了)
架构Qwen3.6-35B-A3B MoE(每 token 只激活 3B)

与 llama.cpp 方案对比

FreeToken + 官方 35B MoEllama.cpp + 破限 27B
速度33.4 tok/s26-27 tok/s
上下文8271 tokens(KV 很小)96K(KV Q4_0)
破限❌ 官方版非破限✅ 破限
显存14.9G15.5G
内存20G~3G

⚠️ 取舍提醒

启动脚本

下载此文件