qwen3.8-9b-heretic-nvfp4部署报告.md
Qwen3.8-9B-heretic-uncensored(NVFP4)部署报告
- 机器:192.168.31.31(zywpc,Ubuntu 24.04,RTX 5060 Ti 16311 MiB,32 GB RAM)
- 服务:llmster(lms
71bd99c),HTTP 0.0.0.0:1234(局域网直连)
- 日期:2026-09-09
- 模型:
Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF
- 文件:
Qwen3.8-9B-distill-heretic_nvfp4_q4_k_m.gguf(5.18 GB)
- sha256:
c609376c4cc8b3ca42bc9d0dbed193ce4ae00f83914559a65bf395dfd5c48777(与 HF LFS 一致)
- 结论:✅ 部署完成,模型满配驻留运行。
--gpu max --context-length 262144(256K 上下文,原生上限,实测可达),显存 13.3GB/16.3GB。不支持 MTP(GGUF 无捆绑 MTP head)。
1. 模型是什么
- 基座:
empero-ai/Qwen3.8-9B —— Qwen3.8 2.4T-A95B 的全参蒸馏到 Qwen3.5-9B 架构(llama.cpp arch qwen35)。
- 去审查:Heretic v1.4.0 优化(abliteration 路线),拒答率 100/100 → 22/100,KL 散度 0.0171(贴近原模型行为)。
- 量化:NVFP4(FP4)+ Q4_K_M 混合。仓库还有
nvfp4_q8_0(6.07GB)与 mmproj-BF16.gguf(0.92GB 视觉投影,未装,需要看图可补)。
- 镜像仓库:
luxuansang/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF(文件与 Noobito45 完全一致)。
量化质量(仓库 README 的 gguf-eval 基准,相对 BF16 原版)
| 指标 | NVFP4+Q4_K_M | 指标 | NVFP4+Q4_K_M |
| HellaSwag | +0.25 | BoolQ | −3.74 |
| Winogrande | −1.42 | ARC-C / PIQA | 0 / 0 |
| MMLU | −0.32 | | |
总体与 BF16 基本持平。
2. 下载与注册
- HF 官方域名 GPU 机不通,hf-mirror.com 直连可达,直接从 GPU 机下载(实测 ~10MB/s,约 9 分钟)。
sha256sum 校验通过。
lms import ~/downloads/…gguf --user-repo Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF --copy(不要用 lms import -y)。注册 key:qwen3.8-9b-heretic-uncensored-nvfp4。
- 注意:import 后
lms ls 可能延迟几秒才显示,属正常。
3. 加载配置与最大上下文实测(--gpu max,全档实测)
| 上下文 | 显存占用 | 结果 |
| 65536 | ~7.5GB(单独) | ✅ |
| 98304 | 8.02GB | ✅ |
| 131072 | 9.08GB | ✅ |
| 196608 | 11.19GB | ✅ |
| 262144(256K) | 13.30GB | ✅ 最终采用(原生上限) |
| >262144 | — | 超模型原生上限,未测 |
- 速度:加载 ~3s;生成 ~70 tok/s(含思考 token);长提示词预处理 ~2800 tok/s(1876 token 0.97s)。
- NVFP4 在 9B 上表现很好,与 27B NVFP4 的 9.1 tok/s(无法全 GPU)完全不同。
- ⚠️ 必踩的坑:
lms load 换上下文配置前必须先 lms unload --all。旧模型驻留时直接加载新配置会瞬时 OOM,报 failed to allocate buffer for kv cache 或 compute pp buffers(实测 96K~256K 全部"失败",unload 后再加载全成功)。
4. 使用方式
- 一键切换(满配):GPU 机
~/switch-heretic-9b.sh(内部:lms unload --all → lms load qwen3.8-9b-heretic-uncensored-nvfp4 --gpu max --context-length 262144 -y)。
- API(OpenAI 兼容,局域网可直连):
http://192.168.31.31:1234/v1/chat/completions,model id qwen3.8-9b-heretic-uncensored-nvfp4。
- curl 示例:
curl -s --noproxy '*' http://192.168.31.31:1234/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"qwen3.8-9b-heretic-uncensored-nvfp4","messages":[{"role":"user","content":"你好"}],"max_tokens":1024,"thinking":false}'
- 本机(DSH)访问必须
--noproxy '*'(全局代理会拐走局域网请求)。
- 网页端:Open WebUI http://192.168.31.76:3000 ,模型列表选
qwen3.8-9b-heretic-uncensored-nvfp4。
- 释放显存:
lms unload --all(给 ComfyUI 让路前必做)。
- 注意事项:
- 不支持 MTP:
--speculative-draft-mtp 报 requires a GGUF model with a bundled supported MTP head。需要投机解码只能外挂小 draft 模型(未配置)。
- 思考型模型:默认会写很长思考(创作类任务可能把 max_tokens 全耗在思考上导致正文为空)。API 传
"thinking": false 可显著改善,复杂任务再把 max_tokens 调到 1500+。
5. 部署变更记录
- ComfyUI 已停用(用户要求,原命令:
/home/zyw/ComfyUI/venv/bin/python main.py --listen 0.0.0.0 --port 8189 --lowvram --force-fp16 --reserve-vram 1.0 --fast-disk --cache-lru 20 --preview-method none,2026-09-09 前占用 12.5GB 显存)。
- Open WebUI 启动脚本修复:
~/Downloads/start-open-webui.sh 的 upstream 仍是旧 IP 192.168.31.25(死 IP,100% 丢包)→ 已全部改为 192.168.31.31 并重启验证(health 200)。今后重装/他处注意此脚本。
- 模型文件:
~/.lmstudio/models/Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF/;下载缓存 ~/downloads/(可删释放磁盘)。