# Qwen3.8-9B-heretic-uncensored（NVFP4）部署报告

- **机器**：192.168.31.31（zywpc，Ubuntu 24.04，RTX 5060 Ti **16311 MiB**，32 GB RAM）
- **服务**：llmster（lms `71bd99c`），HTTP `0.0.0.0:1234`（局域网直连）
- **日期**：2026-09-09
- **模型**：`Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF`
  - 文件：`Qwen3.8-9B-distill-heretic_nvfp4_q4_k_m.gguf`（5.18 GB）
  - sha256：`c609376c4cc8b3ca42bc9d0dbed193ce4ae00f83914559a65bf395dfd5c48777`（与 HF LFS 一致）
- **结论**：✅ 部署完成，模型**满配驻留运行**。`--gpu max --context-length 262144`（**256K 上下文**，原生上限，实测可达），显存 13.3GB/16.3GB。**不支持 MTP**（GGUF 无捆绑 MTP head）。

---

## 1. 模型是什么

- **基座**：`empero-ai/Qwen3.8-9B` —— Qwen3.8 2.4T-A95B 的**全参蒸馏**到 Qwen3.5-9B 架构（llama.cpp arch `qwen35`）。
- **去审查**：Heretic v1.4.0 优化（abliteration 路线），拒答率 100/100 → **22/100**，KL 散度 0.0171（贴近原模型行为）。
- **量化**：NVFP4（FP4）+ Q4_K_M 混合。仓库还有 `nvfp4_q8_0`（6.07GB）与 `mmproj-BF16.gguf`（0.92GB 视觉投影，**未装**，需要看图可补）。
- **镜像仓库**：`luxuansang/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF`（文件与 Noobito45 完全一致）。

### 量化质量（仓库 README 的 gguf-eval 基准，相对 BF16 原版）

| 指标 | NVFP4+Q4_K_M | 指标 | NVFP4+Q4_K_M |
| --- | --- | --- | --- |
| HellaSwag | +0.25 | BoolQ | −3.74 |
| Winogrande | −1.42 | ARC-C / PIQA | 0 / 0 |
| MMLU | −0.32 | | |

总体与 BF16 基本持平。

## 2. 下载与注册

1. **HF 官方域名 GPU 机不通**，hf-mirror.com 直连可达，直接从 GPU 机下载（实测 ~10MB/s，约 9 分钟）。
2. `sha256sum` 校验通过。
3. `lms import ~/downloads/…gguf --user-repo Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF --copy`（不要用 `lms import -y`）。注册 key：**`qwen3.8-9b-heretic-uncensored-nvfp4`**。
   - 注意：import 后 `lms ls` 可能延迟几秒才显示，属正常。

## 3. 加载配置与最大上下文实测（--gpu max，全档实测）

| 上下文 | 显存占用 | 结果 |
| --- | --- | --- |
| 65536 | ~7.5GB（单独） | ✅ |
| 98304 | 8.02GB | ✅ |
| 131072 | 9.08GB | ✅ |
| 196608 | 11.19GB | ✅ |
| **262144（256K）** | **13.30GB** | ✅ **最终采用（原生上限）** |
| >262144 | — | 超模型原生上限，未测 |

- **速度**：加载 **~3s**；生成 **~70 tok/s**（含思考 token）；长提示词预处理 **~2800 tok/s**（1876 token 0.97s）。
  - NVFP4 在 9B 上表现很好，与 27B NVFP4 的 9.1 tok/s（无法全 GPU）完全不同。
- ⚠️ **必踩的坑**：`lms load` 换上下文配置前**必须先 `lms unload --all`**。旧模型驻留时直接加载新配置会瞬时 OOM，报 `failed to allocate buffer for kv cache` 或 `compute pp buffers`（实测 96K~256K 全部"失败"，unload 后再加载全成功）。

## 4. 使用方式

- **一键切换（满配）**：GPU 机 `~/switch-heretic-9b.sh`（内部：`lms unload --all` → `lms load qwen3.8-9b-heretic-uncensored-nvfp4 --gpu max --context-length 262144 -y`）。
- **API（OpenAI 兼容，局域网可直连）**：`http://192.168.31.31:1234/v1/chat/completions`，model id `qwen3.8-9b-heretic-uncensored-nvfp4`。
  - curl 示例：`curl -s --noproxy '*' http://192.168.31.31:1234/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"qwen3.8-9b-heretic-uncensored-nvfp4","messages":[{"role":"user","content":"你好"}],"max_tokens":1024,"thinking":false}'`
  - 本机（DSH）访问必须 `--noproxy '*'`（全局代理会拐走局域网请求）。
- **网页端**：Open WebUI http://192.168.31.76:3000 ，模型列表选 `qwen3.8-9b-heretic-uncensored-nvfp4`。
- **释放显存**：`lms unload --all`（给 ComfyUI 让路前必做）。
- **注意事项**：
  - **不支持 MTP**：`--speculative-draft-mtp` 报 `requires a GGUF model with a bundled supported MTP head`。需要投机解码只能外挂小 draft 模型（未配置）。
  - 思考型模型：默认会写很长思考（创作类任务可能把 max_tokens 全耗在思考上导致正文为空）。API 传 **`"thinking": false`** 可显著改善，复杂任务再把 `max_tokens` 调到 1500+。

## 5. 部署变更记录

- ComfyUI **已停用**（用户要求，原命令：`/home/zyw/ComfyUI/venv/bin/python main.py --listen 0.0.0.0 --port 8189 --lowvram --force-fp16 --reserve-vram 1.0 --fast-disk --cache-lru 20 --preview-method none`，2026-09-09 前占用 12.5GB 显存）。
- **Open WebUI 启动脚本修复**：`~/Downloads/start-open-webui.sh` 的 upstream 仍是旧 IP `192.168.31.25`（死 IP，100% 丢包）→ 已全部改为 `192.168.31.31` 并重启验证（health 200）。今后重装/他处注意此脚本。
- 模型文件：`~/.lmstudio/models/Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF/`；下载缓存 `~/downloads/`（可删释放磁盘）。