# Qwen3.8-27B（千问 3.8）LM Studio 部署报告

- **机器**：192.168.31.25（zywpc，Ubuntu 24.04，RTX 5060 Ti **16311 MiB**，32 GB RAM + 72 GB swap）
- **服务**：llmster `v0.0.21+2`，HTTP `0.0.0.0:1234`，llama.cpp CUDA 运行时 `2.28.2`（已能识别 `qwen35` 架构）
- **日期**：2026-08-25
- **结论**：官方 Unsloth **UD-Q4_K_M** 与 huihui **Q4_K 无审核版** 均已注册并完成中文对话验证。当前驻留的是无审核版。

---

## 1. Qwen3.8 系列：最新结论（2026-08）

**Qwen3.8 ≠ Qwen3-8B。** 二者是完全不同的产品：

| 名字 | 是什么 | 参数量 | 是否适合这台 16GB 卡 |
| --- | --- | --- | --- |
| **Qwen3.8-27B** | 2026-08 新一代旗舰稠密模型（架构 `qwen35`，原生视觉 + 256K/262K 上下文 + thinking） | **27B** | 本任务目标 |
| Qwen3-8B | 2025-05 的 Qwen3 8B（架构 `qwen3`） | 8.2B | 不是用户要的「千问 3.8」 |
| Qwen3-Instruct-2507 | 2025-07 更新，规格只有 235B-A22B / 30B-A3B / **4B**，**没有 8B** | — | 无关 |
| Qwen3.8-2.4T-A95B | 同代超大 MoE | 2.4T（95B 激活） | 本机不可跑 |

官方权重：`Qwen/Qwen3.8-27B`（HF / ModelScope，safetensors）。

**官方 GGUF 仓库**：Qwen 自己没有在 ModelScope 上放 `Qwen/Qwen3.8-27B-GGUF`。社区事实标准是 Unsloth Dynamic V3：

- Hugging Face：`unsloth/Qwen3.8-27B-GGUF`
- **ModelScope 镜像（本次直连）**：`unsloth/Qwen3.8-27B-GGUF`

另有 `lmstudio-community/Qwen3.8-27B-GGUF`、`prithivMLmods/Qwen3.8-27B-GGUF`。Unsloth 仓库在 2026-08-19 用 Dynamic V3 更新过，下载量与文档完整度最高，作为官方量化来源。

**无审核版**：huihui-ai 的 abliteration 是目前社区评价最好的一路（KLD 低、thinking 模式下也去拒答、保留 MTP）。

- HF：`huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF`
- ModelScope 上 `huihui-ai/...` 不存在；只有第三方 `yyds110110110/...` 且仅有 **Q5_K（19.5 GB）**，不适合 16GB 卡
- 其它：orcarouter、Wassimyounes01/qwen38-uncensored、douyamv 等。本次选 huihui Q4_K

---

## 2. 量化档：最终拍板与理由

### 2.1 硬件约束

- 显存 **15.93 GiB 可用**（16311 MiB），还要给 CUDA context + KV cache 留空
- 32 GB 内存可以扛 CPU 侧权重；72 GB swap 是安全网，不应作为热路径
- ComfyUI 同机，图生时常见占用 6–10 GB。**不能和 27B 同时常驻**
- 原生上下文 262144，全开 KV 会把 16GB 卡直接打爆

Unsloth 仓库实测文件（ModelScope `master`）：

| 文件 | 大小 | 16GB 卡 |
| --- | --- | --- |
| UD-Q3_K_XL | 12.25 GiB | 可 `--gpu max` + 小上下文，质量低于 Q4 |
| UD-IQ4_XS | 13.27 GiB | 卡边，几乎塞满后没 KV 余量 |
| **UD-Q4_K_M** | **15.33 GiB / 16.46 GB** | **必须部分卸载** |
| UD-Q4_K_XL | 16.35 GiB | 卸载更多，更慢 |
| UD-Q5_K_M | 18.41 GiB | 放弃 |
| Q8_0 | 27.1 GiB | 放弃 |

经典 Q4_K_M 在其它仓库约 16.8–17.1 GB，比 Unsloth UD-Q4_K_M 更大。

### 2.2 决定

**官方：`Qwen3.8-27B-UD-Q4_K_M.gguf`（Unsloth Dynamic V3）**  
**无审核：`Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf`（huihui 标准 4-bit，15.65 GiB）**

加载参数（两个模型相同）：

```bash
lms load <modelKey> --gpu 0.70 --context-length 4096 -y
```

理由：

1. **质量**：这是用户「试最新旗舰」的场景。Q3 / IQ3 能全进 GPU、速度更快，但 27B 压到 3-bit 损失明显。Unsloth 把 UD-Q4_K_M 当作质量默认档；huihui 对应的是 Q4_K（没有 UD-Q4_K_M）。
2. **显存**：15.33 GiB 权重大于 16GB 卡的可用空间。`--gpu 0.70` 实测 **n-gpu-layers=46**，权重+KV 占用 **~12.7 GB**，还剩 ~3.2 GB，不会 OOM。`--gpu max` 会把 15.3 GiB 全塞进去，必爆。
3. **速度可接受**：部分卸载后生成约 **5.5–5.7 tok/s**，prompt ~20 tok/s。慢，但中文短对话可用。32GB RAM 扛得住剩下 ~30% 层。
4. **上下文 4096**：KV 用 f16。8K 也能试，但余量变小；32K+ 不适合这张卡。模型本身 maxContextLength=262144，那是文件能力，不是本机预算。
5. **不加载 mmproj**：视觉塔约 0.9 GB。目录里只放主 GGUF，LM Studio 报告 `vision: false`，省显存。需要看图时再单独放 projector。
6. **不选 Q5/Q6/Q8**：文件已经超过显存，CPU 卸载比例更高，生成会掉到难以使用。
7. **不选 IQ4_XS / Q3_K_XL 作为主档**：它们更适合「必须全 GPU、要速度」。本机有 32GB 内存，用 Q4 + 30% CPU 换质量更合理。若以后觉得 5.5 tok/s 太慢，可再下 UD-Q3_K_XL 用 `--gpu max`。

与 ComfyUI：**先 `lms unload --all`，再开 ComfyUI。** 12.7 GB 常驻时 ComfyUI 几乎没显存。

---

## 3. 下载

### 3.1 官方（ModelScope 直链）

仓库文件已列全（Q4_0 / Q4_1 / Q8_0 + 全套 UD-*）。选用：

```text
https://modelscope.cn/models/unsloth/Qwen3.8-27B-GGUF/resolve/master/Qwen3.8-27B-UD-Q4_K_M.gguf
```

- 工具：GPU 机 `aria2c -x 8 -s 8`
- 实际走 `cdn-lfs-cn-1.modelscope.cn`
- **均速 110 MiB/s**，约 2.5 分钟完成
- 落盘：`/home/zyw/Qwen3.8-27B-UD-Q4_K_M.gguf`

校验：

```text
size 16464440224  expected 16464440224  match True
magic b'GGUF'
SHA256 (ModelScope/HF LFS): 322e194ff79741c7baa497c240f677f54b201b0efab44ca8e50f122b39123482
```

### 3.2 无审核（HF-mirror → AWS CDN）

ModelScope 没有可用的 Q4。本机 `192.168.31.76:10809` HTTP 代理当时 **Connection refused**（10808 SOCKS 同样连不上），改走：

```text
https://hf-mirror.com/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/resolve/main/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf
```

- 302 到 `us.aws.cdn.hf.co`
- **均速 26 MiB/s**，约 10 分钟
- 落盘：`/home/zyw/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf`

校验：

```text
size 16810714400  expected 16810714400  match True
magic b'GGUF'
SHA256: 6c2c13cef89238c3604d756b07b3ef5fafebbd61095feb8553ff449c95e4c1c6
```

---

## 4. 注册（沿用上次离线姿势）

`download-jobs-info.json` 为 `{"jobs": []}`，无同路径活跃任务。

**不要** `lms import -y`（会去 Hugging Face 搜文件名并卡住）。

```bash
mkdir -p ~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF
ln /home/zyw/Qwen3.8-27B-UD-Q4_K_M.gguf \
   ~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_M.gguf

mkdir -p ~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF
ln /home/zyw/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf \
   ~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf

lms daemon down
lms daemon up
lms server start --bind 0.0.0.0 --port 1234
lms ls
```

使用 hardlink（同一 inode），不占双倍磁盘。目录内 **没有 mmproj**。

`lms ls` 结果：4 个模型（含原 Qwen2.5-1.5B 与 embedding）。两个 27B 均显示 ARCH=`qwen35`。

---

## 5. 加载参数与显存

两个模型都用：

```bash
lms load qwen3.8-27b --gpu 0.70 --context-length 4096 -y
lms load huihui-qwen3.8-27b-abliterated --gpu 0.70 --context-length 4096 -y
```

实测 llama-server 公共参数：`--n-gpu-layers 46 --ctx-size 4096 --flash-attn on --kv-offload --load-mode mmap+mlock --spec-type draft-mtp`。

**必须分开加载。** 验证完官方后已 `lms unload`，再加载无审核。`lms unload` **没有 `-y`**。

| 模型 | 加载耗时 | 报告体积 | nvidia-smi | 生成 | prompt | MTP 接受率 |
| --- | --- | --- | --- | --- | --- | --- |
| qwen3.8-27b | 6.96 s | 15.33 GiB | **12982 / 16311 MiB** | **5.69 tok/s** | 19.25 tok/s | 82.7% |
| huihui-qwen3.8-27b-abliterated | 18.82 s | 15.66 GiB | **12790 / 16311 MiB** | **5.47 tok/s** | 22.34 tok/s | 83.3% |

`--gpu 0.70` 把约 30% 层放 CPU，所以生成只有 ~5.5 tok/s（对比同卡上 Qwen2.5-1.5B 的 ~205 tok/s）。这是 16GB 跑 27B Q4 的预期代价，不是故障。

---

## 6. 验证输出

本机必须 `curl --noproxy '*'`（环境里有 `ALL_PROXY`）。

### 6.1 官方 `qwen3.8-27b`

请求：「请用两三句话介绍你自己，并计算 17*19 等于多少。」

```text
content: 你好，我是通义千问（Qwen），一个由阿里巴巴通义实验室研发的大语言模型。我可以帮你回答问题、写作、分析信息和编写代码等。17 × 19 = 323。
reasoning_tokens: 78
finish_reason: stop
```

### 6.2 无审核 `huihui-qwen3.8-27b-abliterated`

同一条中文提示：

```text
content: 我是通义千问（Qwen），一个由阿里巴巴通义实验室研发的大语言模型，可以帮你回答问题、写代码和做推理。
17×19=323。
reasoning_tokens: 142
finish_reason: stop
```

两个模型都走 thinking（`reasoning_content` 有内容）。算术正确。

---

## 7. 文件路径与 API 模型名

| 角色 | API 模型名（Open WebUI / curl 的 `model` 字段） | 磁盘路径 |
| --- | --- | --- |
| 官方 | **`qwen3.8-27b`** | `~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_M.gguf` |
| 无审核 | **`huihui-qwen3.8-27b-abliterated`** | `~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf` |
| 旧模型 | `qwen2.5-1.5b-instruct` | 仍保留 |
| embedding | `text-embedding-nomic-embed-text-v1.5` | bundled |

`lms ls --json` 中 `maxContextLength` 均为 262144；实际加载请继续用 **4096**（或最多试 8192）。

当前驻留：**huihui-qwen3.8-27b-abliterated**（IDLE，4096 ctx）。

---

## 8. Open WebUI / API 切换

Open WebUI（本机 `http://192.168.31.76:3000`）已接 LM Studio `http://192.168.31.25:1234`。刷新模型列表后会出现上面两个 id。

**聊天里直接改模型下拉框即可**，但 16GB 卡 **不能同时驻留两个 27B**：

```bash
# 换成官方
lms unload --all
lms load qwen3.8-27b --gpu 0.70 --context-length 4096 -y

# 换成无审核
lms unload --all
lms load huihui-qwen3.8-27b-abliterated --gpu 0.70 --context-length 4096 -y

# 把显存还给 ComfyUI
lms unload --all
```

HTTP 配置里 `justInTimeModelLoading: true`。若 Open WebUI 请求的模型没在内存里，llmster 可能 JIT 加载；**不要让它在官方/无审核之间频繁 JIT**，显存不够会失败。建议手动 `lms load` 一个、卸另一个。

API 示例：

```bash
curl --noproxy '*' http://192.168.31.25:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}],"max_tokens":256}'
```

把 `model` 换成 `huihui-qwen3.8-27b-abliterated` 即切无审核。

systemd `lmstudio.service` 仍是 **disabled + 手动**。`autoStartOnLaunch` 为 false，daemon 重启后需要再 `lms server start --bind 0.0.0.0 --port 1234`。

---

## 9. 与 ComfyUI 共用显存

1. 27B Q4 常驻约 **12.7 GB**，ComfyUI 工作流通常还要 6 GB+ → **互斥**。
2. 用 LLM 时关掉 ComfyUI 的 GPU 任务；用 ComfyUI 前 `lms unload --all`，确认 `nvidia-smi` 回到几十 MiB。
3. 需要更快的 LLM、可以牺牲质量时，再考虑 Unsloth `UD-Q3_K_XL`（12.25 GiB）+ `--gpu max`，仍建议不要和 ComfyUI 同时满载。
4. 不要把 `mmproj-*.gguf` 放进模型目录，否则 LM Studio 可能当视觉模型加载，再吞 ~1 GB。

---

## 10. 后续建议

- 觉得 5.5 tok/s 太慢：下载 `Qwen3.8-27B-UD-Q3_K_XL.gguf`，`--gpu max -c 4096`，预期更接近全 GPU 速度。
- 觉得质量不够、ComfyUI 不用时：可试 `--gpu 0.80` 或 context 8192，盯着 `nvidia-smi`，OOM 就退回 0.70 / 4096。
- 需要视觉：把 Unsloth 的 `mmproj-F16.gguf` 放到官方模型目录后重扫；无审核对应 `mmproj-model-bf16.gguf`。
- `lms runtime ls` 显示 CUDA 有 **2.29.1** 可更新。本次 2.28.2 已能跑 `qwen35`；若以后出现模板/MTP 问题再 `lms runtime update`（更新时 **不要** 给进程设 `HTTPS_PROXY`，否则会连不上本机 daemon）。
- 无审核版已去掉拒答，仅限自用研究。

---

## 11. 一句话

千问 3.8 的旗舰是 **Qwen3.8-27B**。本机 16GB 显存选 Unsloth **UD-Q4_K_M** + huihui **Q4_K**，用 `--gpu 0.70 --context-length 4096` 混合卸载；官方 110 MiB/s 从 ModelScope 下完，无审核 26 MiB/s 从 hf-mirror 下完。API 名：`qwen3.8-27b` / `huihui-qwen3.8-27b-abliterated`。和 ComfyUI 必须错开用显存。
