qwen3.8-27b模型部署报告.md

Qwen3.8-27B(千问 3.8)LM Studio 部署报告


1. Qwen3.8 系列:最新结论(2026-08)

Qwen3.8 ≠ Qwen3-8B。 二者是完全不同的产品:

名字是什么参数量是否适合这台 16GB 卡
Qwen3.8-27B2026-08 新一代旗舰稠密模型(架构 qwen35,原生视觉 + 256K/262K 上下文 + thinking)27B本任务目标
Qwen3-8B2025-05 的 Qwen3 8B(架构 qwen3)8.2B不是用户要的「千问 3.8」
Qwen3-Instruct-25072025-07 更新,规格只有 235B-A22B / 30B-A3B / 4B,没有 8B—无关
Qwen3.8-2.4T-A95B同代超大 MoE2.4T(95B 激活)本机不可跑

官方权重:Qwen/Qwen3.8-27B(HF / ModelScope,safetensors)。

官方 GGUF 仓库:Qwen 自己没有在 ModelScope 上放 Qwen/Qwen3.8-27B-GGUF。社区事实标准是 Unsloth Dynamic V3:

另有 lmstudio-community/Qwen3.8-27B-GGUF、prithivMLmods/Qwen3.8-27B-GGUF。Unsloth 仓库在 2026-08-19 用 Dynamic V3 更新过,下载量与文档完整度最高,作为官方量化来源。

无审核版:huihui-ai 的 abliteration 是目前社区评价最好的一路(KLD 低、thinking 模式下也去拒答、保留 MTP)。


2. 量化档:最终拍板与理由

2.1 硬件约束

Unsloth 仓库实测文件(ModelScope master):

文件大小16GB 卡
UD-Q3_K_XL12.25 GiB可 --gpu max + 小上下文,质量低于 Q4
UD-IQ4_XS13.27 GiB卡边,几乎塞满后没 KV 余量
UD-Q4_K_M15.33 GiB / 16.46 GB必须部分卸载
UD-Q4_K_XL16.35 GiB卸载更多,更慢
UD-Q5_K_M18.41 GiB放弃
Q8_027.1 GiB放弃

经典 Q4_K_M 在其它仓库约 16.8–17.1 GB,比 Unsloth UD-Q4_K_M 更大。

2.2 决定

官方:Qwen3.8-27B-UD-Q4_K_M.gguf(Unsloth Dynamic V3)
无审核:Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf(huihui 标准 4-bit,15.65 GiB)

加载参数(两个模型相同):

lms load <modelKey> --gpu 0.70 --context-length 4096 -y

理由:

  1. 质量:这是用户「试最新旗舰」的场景。Q3 / IQ3 能全进 GPU、速度更快,但 27B 压到 3-bit 损失明显。Unsloth 把 UD-Q4_K_M 当作质量默认档;huihui 对应的是 Q4_K(没有 UD-Q4_K_M)。
  2. 显存:15.33 GiB 权重大于 16GB 卡的可用空间。--gpu 0.70 实测 n-gpu-layers=46,权重+KV 占用 ~12.7 GB,还剩 ~3.2 GB,不会 OOM。--gpu max 会把 15.3 GiB 全塞进去,必爆。
  3. 速度可接受:部分卸载后生成约 5.5–5.7 tok/s,prompt ~20 tok/s。慢,但中文短对话可用。32GB RAM 扛得住剩下 ~30% 层。
  4. 上下文 4096:KV 用 f16。8K 也能试,但余量变小;32K+ 不适合这张卡。模型本身 maxContextLength=262144,那是文件能力,不是本机预算。
  5. 不加载 mmproj:视觉塔约 0.9 GB。目录里只放主 GGUF,LM Studio 报告 vision: false,省显存。需要看图时再单独放 projector。
  6. 不选 Q5/Q6/Q8:文件已经超过显存,CPU 卸载比例更高,生成会掉到难以使用。
  7. 不选 IQ4_XS / Q3_K_XL 作为主档:它们更适合「必须全 GPU、要速度」。本机有 32GB 内存,用 Q4 + 30% CPU 换质量更合理。若以后觉得 5.5 tok/s 太慢,可再下 UD-Q3_K_XL 用 --gpu max。

与 ComfyUI:先 lms unload --all,再开 ComfyUI。 12.7 GB 常驻时 ComfyUI 几乎没显存。


3. 下载

3.1 官方(ModelScope 直链)

仓库文件已列全(Q4_0 / Q4_1 / Q8_0 + 全套 UD-*)。选用:

https://modelscope.cn/models/unsloth/Qwen3.8-27B-GGUF/resolve/master/Qwen3.8-27B-UD-Q4_K_M.gguf

校验:

size 16464440224  expected 16464440224  match True
magic b'GGUF'
SHA256 (ModelScope/HF LFS): 322e194ff79741c7baa497c240f677f54b201b0efab44ca8e50f122b39123482

3.2 无审核(HF-mirror → AWS CDN)

ModelScope 没有可用的 Q4。本机 192.168.31.76:10809 HTTP 代理当时 Connection refused(10808 SOCKS 同样连不上),改走:

https://hf-mirror.com/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/resolve/main/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf

校验:

size 16810714400  expected 16810714400  match True
magic b'GGUF'
SHA256: 6c2c13cef89238c3604d756b07b3ef5fafebbd61095feb8553ff449c95e4c1c6

4. 注册(沿用上次离线姿势)

download-jobs-info.json 为 {"jobs": []},无同路径活跃任务。

不要 lms import -y(会去 Hugging Face 搜文件名并卡住)。

mkdir -p ~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF
ln /home/zyw/Qwen3.8-27B-UD-Q4_K_M.gguf \
   ~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_M.gguf

mkdir -p ~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF
ln /home/zyw/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf \
   ~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf

lms daemon down
lms daemon up
lms server start --bind 0.0.0.0 --port 1234
lms ls

使用 hardlink(同一 inode),不占双倍磁盘。目录内 没有 mmproj。

lms ls 结果:4 个模型(含原 Qwen2.5-1.5B 与 embedding)。两个 27B 均显示 ARCH=qwen35。


5. 加载参数与显存

两个模型都用:

lms load qwen3.8-27b --gpu 0.70 --context-length 4096 -y
lms load huihui-qwen3.8-27b-abliterated --gpu 0.70 --context-length 4096 -y

实测 llama-server 公共参数:--n-gpu-layers 46 --ctx-size 4096 --flash-attn on --kv-offload --load-mode mmap+mlock --spec-type draft-mtp。

必须分开加载。 验证完官方后已 lms unload,再加载无审核。lms unload 没有 -y。

模型加载耗时报告体积nvidia-smi生成promptMTP 接受率
qwen3.8-27b6.96 s15.33 GiB12982 / 16311 MiB5.69 tok/s19.25 tok/s82.7%
huihui-qwen3.8-27b-abliterated18.82 s15.66 GiB12790 / 16311 MiB5.47 tok/s22.34 tok/s83.3%

--gpu 0.70 把约 30% 层放 CPU,所以生成只有 ~5.5 tok/s(对比同卡上 Qwen2.5-1.5B 的 ~205 tok/s)。这是 16GB 跑 27B Q4 的预期代价,不是故障。


6. 验证输出

本机必须 curl --noproxy '*'(环境里有 ALL_PROXY)。

6.1 官方 qwen3.8-27b

请求:「请用两三句话介绍你自己,并计算 17*19 等于多少。」

content: 你好,我是通义千问(Qwen),一个由阿里巴巴通义实验室研发的大语言模型。我可以帮你回答问题、写作、分析信息和编写代码等。17 × 19 = 323。
reasoning_tokens: 78
finish_reason: stop

6.2 无审核 huihui-qwen3.8-27b-abliterated

同一条中文提示:

content: 我是通义千问(Qwen),一个由阿里巴巴通义实验室研发的大语言模型,可以帮你回答问题、写代码和做推理。
17×19=323。
reasoning_tokens: 142
finish_reason: stop

两个模型都走 thinking(reasoning_content 有内容)。算术正确。


7. 文件路径与 API 模型名

角色API 模型名(Open WebUI / curl 的 model 字段)磁盘路径
官方qwen3.8-27b~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_M.gguf
无审核huihui-qwen3.8-27b-abliterated~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf
旧模型qwen2.5-1.5b-instruct仍保留
embeddingtext-embedding-nomic-embed-text-v1.5bundled

lms ls --json 中 maxContextLength 均为 262144;实际加载请继续用 4096(或最多试 8192)。

当前驻留:huihui-qwen3.8-27b-abliterated(IDLE,4096 ctx)。


8. Open WebUI / API 切换

Open WebUI(本机 http://192.168.31.76:3000)已接 LM Studio http://192.168.31.25:1234。刷新模型列表后会出现上面两个 id。

聊天里直接改模型下拉框即可,但 16GB 卡 不能同时驻留两个 27B:

# 换成官方
lms unload --all
lms load qwen3.8-27b --gpu 0.70 --context-length 4096 -y

# 换成无审核
lms unload --all
lms load huihui-qwen3.8-27b-abliterated --gpu 0.70 --context-length 4096 -y

# 把显存还给 ComfyUI
lms unload --all

HTTP 配置里 justInTimeModelLoading: true。若 Open WebUI 请求的模型没在内存里,llmster 可能 JIT 加载;不要让它在官方/无审核之间频繁 JIT,显存不够会失败。建议手动 lms load 一个、卸另一个。

API 示例:

curl --noproxy '*' http://192.168.31.25:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}],"max_tokens":256}'

把 model 换成 huihui-qwen3.8-27b-abliterated 即切无审核。

systemd lmstudio.service 仍是 disabled + 手动。autoStartOnLaunch 为 false,daemon 重启后需要再 lms server start --bind 0.0.0.0 --port 1234。


9. 与 ComfyUI 共用显存

  1. 27B Q4 常驻约 12.7 GB,ComfyUI 工作流通常还要 6 GB+ → 互斥。
  2. 用 LLM 时关掉 ComfyUI 的 GPU 任务;用 ComfyUI 前 lms unload --all,确认 nvidia-smi 回到几十 MiB。
  3. 需要更快的 LLM、可以牺牲质量时,再考虑 Unsloth UD-Q3_K_XL(12.25 GiB)+ --gpu max,仍建议不要和 ComfyUI 同时满载。
  4. 不要把 mmproj-*.gguf 放进模型目录,否则 LM Studio 可能当视觉模型加载,再吞 ~1 GB。

10. 后续建议


11. 一句话

千问 3.8 的旗舰是 Qwen3.8-27B。本机 16GB 显存选 Unsloth UD-Q4_K_M + huihui Q4_K,用 --gpu 0.70 --context-length 4096 混合卸载;官方 110 MiB/s 从 ModelScope 下完,无审核 26 MiB/s 从 hf-mirror 下完。API 名:qwen3.8-27b / huihui-qwen3.8-27b-abliterated。和 ComfyUI 必须错开用显存。

下载此文件