v0.0.21+2,HTTP 0.0.0.0:1234,llama.cpp CUDA 运行时 2.28.2(已能识别 qwen35 架构)Qwen3.8 ≠ Qwen3-8B。 二者是完全不同的产品:
| 名字 | 是什么 | 参数量 | 是否适合这台 16GB 卡 |
|---|---|---|---|
| Qwen3.8-27B | 2026-08 新一代旗舰稠密模型(架构 qwen35,原生视觉 + 256K/262K 上下文 + thinking) | 27B | 本任务目标 |
| Qwen3-8B | 2025-05 的 Qwen3 8B(架构 qwen3) | 8.2B | 不是用户要的「千问 3.8」 |
| Qwen3-Instruct-2507 | 2025-07 更新,规格只有 235B-A22B / 30B-A3B / 4B,没有 8B | — | 无关 |
| Qwen3.8-2.4T-A95B | 同代超大 MoE | 2.4T(95B 激活) | 本机不可跑 |
官方权重:Qwen/Qwen3.8-27B(HF / ModelScope,safetensors)。
官方 GGUF 仓库:Qwen 自己没有在 ModelScope 上放 Qwen/Qwen3.8-27B-GGUF。社区事实标准是 Unsloth Dynamic V3:
unsloth/Qwen3.8-27B-GGUFunsloth/Qwen3.8-27B-GGUF另有 lmstudio-community/Qwen3.8-27B-GGUF、prithivMLmods/Qwen3.8-27B-GGUF。Unsloth 仓库在 2026-08-19 用 Dynamic V3 更新过,下载量与文档完整度最高,作为官方量化来源。
无审核版:huihui-ai 的 abliteration 是目前社区评价最好的一路(KLD 低、thinking 模式下也去拒答、保留 MTP)。
huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUFhuihui-ai/... 不存在;只有第三方 yyds110110110/... 且仅有 Q5_K(19.5 GB),不适合 16GB 卡Unsloth 仓库实测文件(ModelScope master):
| 文件 | 大小 | 16GB 卡 |
|---|---|---|
| UD-Q3_K_XL | 12.25 GiB | 可 --gpu max + 小上下文,质量低于 Q4 |
| UD-IQ4_XS | 13.27 GiB | 卡边,几乎塞满后没 KV 余量 |
| UD-Q4_K_M | 15.33 GiB / 16.46 GB | 必须部分卸载 |
| UD-Q4_K_XL | 16.35 GiB | 卸载更多,更慢 |
| UD-Q5_K_M | 18.41 GiB | 放弃 |
| Q8_0 | 27.1 GiB | 放弃 |
经典 Q4_K_M 在其它仓库约 16.8–17.1 GB,比 Unsloth UD-Q4_K_M 更大。
官方:Qwen3.8-27B-UD-Q4_K_M.gguf(Unsloth Dynamic V3)
无审核:Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf(huihui 标准 4-bit,15.65 GiB)
加载参数(两个模型相同):
lms load <modelKey> --gpu 0.70 --context-length 4096 -y
理由:
--gpu 0.70 实测 n-gpu-layers=46,权重+KV 占用 ~12.7 GB,还剩 ~3.2 GB,不会 OOM。--gpu max 会把 15.3 GiB 全塞进去,必爆。vision: false,省显存。需要看图时再单独放 projector。--gpu max。与 ComfyUI:先 lms unload --all,再开 ComfyUI。 12.7 GB 常驻时 ComfyUI 几乎没显存。
仓库文件已列全(Q4_0 / Q4_1 / Q8_0 + 全套 UD-*)。选用:
https://modelscope.cn/models/unsloth/Qwen3.8-27B-GGUF/resolve/master/Qwen3.8-27B-UD-Q4_K_M.gguf
aria2c -x 8 -s 8cdn-lfs-cn-1.modelscope.cn/home/zyw/Qwen3.8-27B-UD-Q4_K_M.gguf校验:
size 16464440224 expected 16464440224 match True
magic b'GGUF'
SHA256 (ModelScope/HF LFS): 322e194ff79741c7baa497c240f677f54b201b0efab44ca8e50f122b39123482
ModelScope 没有可用的 Q4。本机 192.168.31.76:10809 HTTP 代理当时 Connection refused(10808 SOCKS 同样连不上),改走:
https://hf-mirror.com/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/resolve/main/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf
us.aws.cdn.hf.co/home/zyw/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf校验:
size 16810714400 expected 16810714400 match True
magic b'GGUF'
SHA256: 6c2c13cef89238c3604d756b07b3ef5fafebbd61095feb8553ff449c95e4c1c6
download-jobs-info.json 为 {"jobs": []},无同路径活跃任务。
不要 lms import -y(会去 Hugging Face 搜文件名并卡住)。
mkdir -p ~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF
ln /home/zyw/Qwen3.8-27B-UD-Q4_K_M.gguf \
~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_M.gguf
mkdir -p ~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF
ln /home/zyw/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf \
~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf
lms daemon down
lms daemon up
lms server start --bind 0.0.0.0 --port 1234
lms ls
使用 hardlink(同一 inode),不占双倍磁盘。目录内 没有 mmproj。
lms ls 结果:4 个模型(含原 Qwen2.5-1.5B 与 embedding)。两个 27B 均显示 ARCH=qwen35。
两个模型都用:
lms load qwen3.8-27b --gpu 0.70 --context-length 4096 -y
lms load huihui-qwen3.8-27b-abliterated --gpu 0.70 --context-length 4096 -y
实测 llama-server 公共参数:--n-gpu-layers 46 --ctx-size 4096 --flash-attn on --kv-offload --load-mode mmap+mlock --spec-type draft-mtp。
必须分开加载。 验证完官方后已 lms unload,再加载无审核。lms unload 没有 -y。
| 模型 | 加载耗时 | 报告体积 | nvidia-smi | 生成 | prompt | MTP 接受率 |
|---|---|---|---|---|---|---|
| qwen3.8-27b | 6.96 s | 15.33 GiB | 12982 / 16311 MiB | 5.69 tok/s | 19.25 tok/s | 82.7% |
| huihui-qwen3.8-27b-abliterated | 18.82 s | 15.66 GiB | 12790 / 16311 MiB | 5.47 tok/s | 22.34 tok/s | 83.3% |
--gpu 0.70 把约 30% 层放 CPU,所以生成只有 ~5.5 tok/s(对比同卡上 Qwen2.5-1.5B 的 ~205 tok/s)。这是 16GB 跑 27B Q4 的预期代价,不是故障。
本机必须 curl --noproxy '*'(环境里有 ALL_PROXY)。
qwen3.8-27b请求:「请用两三句话介绍你自己,并计算 17*19 等于多少。」
content: 你好,我是通义千问(Qwen),一个由阿里巴巴通义实验室研发的大语言模型。我可以帮你回答问题、写作、分析信息和编写代码等。17 × 19 = 323。
reasoning_tokens: 78
finish_reason: stop
huihui-qwen3.8-27b-abliterated同一条中文提示:
content: 我是通义千问(Qwen),一个由阿里巴巴通义实验室研发的大语言模型,可以帮你回答问题、写代码和做推理。
17×19=323。
reasoning_tokens: 142
finish_reason: stop
两个模型都走 thinking(reasoning_content 有内容)。算术正确。
| 角色 | API 模型名(Open WebUI / curl 的 model 字段) | 磁盘路径 |
|---|---|---|
| 官方 | qwen3.8-27b | ~/.lmstudio/models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_M.gguf |
| 无审核 | huihui-qwen3.8-27b-abliterated | ~/.lmstudio/models/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF/Huihui-Qwen3.8-27B-abliterated-Q4_K.gguf |
| 旧模型 | qwen2.5-1.5b-instruct | 仍保留 |
| embedding | text-embedding-nomic-embed-text-v1.5 | bundled |
lms ls --json 中 maxContextLength 均为 262144;实际加载请继续用 4096(或最多试 8192)。
当前驻留:huihui-qwen3.8-27b-abliterated(IDLE,4096 ctx)。
Open WebUI(本机 http://192.168.31.76:3000)已接 LM Studio http://192.168.31.25:1234。刷新模型列表后会出现上面两个 id。
聊天里直接改模型下拉框即可,但 16GB 卡 不能同时驻留两个 27B:
# 换成官方
lms unload --all
lms load qwen3.8-27b --gpu 0.70 --context-length 4096 -y
# 换成无审核
lms unload --all
lms load huihui-qwen3.8-27b-abliterated --gpu 0.70 --context-length 4096 -y
# 把显存还给 ComfyUI
lms unload --all
HTTP 配置里 justInTimeModelLoading: true。若 Open WebUI 请求的模型没在内存里,llmster 可能 JIT 加载;不要让它在官方/无审核之间频繁 JIT,显存不够会失败。建议手动 lms load 一个、卸另一个。
API 示例:
curl --noproxy '*' http://192.168.31.25:1234/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}],"max_tokens":256}'
把 model 换成 huihui-qwen3.8-27b-abliterated 即切无审核。
systemd lmstudio.service 仍是 disabled + 手动。autoStartOnLaunch 为 false,daemon 重启后需要再 lms server start --bind 0.0.0.0 --port 1234。
lms unload --all,确认 nvidia-smi 回到几十 MiB。UD-Q3_K_XL(12.25 GiB)+ --gpu max,仍建议不要和 ComfyUI 同时满载。mmproj-*.gguf 放进模型目录,否则 LM Studio 可能当视觉模型加载,再吞 ~1 GB。Qwen3.8-27B-UD-Q3_K_XL.gguf,--gpu max -c 4096,预期更接近全 GPU 速度。--gpu 0.80 或 context 8192,盯着 nvidia-smi,OOM 就退回 0.70 / 4096。mmproj-F16.gguf 放到官方模型目录后重扫;无审核对应 mmproj-model-bf16.gguf。lms runtime ls 显示 CUDA 有 2.29.1 可更新。本次 2.28.2 已能跑 qwen35;若以后出现模板/MTP 问题再 lms runtime update(更新时 不要 给进程设 HTTPS_PROXY,否则会连不上本机 daemon)。千问 3.8 的旗舰是 Qwen3.8-27B。本机 16GB 显存选 Unsloth UD-Q4_K_M + huihui Q4_K,用 --gpu 0.70 --context-length 4096 混合卸载;官方 110 MiB/s 从 ModelScope 下完,无审核 26 MiB/s 从 hf-mirror 下完。API 名:qwen3.8-27b / huihui-qwen3.8-27b-abliterated。和 ComfyUI 必须错开用显存。