qwen3.8-9b-heretic-nvfp4部署报告.md

Qwen3.8-9B-heretic-uncensored(NVFP4)部署报告


1. 模型是什么

量化质量(仓库 README 的 gguf-eval 基准,相对 BF16 原版)

指标NVFP4+Q4_K_M指标NVFP4+Q4_K_M
HellaSwag+0.25BoolQ−3.74
Winogrande−1.42ARC-C / PIQA0 / 0
MMLU−0.32

总体与 BF16 基本持平。

2. 下载与注册

  1. HF 官方域名 GPU 机不通,hf-mirror.com 直连可达,直接从 GPU 机下载(实测 ~10MB/s,约 9 分钟)。
  2. sha256sum 校验通过。
  3. lms import ~/downloads/…gguf --user-repo Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF --copy(不要用 lms import -y)。注册 key:qwen3.8-9b-heretic-uncensored-nvfp4。
    • 注意:import 后 lms ls 可能延迟几秒才显示,属正常。

3. 加载配置与最大上下文实测(--gpu max,全档实测)

上下文显存占用结果
65536~7.5GB(单独)✅
983048.02GB✅
1310729.08GB✅
19660811.19GB✅
262144(256K)13.30GB✅ 最终采用(原生上限)
>262144—超模型原生上限,未测

4. 使用方式

5. 部署变更记录

下载此文件