Qwen3.8-27B 在 RTX 4090 Laptop GPU 16GB 上的补充调研
====================================================
日期:2026-08-27
对象:对方展示的设备 = NVIDIA GeForce RTX 4090 Laptop GPU 16GB
对照:此前认定不可信的「16GB + Q4 + 256K + 50 t/s」声称;提问者本机 = RTX 5060 Ti 16GB
前提:对方暂未提供具体模型文件 / 量化档 / llama.cpp 启动参数 / 实际填充长度
本报告是对 `/home/zyw/Downloads/grok-16g-256k-调研.txt` 的硬件专项补充。
KV 公式、MTP 开关、16GB 显存加法不变;变的是「这张卡是不是比 5060 Ti 更快、能不能因此让声称成立」。
一、结论(先看这个)
----------------
换到 4090 Laptop 16GB,并不让原声称变成真。
1. 带宽不是 448 GB/s。4090 Laptop 是 GDDR6 256-bit @ 18 Gbps = 576 GB/s。
5060 Ti 才是 448 GB/s(GDDR7 128-bit @ 28 Gbps)。两张卡带宽不同。
2. 显存同为 16GB,Q4 权重 + Q4_0 KV 的上下文上限与 5060 Ti 同一条物理线:
IQ4_XS 档大约 32K–96K,到不了 128K / 210K / 256K。
3. 短上下文开 MTP(nextn=2~3)到 44–50 t/s,在 150W 档 4090 Laptop 上比 5060 Ti 更说得通,
估计无 MTP 约 30–35 t/s、MTP n-max 2~3 约 48–62 t/s。这仍是短上下文数字。
4. Q4 + 视觉 mmproj + 128K + MTP 3 仍然装不下(合计约 18GB+)。
5. decode 瓶颈是显存带宽,不是算力。4090 Laptop 比 5060 Ti 大约快 25–30%(带宽比),
算力多一倍主要帮 prefill 和 MTP 校验,帮不了把 4.5 GiB 的 256K Q4 KV 塞进 16GB。
6. 公开检索没有「4090 Laptop 16GB + Qwen3.8-27B」的带收据 tok/s。网上几乎所有「4090 跑 3.8-27B」
都是桌面 4090 24GB(1008 GB/s)。不要把那组 46 / 65 / 76 t/s 搬到笔记本 16GB 上。
一句话:4090 Laptop 是一张「比 5060 Ti 略快的 16GB 卡」,不是「能跑 256K Q4 的另一档硬件」。
原声称拆开后,速度在短上下文 + MTP 上更可信,上下文上限完全没有变松。
二、4090 Laptop 规格确认(纠正「448 GB/s」)
----------------------------------------
官方名称:NVIDIA GeForce RTX 4090 Laptop GPU
内部代号:GN21-X11 / AD103(和桌面 RTX 4080 同一颗芯,不是桌面 4090 的 AD102)
架构:Ada Lovelace,CUDA SM 8.9(编译必须 sm_89,不是 5060 Ti 的 sm_120)
确认过的数字(TechPowerUp / VideoCardz / Notebookcheck / TechSpot 一致):
CUDA 核心 9728(76 SM)
Tensor 核心 304(第 4 代)
L2 缓存 64 MB
显存 16 GB GDDR6(不是 GDDR6X,也不是 GDDR7)
位宽 256-bit
颗粒速率 18.0 Gbps(等效;部分早期稿写 20 Gbps,但带宽字段仍给 576)
显存带宽 18 Gbps × 256-bit / 8 = 576.0 GB/s
Boost 1455–2040 MHz(随 TGP)
FP32 约 33 TFLOPS(120W 档)~ 39.7 TFLOPS(150W 档)
NVIDIA 标称 AI 686 INT8 TOPS
TGP 80–150 W,部分 OEM 到 175 W(+ Dynamic Boost 约 15–25 W)
接口 PCIe 4.0 x16
448 GB/s 从哪来、为什么不对:
448 GB/s = RTX 5060 Ti 的官方带宽(128-bit GDDR7 @ 28 Gbps)。
若有人按「14 Gbps × 256-bit / 8」去算 4090 Laptop,也会得到 448——那是错的颗粒速率。
4090 Laptop 量产颗粒是 18 Gbps,带宽 576 GB/s。这个数字不是猜测。
和「叫 4090 的另外两张卡」必须分开:
卡 显存 带宽 就是不是对方这张
4090 Laptop GPU 16GB G6 576 GB/s 是
桌面 RTX 4090 24GB G6X 1008 GB/s 不是(社区 3.8-27B 数字几乎全是它)
桌面 RTX 4080 16GB G6X 717 GB/s 同芯不同显存
笔记本额外扣减(桌面 5060 Ti 没有):
- Windows WDDM + 内屏帧缓冲,通常先吃 200–800 MiB
- Optimus / Advanced Optimus 未切独显时,可用显存更差
- TGP 因机型而异:同样叫 4090 Laptop,80W 轻薄本和 175W 游戏本不是同一档速度
- 持续推理会掉到「机箱能散掉的功率」,评测第一分钟的数字会偏高
所以:对方如果只给了 GPU-Z / nvidia-smi 上的「RTX 4090 Laptop GPU 16GB」,
还缺 TGP(W)、是否独显直连、Windows 还是 Linux。这些会改速度,不改 16GB 上下文上限。
三、和 RTX 5060 Ti 16GB 的对照
----------------------------
4090 Laptop 16GB 5060 Ti 16GB(桌面)
架构 Ada AD103 / SM 8.9 Blackwell GB206 / SM 12.0
CUDA 核心 9728(2.11×) 4608
L2 64 MB(2×) 32 MB
FP32 ~33–40 TFLOPS ~23.7–25.3 TFLOPS
显存 16 GB GDDR6 16 GB GDDR7
位宽 256-bit 128-bit
带宽 576 GB/s(+28.6%) 448 GB/s
功耗墙 80–175 W(机型) 180 W 稳定
可用显存 约 15.0–15.5 GiB 约 15.5–15.8 GiB
编译架构 CMAKE ...=89 CMAKE ...=120
带宽相同吗?不相同。4090 Laptop 高 28.6%。
速度上限类似吗?同量化、全卡驻留下,decode 应按带宽比,大约快四分之一,不是「同一档」。
上下文上限类似吗?类似——两边都是 16GB,KV 加法相同。笔记本还可能略紧一点(内屏占显存)。
理论 decode 天花板(权重常驻、忽略 KV,经验效率约 80%):
文件 大小约 5060 Ti 理论/实测 4090 Laptop 按带宽外推
UD-IQ4_XS 14.3 GB 448/14.3≈31;实测 25–27 576/14.3≈40 → 约 32–35 t/s
Q4-XYZ-v2 15.06 GB 实测无 MTP 26.3 约 33–34 t/s
UD-Q3_K_XL 13.1 GB 稍快于 IQ4 约 35–38 t/s
桌面 4090 24GB 的对照(只用来标定,不是对方的卡):
Hardware Corner Q4、无 MTP:4K = 46.16 t/s(1008 GB/s)
按带宽缩到 576:46.16 × 576/1008 = 26.4 t/s —— 那是 Q4_K_M(约 17GB)装不满 16GB 的算法。
换 IQ4_XS(更小)后,4090 Laptop 无 MTP 应高于 26、低于桌面 4090 的 46,落在 30–35。
qwen38-mtp 社区表里,桌面 4090 24GB 无 MTP 约 36–48、MTP n-max 2 约 69–76 t/s。
那是 24GB + 常驻 Q4_K_M/XL + 1008 GB/s,不能当 4090 Laptop 的成绩单。
四、Q4 权重 + KV Q4_0 的上下文上限(按指定公式)
--------------------------------------------
公式(与前次报告、模型卡一致):
BF16/F16 KV = 64 KiB / token
16 层全注意力 × 4 KV 头 × 256 维 × 2(K+V)× 2 字节 = 65,536 B
Q4_0 KV ≈ 18 KiB / token(Q4_0 是 4.5 bit/值,约 F16 的 28%,不是精确 1/4)
上下文 F16 KV Q4_0 KV
8,192 0.50 GiB 0.14 GiB
32,768 2.00 GiB 0.56 GiB
65,536 4.00 GiB 1.13 GiB
98,304 6.00 GiB 1.69 GiB ← 提问者 5060 Ti 上 96K / 15.76G 所在档
131,072 8.00 GiB 2.25 GiB
210,000 13.13 GiB 3.69 GiB
262,144 16.00 GiB 4.50 GiB
16GB 卡还要扣:CUDA/图/计算缓冲 0.4–0.8 GiB,DeltaNet 固定状态 0.07–0.15 GiB,
合计开销按 0.6 GiB。笔记本再扣内屏 0.2–0.8 GiB。可用按 15.0–15.5 GiB 估。
Q4 档权重在 16GB 上的命运(与卡型无关,4090 Laptop 和 5060 Ti 同一张账单):
文件 约大小 扣完开销后留给 Q4 KV 对应上下文
UD-Q4_K_XL 17.6–17.9 GB 权重已经超 16GB 装不下
Q4_K_M / ggml-org Q4 16.5–19 GB 同上 装不下
UD-Q4_K_S 15.4 GB 贴边,几乎无 KV 空载~数 K
第三方 IQ4_XS 15.7 GB 贴边 ~32K;开 MTP 易 OOM
quimmedes Q4-XYZ-v2 15.06 GB 能开短上下文 + MTP ~32K(扫参表用的就是它)
Unsloth UD-IQ4_XS 14.3 GB 提问者实测 96K = 15.76G ~32K–96K(96K 已是上限附近)
UD-Q3_K_XL 13.1–13.4 GB 社区 16GB 甜点 ~64K–73K + MTP;128K 无 MTP 贴边
UD-Q2_K_XL 9.83 GB 才能开始谈 200K+ 256K Q4 KV(4.5 GiB)纸面能进
把加法写死(UD-IQ4_XS 14.3 + 开销 0.6):
32K: 14.3 + 0.56 + 0.6 ≈ 15.5 GB 能起来,MTP n-max 2 通常还能
96K: 14.3 + 1.69 + 0.6 ≈ 16.6 GB 提问者测到 15.76G,说明文件按十进制 GB 计约 13.3 GiB;
这是 16GB 卡 IQ4_XS 的实测天花板,换 4090 Laptop 不会变大
128K: 14.3 + 2.25 + 0.6 ≈ 17.2 GB OOM
210K: 14.3 + 3.69 + 0.6 ≈ 18.6 GB OOM
256K: 14.3 + 4.50 + 0.6 ≈ 19.4 GB OOM
4090 Laptop 若在 Windows + 内屏,可用显存往往比桌面 5060 Ti 更紧,96K 这条线更可能变成 64K–80K。
Linux + 外接屏/关桌面合成器,才比较接近提问者的 96K。
所以问题 2 的直接答案:
Q4 权重 + KV Q4_0,4090 Laptop 16GB 的实际上下文上限
≈ 32K(稳、能开 MTP)到约 96K(IQ4_XS、关 MTP、贴顶)。
128K / 210K / 256K 在真正的 Q4 权重上物理装不下。
这不是 4090 Laptop「不够快」,是 16GB 不够装。
五、MTP nextn=3 能不能到 44–50 t/s(对比 5060 Ti)
------------------------------------------------
5060 Ti 16GB、能装下的 Q4、32K、q4_0 KV(qwen38-mtp @jaisusx,b10472):
MTP off 26.3 t/s 14,514 MiB
n-max 2 50.0 t/s 15,404 MiB
n-max 3 53.6 t/s 15,554 MiB ← 对方「nextn=3」这一档
n-max 4 59.5 t/s 15,704 MiB(再深加载 OOM)
按带宽比外推到 4090 Laptop(576/448 = 1.286):
无 MTP 26.3 × 1.286 ≈ 34 t/s
n-max 2 50.0 × 1.286 ≈ 64 t/s
n-max 3 53.6 × 1.286 ≈ 69 t/s
这是上限方向,不是保证。笔记本还要打三折:
(a) TGP:150W 对比 5060 Ti 的 180W,SM 频率低,MTP 校验(偏算力)会掉一截。
显存时钟一般仍锁 18 Gbps,纯 decode 带宽优势大概率还在。
(b) 持续温控:轻薄 80–115W 机型会明显慢于 150–175W 游戏本。
(c) 4090 Laptop 算力是 5060 Ti 的约 1.5–2×,MTP 校验比 5060 Ti 更不容易变成算力瓶颈。
所以「带宽给的 1.29×」里,MTP 比无 MTP 更容易拿到。
综合估计(IQ4_XS 或定制 Q4,全卡驻留,-c 8K–32K,-np 1,思考关或 medium):
150–175W 游戏本
无 MTP 30–35 t/s
n-max 2 48–58 t/s
n-max 3 52–62 t/s
80–115W 轻薄本
再少 20–35%。最近的笔记本 16GB 收据:3080 Ti Laptop 115W、Q3_K_XL、16K
无 MTP 14.8 t/s,MTP n-max 2 仅 28.6 t/s(qwen38-mtp PR #56)。
4090 Laptop 同 TGP 也会比这快(Ada + 576 vs Ampere + 512),但到不了桌面 4090。
问题 3 的答案:
短上下文 + MTP nextn=3 → 44–50 t/s:在 150W 档 4090 Laptop 上可信,甚至可能高于 5060 Ti。
填满 128K / 210K / 256K 之后仍 44–50 t/s:不可信。长上下文要多扫 Q4 KV,
接受率下降,5060 Ti 在约 55K 填充后 MTP-1 已经掉到 31.3 t/s。
4090 Laptop 同容量,只会按带宽比例好一点,好不出一倍。
六、4090 Laptop 16GB + 视觉 mmproj + 128K + MTP 装得下吗?
-------------------------------------------------------
装不下。显存加法与 5060 Ti 相同。
Q4 权重(IQ4_XS) 14.3 GB
mmproj F16 ≈ 0.91 GB(931 MB)
128K Q4 KV 2.25 GiB
MTP n-max=3 草稿缓冲 0.4–0.8 GB(若再加载独立 MTP GGUF 则 +1.4–1.7 GB)
运行开销 0.6 GB
合计 ≥ 18 GB
换 Q3 也不够:
UD-Q3_K_XL 13.1 + mmproj 0.91 + 128K 2.25 + MTP 0.5 + 开销 0.6 ≈ 17.4 GB → 仍 OOM
公开能同时站住的 16GB 视觉配方(前次报告,Reddit):
UD-IQ4_XS + MTP-1 + F16 mmproj + 64K = 15,680 MiB,短上下文 45.4 t/s
这已经是 16GB 天花板。128K 不要想。mmproj 换成 q8_0(约 629MB)也补不回 2.25 GiB 的 128K KV。
问题 4:否。4090 Laptop 没有多出来的第 17 个 GB。
七、差距主要在带宽还是算力?decode 瓶颈是哪个?
-------------------------------------------
Qwen3.8-27B 单用户 decode(batch=1)是显存带宽瓶颈。每生成一个 token 都要把驻留权重量扫一遍。
理论步数 ≈ 带宽 / 权重体积
5060 Ti:448e9 / 14.3e9 ≈ 31 步/秒
4090 Laptop:576e9 / 14.3e9 ≈ 40 步/秒
桌面 4090:1008e9 / 16.7e9 ≈ 60 步/秒(Q4_K_M 装得下 24GB)
实测效率大约 75–85%(内核、采样、KV 读取)。这就是 26 vs ~33 vs ~46 的来源。
算力差在哪起作用:
更影响 4090 Laptop 相对 5060 Ti
decode(无 MTP) 带宽 +29% 主导;算力过剩
prefill / prompt eval 算力 + L2;4090 Laptop 明显更快(桌面 4090 prefill ~3000 t/s 量级,
笔记本按 TGP 打折,仍应高于 5060 Ti)
MTP 校验(每个草稿 token 再跑一遍) 算力更有用;4090 Laptop 的 2× 核心让 nextn=3 比 5060 Ti 更从容
长上下文注意力 Qwen3.8 只有 16/64 层全注意力,长上下文掉速比稠密 27B 慢,
但仍要读更大的 KV,带宽再次主导
所以:
两张卡的差距,对「你打字看到的 t/s」主要是带宽(576 vs 448),不是算力。
算力差距会显在「先读完长 prompt 的等待」和「MTP 能不能把 n-max 开到 3 而不亏」。
没有任何一项差距能把 4.5 GiB 的 256K Q4 KV 变小。
次要差异:
- 5060 Ti 是 Blackwell sm_120,llama.cpp 必须 -DCMAKE_CUDA_ARCHITECTURES=120,
否则跑兼容内核。4090 Laptop 是 Ada sm_89,编译 120 等于没为它优化。
- Blackwell 的 NVFP4 对 16GB 不是免费午餐(文件 16–23GB)。Ada 没有这条路。
- 5060 Ti L2 只有 32MB,4090 Laptop 64MB,对 14GB 权重几乎聊胜于无,改变不了「权重量扫」。
八、有没有 4090 Laptop 跑 Qwen3.8-27B 的公开实测?
----------------------------------------------
检索范围:GitHub qwen38-mtp 社区表及 sweeps/、r/LocalLLaMA、Hugging Face 讨论、
X/Twitter、Hardware Corner、Unsloth 文档、YouTube、中文社区。时间截至 2026-08-27。
结果:没有找到「RTX 4090 Laptop GPU 16GB + Qwen3.8-27B」带量化档、上下文、t/s 的收据。
能找到的、容易被认错的,全部不是这张卡:
来源 实际硬件 数字
Hardware Corner 桌面 4090 24GB 无 MTP 4K=46.16 / 64K=38.41 t/s
qwen38-mtp @Spadav_ 等 桌面 4090 24GB 47.7 → 76.3 t/s(MTP n-max 2)
@analogalok 桌面 4090 24GB 无 MTP ~41;MTP ~60–65;DFlash2 更高
且 260K 是 Q4 KV + 24GB,16GB 做不到
Maverobot qwen-mtp 桌面 4090 24GB Q4_K_M + MTP,65K 约 98 t/s(短答)
Prompt Engineer YouTube 租用桌面 4090 24GB Ollama Q4_K_M 86.7 t/s
对照 4060 Laptop 8GB 0.26 t/s(大量 CPU offload)
qwen38-mtp @sudoingX 5090 Laptop 24GB 36.7 → 50.9 t/s(这是 24GB 笔记本旗舰)
qwen38-mtp PR #56 3080 Ti Laptop 16GB Q3_K_XL、16K、115W:14.8 → 28.6 t/s
这是目前最接近的「16GB 笔记本跑 3.8-27B」收据
FitMyLLM / LocalAimaster 4090 Mobile 规格页 只给带宽公式估计,没有 27B 实测
Unsloth 文档 「16–19GB VRAM like RTX 5080, 4090」
这里的 4090 按习惯指桌面 24GB;4-bit 文件 16–19GB
本身就说明不是给 16GB 笔记本留上下文的
3080 Ti Laptop 那条收据的读法:同是 16GB 笔记本、更老架构、更低 TGP(115W)、更窄带宽(512 GB/s),
Q3 + MTP 也只有 29 t/s。4090 Laptop(576 GB/s、Ada、常见 150W)应当明显快于它,
并接近或略高于桌面 5060 Ti 的 50 t/s 短上下文档——这支持第五节的估计,
但不支持 128K/210K/256K 填满后仍 50 t/s。
在对方交出「模型文件名 + -c + -ctk/-ctv + 是否 --spec-type draft-mtp + 日志里的 kv size / eval time」
之前,速度只能按带宽模型估,不能当实测。
九、原三条声称在 4090 Laptop 上的重估
----------------------------------
前次对 5060 Ti 的判定仍然成立。换卡只改「短上下文有多快」,不改「16GB 装得下什么」。
声称 1 Q4 + mmproj + KV 压缩 4 + 128K + MTP 3 + 44 t/s
配置:不可行,合计 ≥18GB。4090 Laptop 没有多的显存。
速度:44 t/s 作为「32K + MTP n-max 2~3」在 150W 4090 Laptop 上比 5060 Ti 更可信。
判定:配置假,短上下文速度真。把短上下文 MTP 数字贴到了 128K+视觉上。
声称 2 无视觉、关 MTP、256K、35 t/s
配置:Q4 权重 + 256K Q4 KV(4.5 GiB)≥19GB,装不下。
35 t/s 本身接近 4090 Laptop 无 MTP、短上下文的估计(30–35)。
判定:字面不可行。最像「-c 262144 写进了启动参数,实际填充只有几十 K,
或者权重其实是 2-bit」。分配 256K 窗口不等于跑满 256K;
而且 llama.cpp 的 -c 会按窗口预分配 KV,Q4 权重连空的 4.5 GiB KV 都放不下。
声称 3 开 MTP、210K、50 t/s
配置:210K Q4 KV = 3.69 GiB,Q4 装不下,Q3 也装不下。
50 t/s 精确落在 5060 Ti 32K MTP n-max=2 的中位数;在 4090 Laptop 短上下文上同样合理。
判定:不可行。50 t/s 是短上下文 MTP 数字搬家。
和提问者 5060 Ti 实测(96K / 15.76G / 26 t/s)的关系:
那组数字在 4090 Laptop 上应当复现为「同样的 96K 贴顶、速度略快」,
例如无 MTP 约 30–34 t/s,而不是突然能装 210K。
若对方在 4090 Laptop 上真的展示了 210K 驻留,文件就不是 Q4——去看 GGUF 体积是不是 ≤11GB。
十、可复现配置(4090 Laptop 16GB)
-------------------------------
前置:
- llama.cpp b10472+(建议含 q4 KV prefill 修复的 b10520+)
- 编译给 Ada,不要抄 5060 Ti 的 120:
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=89
cmake --build build -j --target llama-server
- 测速一律 -np 1;thinking 先关或 reasoning_effort=medium
- Windows:独显直连 / 外屏,减少内屏占显存;电源插上,性能模式
- nvidia-smi 看 TGP 实际功耗。80W 和 150W 不是同一张卡
- 不要 -md / -hfd 再加载独立 MTP GGUF(主文件已含 nextn)
- 不要把桌面 4090 的 UD-Q4_K_XL(17.6GB+)往 16GB 上硬塞
先确认是不是这张芯:
nvidia-smi --query-gpu=name,memory.total,memory.free,power.limit,clocks.mem --format=csv
# 期望:GeForce RTX 4090 Laptop GPU,16384 MiB,显存时钟对应 18 Gbps
----- 配方 A:对齐提问者基线(IQ4_XS,96K,无 MTP)-----
# 预期:能起来或比 5060 Ti 更早 OOM(若 Windows 内屏占显存)。
# 速度:短生成约 30–35 t/s,不是 50。96K 填满后略降。
llama-server \
-m Qwen3.8-27B-UD-IQ4_XS.gguf \
-ngl 999 -fa on -np 1 \
-c 98304 \
-ctk q4_0 -ctv q4_0 \
--jinja --reasoning-preserve \
--host 127.0.0.1 --port 8080
# 若创建 KV 时 OOM,把 -c 降到 65536 或 32768。这就是 16GB 的真实上限,不是驱动问题。
----- 配方 B:4090 Laptop 日用甜点(速度 / 质量 / 上下文)-----
# 权重:UD-Q3_K_XL 13.1–13.4GB
# 预期:73K、MTP n-max 2,150W 机约 46–58 t/s(短填充);高于 5060 Ti 的 ~46
llama-server \
-m Qwen3.8-27B-UD-Q3_K_XL.gguf \
-ngl 999 -fa on -np 1 \
--fit off \
--ctx-checkpoints 0 \
-c 73728 \
-ctk q4_1 -ctv q4_1 \
-ctkd q5_1 -ctvd q5_1 \
--spec-type ngram-mod,draft-mtp \
--spec-draft-n-max 2 \
--temp 0.4 --top-p 0.90 --top-k 15 --min-p 0.02 \
--jinja --reasoning-preserve \
--host 127.0.0.1 --port 8080
----- 配方 C:冲击 44–50 t/s(必须短上下文,这才是声称里的速度)-----
# 权重优先:Q4-XYZ-v2 15.06GB 或 UD-IQ4_XS 14.3GB
# 预期(150W):无 MTP ~32 t/s;n-max 2 ~50–58;n-max 3 若 VRAM 余量 >400 MiB 再试
llama-server \
-m Qwen3.8-27B-UD-IQ4_XS.gguf \
-ngl 999 -fa on -np 1 \
--fit off \
-c 32768 \
-ctk q4_0 -ctv q4_0 \
-ctkd q4_0 -ctvd q4_0 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
--jinja --reasoning-preserve \
--host 127.0.0.1 --port 8080
# 验证对方声称时:看日志 type_k=q4_0、flash_attn=enabled、
# prompt eval / eval time,以及实际 n_past,不要看 -c 写了多少。
----- 配方 D:要视觉时必须让出的东西 -----
# mmproj F16 ≈ 0.91GB。32K + MTP n-max 1 是 16GB 能同时站住的组合。128K 不要开。
llama-server \
-m Qwen3.8-27B-UD-IQ4_XS.gguf \
--mmproj mmproj-Qwen3.8-27B-F16.gguf \
-ngl 999 -fa on -np 1 \
--fit off \
-c 32768 \
-ctk q4_0 -ctv q4_0 \
--spec-type draft-mtp \
--spec-draft-n-max 1 \
--jinja --reasoning-preserve \
--host 127.0.0.1 --port 8080
----- 配方 E:不要这样开 -----
# 1) 桌面 4090 的 Q4_K_M / UD-Q4_K_XL(17GB+)——权重就已经超过 16GB
# 2) -c 262144 配 Q4 权重——启动即 OOM(预分配 4.5 GiB Q4 KV)
# 3) 主 GGUF 已含 nextn,再 -md MTP-Q4_0.gguf——额外 1.4–1.9GB,必爆
# 4) CMAKE_CUDA_ARCHITECTURES=120 ——那是 Blackwell,这张卡是 89
----- 测速(和声称对齐的方式)-----
# 短上下文(验证 44–50 t/s 是不是「这一档」):
curl 127.0.0.1:8080/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"x","messages":[{"role":"user","content":"Write a Python merge sort."}],"max_tokens":256,"temperature":0}'
# 长上下文:先灌满再生成。填满后 eval time 必须变慢,否则对方没有真的在用那个窗口。
要向对方要的最小证据包(没有这些,截图 t/s 没有鉴定价值):
1. nvidia-smi 的 GPU 名、memory.total、power.limit(确认是 Laptop 16GB 以及 TGP)
2. GGUF 文件名和字节数(分辨 Q4 / Q3 / Q2)
3. 完整启动命令(-c、-ctk/-ctv、--spec-type、有无 --mmproj、有无 -md)
4. 启动日志:kv size、type_k/type_v、flash_attn、load 后 VRAM
5. 一次短 prompt 和一次接近 -c 的长 prompt 的 prompt eval / eval time
十一、对提问者的可执行建议
------------------------
目标 4090 Laptop 上怎么做 预期(150W 档)
要对齐 50 t/s Q3 或 IQ4_XS,32K–73K,MTP n-max 2 48–58 t/s,短填充
要尽量长上下文 IQ4_XS 无 MTP,看到底能到 64K 还是 96K 无 MTP 约 30 t/s
要视觉 砍到 32K,MTP n-max 1,mmproj q8/F16 短上下文仍可 40+ t/s
要 210K–256K 换 UD-Q2_K_XL / 2.7bpw,或换 24GB 卡 填满后远低于 50 t/s
不要做的 相信「换了 4090 Laptop 就能 Q4+256K+50t/s」
若对方坚持三件事同时成立,最小打假动作:看 GGUF 体积。
大于 14GB 还声称 210K+ 驻留 → 假(或 KV 在系统内存,速度会垮)。
小于 11GB → 不是 Q4,是 2–3 bit,先前「Q4」的表述就不成立。
十二、主要来源
------------
规格
NVIDIA 40 系笔记本规格页:9728 CUDA、16GB GDDR6、Boost 1455–2040 MHz、686 TOPS
VideoCardz / TechPowerUp:18.0 Gbps、256-bit、576.0 GB/s、TGP 80–175W、FP32 至 39.7 TFLOPS
Notebookcheck / TechSpot:同一带宽;与桌面 4080 同芯、GDDR6 而非 GDDR6X
NVIDIA 5060 Ti 评测(DF / Igor / Guru3D):4608 核、128-bit GDDR7 28 Gbps、448 GB/s、180W、FP32 ~24 TFLOPS
带宽模型与笔记本 LLM
LocalAimaster「Laptop Local AI」:4090 Laptop 576 GB/s;t/s 天花板 = 带宽 / 文件体积
前次报告 grok-16g-256k-调研.txt:KV 公式、16GB 加法、5060 Ti MTP 扫参
Qwen3.8-27B 实测(均非 4090 Laptop 16GB)
github.com/sudoingX/qwen38-mtp 社区表与 sweeps/rtx-5060-ti.md
Hardware Corner:桌面 4090 / 3090 / 5090 / 双 5060 Ti
qwen38-mtp PR #56:3080 Ti Laptop 16GB 115W,Q3_K_XL 14.8 → 28.6 t/s
桌面 4090 24GB MTP:@Spadav_ 47.7→76.3;@analogalok ~41→60–65(Q4 KV 才能在 24GB 上谈 260K)
否定检索
qwen38-mtp sweeps 目录无 4090-laptop / 4090-mobile 专页
公开 web / X 检索无「4090 Laptop 16GB + Qwen3.8-27B」带 t/s 的独立测量
十三、一句话
------------
RTX 4090 Laptop 16GB 的显存带宽是 576 GB/s,不是 448;它比 5060 Ti 快大约四分之一,算力大约翻倍,但显存还是 16GB。
Qwen3.8-27B 的 decode 卡在带宽上,所以短上下文 + MTP 到 44–50 t/s 在这张卡上成立;
Q4 + 128K/210K/256K 仍然装不下,视觉 + 128K + MTP 3 也装不下。
对方若没有给出 GGUF 体积和实际填充长度,那张「4090 Laptop」截图只证明芯片型号,不证明声称。