# B-文档改写

**提示词**

把下面这段改写成给非技术同事看的 5 条要点，每条不超过 25 字：三值量化把模型权重限制在 -1、0、+1 三个值上，每 128 个权重共享一个 FP16 缩放因子；权重在 Hadamard 旋转基下存储，推理时对激活做匹配变换；这样 27B 模型只需 5.95GB。

**思考模式**: False

---

## 正文

1. 模型参数只保留三个值，大幅减少存储占用
2. 每百多个参数共享一个缩放值，提升压缩效率
3. 数据转换存储，推理时自动匹配还原
4. 27B大模型体积缩至5.95GB
5. 部署更轻量，加载速度显著加快

---

## 思考链(reasoning_content, 前 800 字)



---

## 指标

- 墙钟耗时: 2.2s
- usage: `{"completion_tokens": 73, "prompt_tokens": 106, "total_tokens": 179, "prompt_tokens_details": {"cached_tokens": 0}}`
- timings: `{"prompt_ms": 383.057, "predicted_ms": 1650.81, "prompt_per_second": 276.72121903528716, "predicted_per_second": 43.61495265960347}`
