# B-文档改写

**提示词**

把下面这段改写成给非技术同事看的 5 条要点，每条不超过 25 字：三值量化把模型权重限制在 -1、0、+1 三个值上，每 128 个权重共享一个 FP16 缩放因子；权重在 Hadamard 旋转基下存储，推理时对激活做匹配变换；这样 27B 模型只需 5.95GB。

**思考模式**: False

---

## 正文

1. 模型参数简化为三个档位，大幅压缩数据体积。
2. 每128个参数共用一个标准值，统一衡量尺度。
3. 数据采用特殊编码方式存储，优化空间占用。
4. 读取数据时自动匹配解码，确保结果准确无误。
5. 27B大模型体积缩小，仅占5.95GB存储空间。

---

## 思考链(reasoning_content, 前 800 字)



---

## 指标

- 墙钟耗时: 2.5s
- usage: `{"completion_tokens": 87, "prompt_tokens": 106, "total_tokens": 193, "prompt_tokens_details": {"cached_tokens": 0}}`
- timings: `{"prompt_ms": 308.147, "predicted_ms": 2046.999, "prompt_per_second": 343.99166631510286, "predicted_per_second": 42.01272203845727}`
