# ACE-Step 1.5「所需文件」下载就绪记录

**日期**：2026-09-16（GPU 机日志时间为 UTC 12:40 ~ 12:56）
**机器**：GPU 机 192.168.31.31（RTX 5060 Ti 16GB / 32GB RAM / 根分区余 200GB）
**执行**：DSH（DeepSeek Harness）
**约束**：**全程未触碰 ComfyUI**（未改配置、未装节点、未停服务、未占显存）；ComfyUI 进程 PID 17332 全程存活，显存 11.6GB 未被干扰。
**当前状态**：**下载完成，尚未安装、尚未运行**（按"先下载"的要求停在安装前一步）。

---

## 一、已完成清单

| 项目 | 内容 | 体积 | 状态 |
|---|---|---|---|
| 代码仓库 | `ACE-Step-1.5` @ `ca1e85f`（2026-08-29），shallow clone | 141 MB | ✅ |
| 模型权重（主） | `ACE-Step/Ace-Step1.5`：`acestep-v15-turbo`(2B DiT) + `vae` + `Qwen3-Embedding-0.6B` + `acestep-5Hz-lm-1.7B` | 10.09 GB | ✅ |
| 模型权重（附加） | `ACE-Step/acestep-v15-sft`（2B，支持 CFG、50 步、质量更高） | 4.79 GB | ✅ |
| 模型权重（附加） | `ACE-Step/acestep-5Hz-lm-0.6B`（低显存备用规划器） | 1.37 GB | ✅ |
| Python 依赖轮子 | `wheels/`：142 个 wheel，含 torch 2.10.0+cu128 全家桶 + nvidia-cu12 运行时 + 29 个主依赖 + nano-vllm 依赖（triton/xxhash），**不含 flash-attn** | 4.2 GB | ✅ |

**完整性校验**：对三个 ModelScope 仓库全部 50 个文件做 sha256 比对 → **`ok=50 bad=0 missing=0`**（校验脚本 `/home/zyw/ace-step-verify.py`，日志 `/home/zyw/ace-step-verify.log`）。
**可安装性验证**：用临时 venv 做 `pip install --dry-run --no-index --find-links wheels` → 全部依赖（含 `torch-2.10.0+cu128`、`torchao-0.16.0`、`triton-3.6.0`、13 个 `nvidia-*-cu12`）**可从本地 wheelhouse 完整解析，无需联网**。

---

## 二、目录结构（GPU 机）

```
/home/zyw/ACE-Step-1.5/
├── acestep/                     # 源码（含 third_parts/nano-vllm）
├── checkpoints/                 # 16 GB 模型权重（官方默认读取位置）
│   ├── acestep-v15-turbo/       #   model.safetensors 4.79 GB（DiT，默认）
│   ├── acestep-v15-sft/         #   model.safetensors 4.79 GB
│   ├── acestep-5Hz-lm-1.7B/     #   model.safetensors 3.71 GB（默认 LM）
│   ├── acestep-5Hz-lm-0.6B/     #   model.safetensors 1.33 GB
│   ├── Qwen3-Embedding-0.6B/    #   1.19 GB 文本编码器
│   └── vae/                     #   337 MB 音频 VAE
├── wheels/                      # 4.2 GB 离线轮子仓库（未安装）
└── .venv-dl/                    # 仅用于下载的轻量 venv（modelscope）
```

**辅助脚本/日志（均在 GPU 机 `/home/zyw/`）**：`ace-step-dl.sh`（模型下载）、`ace-step-wheels.sh`（依赖下载）、`ace-step-mkreq.py` + `ace-step-req.txt` + `ace-step-nv-dep.txt`（依赖清单生成）、`ace-step-verify.py`（哈希校验）、日志 `ace-step-models-dl.log` / `ace-step-wheels.log` / `ace-step-verify.log`。
**本机已装**：`uv 0.12.15`（`~/.local/bin/uv`，未改 PATH 配置）。uv 的 sync 未成功使用，见下节。

---

## 三、为什么走 ModelScope + 阿里云 PyTorch 镜像（实测带宽）

| 源 | 实测速度 | 结论 |
|---|---|---|
| `modelscope.cn` | **19.5 MB/s（单流）～51.8 MB/s（多线程）** | ✅ 模型权重全部走这里 |
| `mirrors.aliyun.com/pytorch-wheels/cu128` | **14.1 MB/s** | ✅ torch/torchvision/torchaudio 走这里 |
| `pypi.tuna.tsinghua.edu.cn` | **40 ~ 135 MB/s** | ✅ 其余 Python 包走这里 |
| `hf-mirror.com` | 2.28 MB/s | 备用 |
| `files.pythonhosted.org` | 1.0 MB/s | 太慢，弃用 |
| `download.pytorch.org` | 1.7 MB/s | 太慢（仅在 pip.conf 里做 extra-index 遗留） |
| `github.com`（release 二进制） | 超时/不可用 | ❌ 这是 uv 卡死的根因 |

---

## 四、踩坑记录（后续重装别再踩）

1. **`uv sync` 卡死在 GitHub**：仓库 `uv.lock` 里 `nano-vllm` 依赖 `flash-attn` 的**预编译轮子托管在 GitHub Releases**，本机下载该地址超时；实测 uv 进程 8 分钟只从 GitHub 拖了 521 MB（还是个 **Windows** 的 `flash_attn_2_cuda.cp311-win_amd64.pyd`），venv 一直 92 KB。**结论：放弃 uv sync，改走 pip + 国内镜像。**
2. **flash-attn 与 Python 3.12 不匹配**：锁里只有 `cp311` 轮子（marker 写的是 `python_full_version < '3.12'`），本机系统 Python 是 3.12.3 → 即便 GitHub 通也装不上。**官方支持不装 flash-attn**：源码 `acestep/llm_inference.py:660` 会打印 “flash_attn not installed: disabling CUDA graph capture for nano-vllm”，自动回退 SDPA 路径。
3. **pip 24.0 的 `download` 子命令没有 `--break-system-packages`**（报 `no such option`），会直接终止脚本；`pip download` 本身不受 PEP 668 限制，去掉该参数即可。
4. **系统 `pip.conf` 里挂着 `extra-index-url = download.pytorch.org/whl/cu130`**，下载依赖时会把 `torch` 解析成 **2.12.1+cu130** 并从头拉 532 MB。解决：`export PIP_CONFIG_FILE=/dev/null` 隔离配置，再用 `--find-links <本地 wheels 目录>` + `torch==2.10.0+cu128` 精确钉版本。
5. **`pkill -f "uv sync"` 会自杀**：模式串出现在自身命令行里，会把 ssh 会话一起杀掉（与 AGENTS.md 里 `llmster` 那个坑同源）。用 `pkill -f "uv syn[c]"` 这类带方括号的写法规避。

---

## 五、后续安装与启动（全部离线，约 2~3 分钟）

```bash
# 1) 建独立 venv（与 ComfyUI 的 venv 完全隔离）
cd /home/zyw/ACE-Step-1.5
python3 -m venv .venv
export PIP_CONFIG_FILE=/dev/null            # 隔离系统 pip.conf 的 cu130 extra-index

# 2) 从本地 wheelhouse 安装全部依赖（不联网）
.venv/bin/pip install --no-index --find-links wheels \
  -r /home/zyw/ace-step-req.txt -r /home/zyw/ace-step-nv-dep.txt \
  "torch==2.10.0+cu128" "torchvision==0.25.0+cu128" "torchaudio==2.10.0+cu128"

# 3) 安装本体与 nano-vllm（--no-deps 跳过 flash-attn）
.venv/bin/pip install --no-deps -e .
.venv/bin/pip install --no-deps -e acestep/third_parts/nano-vllm

# 4) 启动（Gradio 7860 / REST API 8001）
.venv/bin/python -m acestep.acestep_v15_pipeline --port 7860
#   或 .venv/bin/acestep --port 7860      /      .venv/bin/acestep-api
```

**显存前提（重要）**：ACE-Step 与 ComfyUI **不能同时吃到显存**。
- 当前 ComfyUI 常驻占 **11.6 GB / 16.3 GB**，ACE-Step 2B turbo + LM 1.7B 大约需要 6~10 GB。
- 跑 ACE-Step 前建议先停 ComfyUI：`bash ~/restart_comfy.sh` 是起的脚本，停用 `pkill -f "main.py.*818[9]"`（**不要**用会匹配自身的写法），或按 `dl-hub/06-ComfyUI-H3运维记录/` 的既有流程处理；反过来跑完 ComfyUI 记得恢复。
- 只想跑 ACE-Step：用 `--config_path acestep-v15-turbo --lm_model_path acestep-5Hz-lm-1.7B`（默认档，最省显存）；16GB 卡不建议一上来用 XL(4B)。

**Python 3.12 + torch 2.10.0+cu128 说明**：cu128 运行时自带，驱动 610.43.02（CUDA 13.2）向下兼容；与 ComfyUI 的 cu130 环境互不影响（各自 venv）。

---

## 六、未做 / 待办

- ❌ **未创建 `.venv`、未安装依赖、未下载 LM 4B / DiT base / turbo-shift 等可选档**（需要时再下，ModelScope 上都是几十秒级）。
- ❌ **未下载 XL(4B) DiT**：`acestep-v15-xl-turbo` 约 **19.95 GB**（4 个分片），16GB 卡需 ≥12GB 显存 + offload/量化才能跑；要不要下待定。
- ❌ **未跑任何推理**：跑起来会占显存、干扰正在运行的 ComfyUI，所以按约束完全没启动。
- ⏳ 可选：把 ACE-Step 接进 ComfyUI（社区节点 `ComfyUI-ACEStep`）——**这属于"动 ComfyUI"，需用户明确同意后再做**。

---

## 七、相关文档

- 选型调研（开源歌曲生成 + 音色克隆全景）：`dl-hub/39-开源歌曲生成与音色克隆调研/开源歌曲生成AI与音色克隆-调研-20260916.md`
- 官方仓库：<https://github.com/ace-step/ACE-Step-1.5> ｜ 中文教程：<https://github.com/ace-step/ACE-Step-1.5/blob/main/docs/zh/Tutorial.md> ｜ 模型：<https://www.modelscope.cn/models/ACE-Step/Ace-Step1.5>
