日期:2026-09-16(GPU 机日志时间为 UTC 12:40 ~ 12:56) 机器:GPU 机 192.168.31.31(RTX 5060 Ti 16GB / 32GB RAM / 根分区余 200GB) 执行:DSH(DeepSeek Harness) 约束:全程未触碰 ComfyUI(未改配置、未装节点、未停服务、未占显存);ComfyUI 进程 PID 17332 全程存活,显存 11.6GB 未被干扰。 当前状态:下载完成,尚未安装、尚未运行(按"先下载"的要求停在安装前一步)。
| 项目 | 内容 | 体积 | 状态 |
|---|---|---|---|
| 代码仓库 | ACE-Step-1.5 @ ca1e85f(2026-08-29),shallow clone | 141 MB | ✅ |
| 模型权重(主) | ACE-Step/Ace-Step1.5:acestep-v15-turbo(2B DiT) + vae + Qwen3-Embedding-0.6B + acestep-5Hz-lm-1.7B | 10.09 GB | ✅ |
| 模型权重(附加) | ACE-Step/acestep-v15-sft(2B,支持 CFG、50 步、质量更高) | 4.79 GB | ✅ |
| 模型权重(附加) | ACE-Step/acestep-5Hz-lm-0.6B(低显存备用规划器) | 1.37 GB | ✅ |
| Python 依赖轮子 | wheels/:142 个 wheel,含 torch 2.10.0+cu128 全家桶 + nvidia-cu12 运行时 + 29 个主依赖 + nano-vllm 依赖(triton/xxhash),不含 flash-attn | 4.2 GB | ✅ |
完整性校验:对三个 ModelScope 仓库全部 50 个文件做 sha256 比对 → ok=50 bad=0 missing=0(校验脚本 /home/zyw/ace-step-verify.py,日志 /home/zyw/ace-step-verify.log)。 可安装性验证:用临时 venv 做 pip install --dry-run --no-index --find-links wheels → 全部依赖(含 torch-2.10.0+cu128、torchao-0.16.0、triton-3.6.0、13 个 nvidia-*-cu12)可从本地 wheelhouse 完整解析,无需联网。
/home/zyw/ACE-Step-1.5/
├── acestep/ # 源码(含 third_parts/nano-vllm)
├── checkpoints/ # 16 GB 模型权重(官方默认读取位置)
│ ├── acestep-v15-turbo/ # model.safetensors 4.79 GB(DiT,默认)
│ ├── acestep-v15-sft/ # model.safetensors 4.79 GB
│ ├── acestep-5Hz-lm-1.7B/ # model.safetensors 3.71 GB(默认 LM)
│ ├── acestep-5Hz-lm-0.6B/ # model.safetensors 1.33 GB
│ ├── Qwen3-Embedding-0.6B/ # 1.19 GB 文本编码器
│ └── vae/ # 337 MB 音频 VAE
├── wheels/ # 4.2 GB 离线轮子仓库(未安装)
└── .venv-dl/ # 仅用于下载的轻量 venv(modelscope)
辅助脚本/日志(均在 GPU 机 /home/zyw/):ace-step-dl.sh(模型下载)、ace-step-wheels.sh(依赖下载)、ace-step-mkreq.py + ace-step-req.txt + ace-step-nv-dep.txt(依赖清单生成)、ace-step-verify.py(哈希校验)、日志 ace-step-models-dl.log / ace-step-wheels.log / ace-step-verify.log。 本机已装:uv 0.12.15(~/.local/bin/uv,未改 PATH 配置)。uv 的 sync 未成功使用,见下节。
| 源 | 实测速度 | 结论 |
|---|---|---|
modelscope.cn | 19.5 MB/s(单流)~51.8 MB/s(多线程) | ✅ 模型权重全部走这里 |
mirrors.aliyun.com/pytorch-wheels/cu128 | 14.1 MB/s | ✅ torch/torchvision/torchaudio 走这里 |
pypi.tuna.tsinghua.edu.cn | 40 ~ 135 MB/s | ✅ 其余 Python 包走这里 |
hf-mirror.com | 2.28 MB/s | 备用 |
files.pythonhosted.org | 1.0 MB/s | 太慢,弃用 |
download.pytorch.org | 1.7 MB/s | 太慢(仅在 pip.conf 里做 extra-index 遗留) |
github.com(release 二进制) | 超时/不可用 | ❌ 这是 uv 卡死的根因 |
uv sync 卡死在 GitHub:仓库 uv.lock 里 nano-vllm 依赖 flash-attn 的预编译轮子托管在 GitHub Releases,本机下载该地址超时;实测 uv 进程 8 分钟只从 GitHub 拖了 521 MB(还是个 Windows 的 flash_attn_2_cuda.cp311-win_amd64.pyd),venv 一直 92 KB。结论:放弃 uv sync,改走 pip + 国内镜像。cp311 轮子(marker 写的是 python_full_version < '3.12'),本机系统 Python 是 3.12.3 → 即便 GitHub 通也装不上。官方支持不装 flash-attn:源码 acestep/llm_inference.py:660 会打印 “flash_attn not installed: disabling CUDA graph capture for nano-vllm”,自动回退 SDPA 路径。download 子命令没有 --break-system-packages(报 no such option),会直接终止脚本;pip download 本身不受 PEP 668 限制,去掉该参数即可。pip.conf 里挂着 extra-index-url = download.pytorch.org/whl/cu130,下载依赖时会把 torch 解析成 2.12.1+cu130 并从头拉 532 MB。解决:export PIP_CONFIG_FILE=/dev/null 隔离配置,再用 --find-links <本地 wheels 目录> + torch==2.10.0+cu128 精确钉版本。pkill -f "uv sync" 会自杀:模式串出现在自身命令行里,会把 ssh 会话一起杀掉(与 AGENTS.md 里 llmster 那个坑同源)。用 pkill -f "uv syn[c]" 这类带方括号的写法规避。# 1) 建独立 venv(与 ComfyUI 的 venv 完全隔离)
cd /home/zyw/ACE-Step-1.5
python3 -m venv .venv
export PIP_CONFIG_FILE=/dev/null # 隔离系统 pip.conf 的 cu130 extra-index
# 2) 从本地 wheelhouse 安装全部依赖(不联网)
.venv/bin/pip install --no-index --find-links wheels \
-r /home/zyw/ace-step-req.txt -r /home/zyw/ace-step-nv-dep.txt \
"torch==2.10.0+cu128" "torchvision==0.25.0+cu128" "torchaudio==2.10.0+cu128"
# 3) 安装本体与 nano-vllm(--no-deps 跳过 flash-attn)
.venv/bin/pip install --no-deps -e .
.venv/bin/pip install --no-deps -e acestep/third_parts/nano-vllm
# 4) 启动(Gradio 7860 / REST API 8001)
.venv/bin/python -m acestep.acestep_v15_pipeline --port 7860
# 或 .venv/bin/acestep --port 7860 / .venv/bin/acestep-api
显存前提(重要):ACE-Step 与 ComfyUI 不能同时吃到显存。
bash ~/restart_comfy.sh 是起的脚本,停用 pkill -f "main.py.*818[9]"(不要用会匹配自身的写法),或按 dl-hub/06-ComfyUI-H3运维记录/ 的既有流程处理;反过来跑完 ComfyUI 记得恢复。--config_path acestep-v15-turbo --lm_model_path acestep-5Hz-lm-1.7B(默认档,最省显存);16GB 卡不建议一上来用 XL(4B)。Python 3.12 + torch 2.10.0+cu128 说明:cu128 运行时自带,驱动 610.43.02(CUDA 13.2)向下兼容;与 ComfyUI 的 cu130 环境互不影响(各自 venv)。
.venv、未安装依赖、未下载 LM 4B / DiT base / turbo-shift 等可选档(需要时再下,ModelScope 上都是几十秒级)。acestep-v15-xl-turbo 约 19.95 GB(4 个分片),16GB 卡需 ≥12GB 显存 + offload/量化才能跑;要不要下待定。ComfyUI-ACEStep)——这属于"动 ComfyUI",需用户明确同意后再做。dl-hub/39-开源歌曲生成与音色克隆调研/开源歌曲生成AI与音色克隆-调研-20260916.md