| 配置 | 机器/后端 | 耗时(s) | 相对 dawidope |
|---|---|---|---|
| dawidope 公开默认档(50步+LoRA+FBC) | RTX5090(参考基线) | 343–361 | 1.0× |
| lightx2v v1.0 4step LoRA · 4步(新默认) | viggle cuda+sage | 99.5 | 3.5× |
| nvfp4 + LoRA bypass · 4步 | viggle cuda+sage | 99.6 | 3.5× |
| int8 + larryvrh LoRA · 4步 | viggle cuda+sage | 103.3 | 3.4× |
| I2V 首帧 · int8+LoRA · 4步 | viggle cuda+sage | 115.0 | 3.1× |
| lightx2v v1.0 8step · 8步(质量档) | viggle cuda+sage | 177.6 | 2.0× |
| int8 + larryvrh · 8步 | viggle cuda+sage | 176.4–177.4 | 2.0× |
| FLF2V 首尾帧 · 4步 | viggle cuda+SDPA | 214.3 | 1.6× |
| int8 + larryvrh · 4步 | 本机 triton+sage | 118.1 | 3.0× |
| int8 + larryvrh · 8步 | 本机 triton+sage | 204.3 | 1.7× |
| nvfp4 无 LoRA · 8步 | 本机 triton+sage | 206.3 | 1.7× |
6s 短片(141帧,PDF 任务规格)单条仅 ~48–54s。每换一次模型首条 run 另有 10–50s 权重上载。速度均为服务器实测(runs.jsonl 原始记录)。
| 配置 | 总耗时 | 采样 | 每步(纯denoise) | VAE视频解码 | 文本编码 | 音频VAE+封装保存 |
|---|---|---|---|---|---|---|
| int8 + lx2v 4step LoRA · 4步 | 50.7s | 31.7s | 7.44s | 13.5s | 1.9s | 3.4s |
| nvfp4 + 4step LoRA(bypass) · 4步 | 54.2s | 34.8s | 8.30s | 14.1s | 1.8s | 3.4s |
| int8 + lx2v 8step LoRA · 8步 | 81.6s | 63.0s | 7.66s | 13.5s | 1.8s | 2.9s |
| nvfp4 + 8step LoRA(bypass) · 8步 | 88.1s | 69.2s | 8.45s | 14.1s | 1.8s | 3.1s |
nvfp4 每步慢 11–12% = bypass 旁路矩阵 + w4a4 激活量化开销。换模型后的首条 run 另有 20–380s 一次性装载(冷盘读取+Qwen 首载),测速时已剔除。10s 片(243帧)的每步约 17.7s、VAE 解码约 23.6s。
想法:一张卡专驻 Qwen 文本编码器、另一张专驻 DiT,消除每 run 的模型交换。已实现(自定义节点 pin CLIP 到指定 GPU)并实测(int8+lx2v 4step):
| 指标 | 现架构(单卡混驻) | 分卡驻留(Qwen@GPU6+DiT@GPU7) | 结论 |
|---|---|---|---|
| 6s 片热跑 | 50.7s | 46.1s(采样29.3=每步7.02×4+装载1.2 · VAE 13.7 · 编码0.3) | −9% |
| 10s 片热跑 | ~100–103s | 104–105s(每步17.7s · VAE 23.6s · 编码0.5–0.7s) | 持平 |
| 720p 最大帧数 | 923 帧 | 923 帧(974 仍 OOM) | 无提升 |
| 冷启动装载(一次性) | — | Qwen 26.5s + DiT 34.6s | — |
为什么收益小:ComfyUI 动态显存本来就在采样时逐出 Qwen、编码时流回,热循环里的交换税实测仅 2–4s;采样期显存瓶颈是激活而非 Qwen 权重,所以容量也不变。
吞吐账(jobs/s,6s 片):2 卡 — 两条完整管线 2×(1/50.7)=0.0394 vs 分卡 1×(1/46.1)=0.0217 → 完整管线胜 82%;8 卡 — 8 条完整管线 8×(1/50.7)=0.158 vs 1 Qwen+7 DiT 7×(1/46.1)=0.152 → 完整管线仍胜 4%。任何规模下都不值得分卡,除非未来出现"Qwen 编码耗时占比大幅上升"或"DiT 卡需要腾出权重显存"的新场景。
背景:H3 官方管线 = base 模型 768p 生成 → 同一模型 in-context 重生成到 2K(1440p短边);官方无 4K。开源 FL2VA 权重的训练画布 = 768×1344。实测(int8 + lx2v 4step LoRA · 4步 · 90帧=3.75s · GPU7 单卡):
| 分辨率 | 总耗时 | 采样 | VAE解码 | 峰值VRAM | 画质 |
|---|---|---|---|---|---|
| 2K(2560×1440,官方成片档) | 162s | 124s(每步~29s) | ~30s | 32.1GB(贴顶) | ✅ 惊艳——单段直出即可用,细节锐利结构连贯(推测因官方2K重生成阶段用同一DiT,2K token规模在分布内) |
| 4K(3840×2144) | 584s | 506s(每步~120s) | 67s | 31.3GB | ❌ 完全崩坏——整帧灰褐噪声+重复网格(8×出分布,位置外推崩溃)。能跑,不能看 |
注:2K 下 90 帧已到 32GB 显存顶,更长需降分辨率;推荐日常仍用 1344×768(速度/时长最优),2K 用于短片高清直出。