FL2VA 速度基准与样片

满配速度总表(1344×768 · 243帧=10.1s 成片 · 带音频 · 热跑)

配置机器/后端耗时(s)相对 dawidope
dawidope 公开默认档(50步+LoRA+FBC)RTX5090(参考基线)343–3611.0×
lightx2v v1.0 4step LoRA · 4步(新默认)viggle cuda+sage99.53.5×
nvfp4 + LoRA bypass · 4步viggle cuda+sage99.63.5×
int8 + larryvrh LoRA · 4步viggle cuda+sage103.33.4×
I2V 首帧 · int8+LoRA · 4步viggle cuda+sage115.03.1×
lightx2v v1.0 8step · 8步(质量档)viggle cuda+sage177.62.0×
int8 + larryvrh · 8步viggle cuda+sage176.4–177.42.0×
FLF2V 首尾帧 · 4步viggle cuda+SDPA214.31.6×
int8 + larryvrh · 4步本机 triton+sage118.13.0×
int8 + larryvrh · 8步本机 triton+sage204.31.7×
nvfp4 无 LoRA · 8步本机 triton+sage206.31.7×

6s 短片(141帧,PDF 任务规格)单条仅 ~48–54s。每换一次模型首条 run 另有 10–50s 权重上载。速度均为服务器实测(runs.jsonl 原始记录)。

样片(点击播放,均带音频)

lightx2v v1.0 4step LoRA · 4步(新默认)
⏱ 99.5s · int8 · viggle cuda+sage · ugc
nvfp4 + larryvrh LoRA(bypass 加载)· 4步
⏱ 99.6s · nvfp4 · viggle cuda+sage · ugc · DiT 显存省 8GB
int8 + larryvrh v4 LoRA · 4步
⏱ 103.3s · int8 · viggle cuda+sage · ugc
lightx2v v1.0 8step LoRA · 8步(质量档)
⏱ 177.6s · int8 · viggle cuda+sage · ugc
int8 + larryvrh v4 LoRA · 8步
⏱ 176.4s · int8 · viggle cuda+sage · ugc
int8 + larryvrh LoRA · 8步 · cinematic
⏱ 177.4s · viggle cuda+sage
I2V(首帧条件)· int8+LoRA · 4步
⏱ 115.0s · viggle cuda+sage · 首帧遵循差 4.8/255
FLF2V(首尾帧条件)· int8+LoRA · 4步
⏱ 214.3s · viggle cuda+SDPA 档 · 首尾遵循差 ~4.5/255
int8 + larryvrh LoRA · 8步(本机)
⏱ 204.3s · 本机 triton+sage · cinematic
nvfp4 无 LoRA · res_multistep 8步(本机基线)
⏱ 206.3s · 本机 triton+sage · cinematic

分段计时(逐节点 WebSocket 实测,6s 片=1344×768×141帧,热跑中位数,int8=GPU7/nvfp4=GPU6)

配置总耗时采样每步(纯denoise)VAE视频解码文本编码音频VAE+封装保存
int8 + lx2v 4step LoRA · 4步50.7s31.7s7.44s13.5s1.9s3.4s
nvfp4 + 4step LoRA(bypass) · 4步54.2s34.8s8.30s14.1s1.8s3.4s
int8 + lx2v 8step LoRA · 8步81.6s63.0s7.66s13.5s1.8s2.9s
nvfp4 + 8step LoRA(bypass) · 8步88.1s69.2s8.45s14.1s1.8s3.1s

nvfp4 每步慢 11–12% = bypass 旁路矩阵 + w4a4 激活量化开销。换模型后的首条 run 另有 20–380s 一次性装载(冷盘读取+Qwen 首载),测速时已剔除。10s 片(243帧)的每步约 17.7s、VAE 解码约 23.6s。

Qwen/DiT 分卡驻留实验(2026-08-11,已否决)

想法:一张卡专驻 Qwen 文本编码器、另一张专驻 DiT,消除每 run 的模型交换。已实现(自定义节点 pin CLIP 到指定 GPU)并实测(int8+lx2v 4step):

指标现架构(单卡混驻)分卡驻留(Qwen@GPU6+DiT@GPU7)结论
6s 片热跑50.7s46.1s(采样29.3=每步7.02×4+装载1.2 · VAE 13.7 · 编码0.3)−9%
10s 片热跑~100–103s104–105s(每步17.7s · VAE 23.6s · 编码0.5–0.7s)持平
720p 最大帧数923 帧923 帧(974 仍 OOM)无提升
冷启动装载(一次性)Qwen 26.5s + DiT 34.6s

为什么收益小:ComfyUI 动态显存本来就在采样时逐出 Qwen、编码时流回,热循环里的交换税实测仅 2–4s;采样期显存瓶颈是激活而非 Qwen 权重,所以容量也不变。
吞吐账(jobs/s,6s 片):2 卡 — 两条完整管线 2×(1/50.7)=0.0394 vs 分卡 1×(1/46.1)=0.0217 → 完整管线胜 82%;8 卡 — 8 条完整管线 8×(1/50.7)=0.158 vs 1 Qwen+7 DiT 7×(1/46.1)=0.152 → 完整管线仍胜 4%。任何规模下都不值得分卡,除非未来出现"Qwen 编码耗时占比大幅上升"或"DiT 卡需要腾出权重显存"的新场景。

分辨率外推实验(2026-08-11:768p 训练画布之外能跑多大?)

背景:H3 官方管线 = base 模型 768p 生成 → 同一模型 in-context 重生成到 2K(1440p短边);官方无 4K。开源 FL2VA 权重的训练画布 = 768×1344。实测(int8 + lx2v 4step LoRA · 4步 · 90帧=3.75s · GPU7 单卡):

分辨率总耗时采样VAE解码峰值VRAM画质
2K(2560×1440,官方成片档)162s124s(每步~29s)~30s32.1GB(贴顶)✅ 惊艳——单段直出即可用,细节锐利结构连贯(推测因官方2K重生成阶段用同一DiT,2K token规模在分布内)
4K(3840×2144)584s506s(每步~120s)67s31.3GB❌ 完全崩坏——整帧灰褐噪声+重复网格(8×出分布,位置外推崩溃)。能跑,不能看
2K 直出样片(2560×1440×90f)
⏱ 162s · int8+lx2v4step · 俯拍海岸城市
4K 崩坏样片(3840×2144×90f,仅存档)
⏱ 584s · 同配置 · 位置外推崩溃实例

注:2K 下 90 帧已到 32GB 显存顶,更长需降分辨率;推荐日常仍用 1344×768(速度/时长最优),2K 用于短片高清直出。