Download Experiment.md from Cccccz/comparison: direct link, hf CLI and curl.
- Browser
- Download file 70.8 kB
-
https://huggingface.co/Cccccz/comparison/resolve/main/Experiment.md
- Command line
-
hf download hf://Cccccz/comparison/Experiment.md
-
curl -L -o Experiment.md https://huggingface.co/Cccccz/comparison/resolve/main/Experiment.md
Experiment: training-free caching on 4-step block-causal video DiTs
四个 training-free 缓存方法(TeaCache / FlowCache / TaylorSeer / MotionCache)移植到两个 4-step 自回归视频 DiT(Self-Forcing、Causal-Forcing,均为 Wan2.1-1.3B block-causal)上,在匹配的 compute 预算下比较速度与质量。
列定义
- 策略:方法 + 调度 + 目标加速比。调度字符串按 chunk 内 4 个去噪步写,
F= 必算完整 DiT,x= 允许方法从缓存服务。FxxF是原始设定(等价于上游ret_steps=1/cutoff_steps=num_steps-1),FFxx让 TaylorSeer 在第一次预测前有两个已算点,Fxxx去掉最后一步必算的限制,算术上限从 2.0× 提到 4.0×。 - **VBench-251 (%)**:Extended-251 协议的 VBench-8 selected 分(4×quality + semantic)/5,251 条 prompt(subject_consistency 72 / overall_consistency 93 / scene 86)。
- Full:一条视频(7 chunk × 4 步 = 28 次去噪 DiT forward)中实际执行的完整 DiT forward 等效数,251 条 prompt 的平均;MotionCache / FlowCache 这类部分重算的步按 compute-equivalent 折算。所有方法按这一列匹配 compute。
- 平均 P:一条视频中被缓存复用的 forward 数 = 28 − Full。
naiveNstep基线走的是更短的去噪调度,缺的 forward 是根本没有发起而不是被复用,所以这一列对它们记为 —(它们的 Full 仍按 28 步的标尺给出,便于等算力对照)。Predictor 策略(cfa_*,Causal-Forcing-a)按记录里的full_forwards/predictor_forwards计:Full 为完整 DiT 次数,P 为 predictor 调用次数(每次约 0.03 个 forward,不计入 Full)。 - **模型路径耗时 (ms)**:251 条 prompt 上 denoise policy 路径的 GPU 平均耗时,含缓存方法自己的控制开销;不含 context/KV-cache 刷新 DiT(另计,~790 ms/视频)、文本编码、VAE 解码。
- 加速比:matched FFFF 平均耗时 / 该策略平均耗时(同 prompt、同 seed、同一次运行内配对)。原始 26 个策略与 FFFF 同批生成;后加的策略由
eval/retime_eval.py与 FFFF 在同一进程内逐 prompt 配对重新计时(只跑 denoise 路径),其"模型路径耗时"来自这次配对计时,绝对 ms 与首批不在同一争用条件下,只有加速比可跨行比较。首 chunk FFFF 变体(_c0FFFF,teacache_x2_c0FFFF除外)的耗时来自 Sep 7 在空闲 GPU 上只重跑策略 denoise 路径的单次重计时(FFFF 不重跑,以各基模 FFFF 首批记录为分母;逐条核对算量一致,视频与质量指标不变)。 - PSNR / SSIM / LPIPS:相对同 prompt、同 seed 的 FFFF,在解码后的 81 帧 RGB 上计算,编码 MP4 之前。FFFF 对自身固定为 120 dB / 1.0 / 0.0。Sep 7 起新增的策略不再重新生成 FFFF,参考帧读自 FFFF 那次运行写出的 MP4(H.264),表中以 § 标出;在同一批视频上实测该替换使 PSNR +0.10 dB、SSIM −0.024、LPIPS +0.012(MP4 抹掉了参考的高频细节),与其它行比较时按此修正。
- 策略 id 与
eval_out/目录一致(去掉sf_/cf_/cfa_前缀):不带调度后缀的是原始FxxF研究,_FFxx_/_Fxxx_为放宽调度后的操作点,_x<N>是搜索时的目标加速比,实际 compute 看 Full 列;cfa_*为 Causal-Forcing-a 上的 Predictor 策略(DisCa / ATC-chunk / ATC-last-frame,均为 Stage-1 监督蒸馏;atc_chunk_s2_*为 ATC-chunk 再经 Stage-2 随机出口 DMD(Wan-14B real score、LoRA rank-128 fake score,2000 步)后的 EMA 权重),后缀fppf/fppp是 chunk 内的调度模式(P = predictor 步)。
视频规格:81 帧、480×832、16 FPS、seed 0、bf16、每 prompt 一个样本。
1. Extended-251 评测结果(已完成)
Self-Forcing
| 策略 | VBench-251 (%) | 平均 P | Full | 模型路径耗时 (ms) | 加速比 | PSNR | SSIM | LPIPS |
|---|---|---|---|---|---|---|---|---|
| 原始调度(chunk 0 与其它 chunk 相同) | ||||||||
ffff |
80.5372 | 0.000 | 28.000 | 3157.96 | 1.000× | 120.000 | 1.0000 | 0.0000 |
euler_FFFF |
78.7741 | 0.000 | 28.000 | 3171.53 | 0.996× | 9.996 § | 0.3108 § | 0.6051 § |
| ≈1.3× | ||||||||
teacache_x1.3 |
79.5878 | 5.633 | 22.367 | 2547.49 | 1.240× | 15.161 | 0.5325 | 0.3198 |
flowcache_x1.3 |
79.6210 | 6.076 | 21.924 | 2547.75 | 1.240× | 15.151 | 0.5325 | 0.3202 |
taylorseer_x1.3 |
79.8313 | 7.000 | 21.000 | 2439.16 | 1.295× | 13.315 | 0.4421 | 0.4469 |
taylorseer_FFxx_x1.3 |
79.2201 | 6.000 | 22.000 | 2588.89 | 1.226× | 13.128 | 0.4449 | 0.4290 |
motioncache_x1.3 |
79.2294 | 6.537 | 21.463 | 2762.30 | 1.143× | 13.264 | 0.4499 | 0.4431 |
reuse_FRFF |
79.2460 | 7.000 | 21.000 | 2382.76 † | 1.325× † | 13.186 § | 0.4401 § | 0.4497 § |
| ≈1.6× | ||||||||
teacache_x1.6 |
78.9947 | 8.757 | 19.243 | 2187.41 | 1.444× | 13.116 | 0.4428 | 0.4520 |
flowcache_x1.6 |
78.4997 | 9.255 | 18.745 | 2215.58 | 1.425× | 12.991 | 0.4339 | 0.4659 |
taylorseer_x1.6 |
79.0823 | 11.000 | 17.000 | 2008.93 | 1.572× | 13.398 | 0.4082 | 0.5029 |
taylorseer_FFxx_x1.6 |
66.3821 | 10.000 | 18.000 | 2102.06 | 1.509× | 11.321 | 0.3028 | 0.6140 |
motioncache_x1.6 |
79.4907 | 10.597 | 17.403 | 2126.98 | 1.485× | 13.127 | 0.4332 | 0.4722 |
| ≈1.75× | ||||||||
teacache_x1.75 |
79.2788 | 7.725 | 20.275 | 3142.11 | 1.381× | 13.142 | 0.4471 | 0.4460 |
taylorseer_x1.75 |
78.6295 | 13.000 | 15.000 | 2379.43 | 1.823× | 13.479 | 0.4007 | 0.5163 |
motioncache_x1.75 |
79.0342 | 12.222 | 15.778 | 2713.77 | 1.599× | 13.046 | 0.4265 | 0.4823 |
| ≈2× | ||||||||
teacache_x2 |
78.7743 | 14.000 | 14.000 | 1608.20 | 1.964× | 13.020 | 0.4222 | 0.4854 |
flowcache_x2 |
78.7743 | 14.000 | 14.000 | 1613.54 | 1.957× | 13.020 | 0.4222 | 0.4854 |
taylorseer_x2 |
78.2747 | 14.000 | 14.000 | 1667.04 | 1.894× | 13.486 | 0.3974 | 0.5240 |
taylorseer_FFxx_x2 |
57.1775 | 14.000 | 14.000 | 1687.69 | 1.880× | 9.626 | 0.1555 | 0.8272 |
motioncache_x2 |
78.7809 | 14.000 | 14.000 | 1621.06 | 1.948× | 13.020 | 0.4222 | 0.4854 |
reuse_FRRF |
78.7743 | 14.000 | 14.000 | 1604.42 † | 1.968× † | 13.102 § | 0.4150 § | 0.4865 § |
| ≈2.85–3× | ||||||||
teacache_Fxxx_x2.85 |
60.1481 | 14.000 | 14.000 | 2207.42 | 1.965× | 11.844 | 0.3029 | 0.6665 |
teacache_Fxxx_x3 |
58.6783 | 20.155 | 7.845 | 913.40 | 3.473× | 11.946 | 0.2851 | 0.7049 |
flowcache_Fxxx_x3 |
55.7999 | 19.851 | 8.149 | 987.12 | 3.214× | 12.013 | 0.2866 | 0.6946 |
taylorseer_Fxxx_x2.85 |
60.3007 | 19.000 | 9.000 | 1468.31 | 2.954× | 11.750 | 0.2608 | 0.7051 |
motioncache_Fxxx_x2.85 |
58.6018 | 20.344 | 7.656 | 1707.75 | 2.540× | 11.928 | 0.2649 | 0.7232 |
motioncache_Fxxx_x3 |
59.2793 | 18.785 | 9.215 | 1625.07 | 1.952× | 12.240 | 0.2860 | 0.6889 |
| ≈3.3–4× | ||||||||
reuse_FRRR |
58.1223 | 21.000 | 7.000 | 823.91 † | 3.833× † | 11.699 § | 0.2565 § | 0.7347 § |
首 chunk FFFF(_c0FFFF) |
||||||||
| ≈1.3× | ||||||||
teacache_x1.3_c0FFFF |
80.3851 | 3.785 | 24.215 | 2721.09 | 1.161× | 20.370 | 0.8421 | 0.0866 |
taylorseer_x1.3_c0FFFF |
80.4439 | 6.000 | 22.000 | 2517.09 | 1.255× | 17.312 | 0.6934 | 0.1524 |
motioncache_x1.3_c0FFFF |
79.9742 | 5.490 | 22.510 | 2790.03 | 1.132× | 17.332 | 0.6934 | 0.1520 |
| ≈1.6× | ||||||||
teacache_x1.6_c0FFFF |
80.0586 | 7.179 | 20.821 | 2334.11 | 1.353× | 17.180 § | 0.6581 § | 0.1808 § |
| ≈1.75× | ||||||||
taylorseer_x1.75_c0FFFF |
79.4426 | 11.000 | 17.000 | 1930.29 | 1.636× | 16.752 | 0.6201 | 0.2132 |
motioncache_x1.75_c0FFFF |
80.3427 | 10.328 | 17.672 | 2180.22 | 1.448× | 16.749 | 0.6578 | 0.1794 |
| ≈2× | ||||||||
teacache_x2_c0FFFF |
79.7515 | 12.000 | 16.000 | 1766.63 | 1.788× | 16.611 | 0.6511 | 0.1883 |
| ≈2.85–3× | ||||||||
teacache_Fxxx_x3_c0FFFF |
61.3078 | 17.713 | 10.287 | 1092.03 | 2.892× | 13.994 | 0.4180 | 0.5821 |
taylorseer_Fxxx_x2.85_c0FFFF |
65.5397 | 16.000 | 12.000 | 1330.42 | 2.374× | 14.321 | 0.4627 | 0.4903 |
motioncache_Fxxx_x2.85_c0FFFF |
62.0397 | 17.174 | 10.826 | 1650.77 | 1.913× | 14.279 | 0.4229 | 0.5744 |
Causal-Forcing
| 策略 | VBench-251 (%) | 平均 P | Full | 模型路径耗时 (ms) | 加速比 | PSNR | SSIM | LPIPS |
|---|---|---|---|---|---|---|---|---|
| 原始调度(chunk 0 与其它 chunk 相同) | ||||||||
ffff |
81.1659 | 0.000 | 28.000 | 3156.09 | 1.000× | 120.000 | 1.0000 | 0.0000 |
| ≈1.3× | ||||||||
teacache_x1.3 |
81.2244 | 6.088 | 21.912 | 2488.55 | 1.268× | 13.229 | 0.5272 | 0.3419 |
flowcache_x1.3 |
81.8224 | 5.145 | 22.855 | 2683.28 | 1.176× | 13.260 | 0.5272 | 0.3415 |
taylorseer_x1.3 |
81.6245 | 7.000 | 21.000 | 2437.75 | 1.295× | 11.994 | 0.4488 | 0.4509 |
taylorseer_FFxx_x1.3 |
80.2569 | 6.000 | 22.000 | 2569.62 | 1.223× | 11.395 | 0.4381 | 0.4580 |
motioncache_x1.3 |
81.2477 | 6.424 | 21.576 | 2716.36 | 1.162× | 12.068 | 0.4614 | 0.4450 |
naive3step |
81.4017 | — | 21.000 | 2377.69 † | 1.327× † | 11.873 | 0.4393 | 0.4448 |
reuse_FRFF |
81.3133 | 7.000 | 21.000 | 2387.76 † | 1.322× † | 11.845 | 0.4615 | 0.4467 |
| ≈1.6× | ||||||||
teacache_x1.6 |
81.2088 | 9.781 | 18.219 | 2058.41 | 1.533× | 11.932 | 0.4590 | 0.4511 |
flowcache_x1.6 |
80.4213 | 10.631 | 17.369 | 2086.39 | 1.513× | 11.738 | 0.4424 | 0.4744 |
taylorseer_x1.6 |
80.4207 | 11.000 | 17.000 | 2008.23 | 1.572× | 12.175 | 0.4082 | 0.5063 |
taylorseer_FFxx_x1.6 |
65.8948 | 10.000 | 18.000 | 2092.15 | 1.502× | 9.924 | 0.3015 | 0.6262 |
motioncache_x1.6 |
80.8268 | 10.521 | 17.479 | 2243.38 | 1.407× | 11.911 | 0.4404 | 0.4737 |
| ≈1.75× | ||||||||
teacache_x1.75 |
81.2378 | 9.127 | 18.873 | 2386.91 | 1.481× | 11.899 | 0.4596 | 0.4493 |
taylorseer_x1.75 |
79.9462 | 13.000 | 15.000 | 1977.36 | 1.788× | 12.178 | 0.4020 | 0.5182 |
motioncache_x1.75 |
80.6695 | 13.388 | 14.612 | 2270.46 | 1.557× | 11.936 | 0.4400 | 0.4824 |
| ≈2× | ||||||||
teacache_x2 |
79.9681 | 14.000 | 14.000 | 1607.05 | 1.964× | 11.900 | 0.4402 | 0.4835 |
flowcache_x2 |
79.9681 | 14.000 | 14.000 | 1612.28 | 1.958× | 11.900 | 0.4402 | 0.4835 |
taylorseer_x2 |
79.7412 | 14.000 | 14.000 | 1666.32 | 1.894× | 12.160 | 0.3995 | 0.5260 |
taylorseer_FFxx_x2 |
57.3124 | 14.000 | 14.000 | 1673.11 | 1.879× | 8.788 | 0.1646 | 0.8242 |
motioncache_x2 |
79.9909 | 14.000 | 14.000 | 1618.55 | 1.950× | 11.901 | 0.4402 | 0.4835 |
naive2step |
80.5679 | — | 14.000 | 1589.72 † | 1.985× † | 11.745 | 0.4131 | 0.4883 |
reuse_FRRF |
80.0407 | 14.000 | 14.000 | 1607.58 † | 1.963× † | 11.900 | 0.4402 | 0.4835 |
| ≈2.85–3× | ||||||||
teacache_Fxxx_x3 |
65.0186 | 18.378 | 9.622 | 1087.44 | 2.891× | 11.352 | 0.3356 | 0.6346 |
flowcache_Fxxx_x3 |
65.1726 | 18.073 | 9.927 | 1161.04 | 2.707× | 11.338 | 0.3387 | 0.6278 |
taylorseer_Fxxx_x2.85 |
60.9596 | 19.000 | 9.000 | 1217.30 | 2.904× | 10.339 | 0.2573 | 0.7044 |
motioncache_Fxxx_x2.85 |
59.5795 | 19.957 | 8.043 | 1706.05 | 2.072× | 10.619 | 0.2432 | 0.7114 |
motioncache_Fxxx_x3 |
60.9864 | 18.657 | 9.343 | 1698.44 | 1.849× | 10.941 | 0.2716 | 0.6802 |
| ≈3.3–4× | ||||||||
naive1step |
75.5181 | — | 7.000 | 797.85 † | 3.956× † | 11.470 | 0.4009 | 0.5506 |
reuse_FRRR |
58.8612 | 21.000 | 7.000 | 825.80 † | 3.822× † | 10.148 | 0.2478 | 0.7408 |
首 chunk FFFF(_c0FFFF) |
||||||||
| ≈1.3× | ||||||||
teacache_x1.3_c0FFFF |
81.0382 | 4.697 | 23.303 | 2611.40 | 1.209× | 16.495 | 0.7670 | 0.1410 |
taylorseer_x1.3_c0FFFF |
81.3120 | 6.000 | 22.000 | 2522.30 | 1.251× | 14.728 | 0.6736 | 0.1983 |
motioncache_x1.3_c0FFFF |
81.3863 | 5.410 | 22.590 | 2754.74 | 1.146× | 14.950 | 0.6803 | 0.1935 |
naive3step_c0FFFF |
81.3914 | — | 22.000 | 2457.13 † | 1.284× † | 14.407 § | 0.6324 § | 0.2236 § |
reuse_FRFF_c0FFFF |
81.3370 | 6.000 | 22.000 | 2467.84 † | 1.279× † | 14.775 § | 0.6624 § | 0.2046 § |
| ≈1.75× | ||||||||
taylorseer_x1.75_c0FFFF |
80.7431 | 11.000 | 17.000 | 1935.50 | 1.631× | 14.443 | 0.5972 | 0.2719 |
motioncache_x1.75_c0FFFF |
81.1129 | 11.295 | 16.705 | 2173.89 | 1.452× | 14.454 | 0.6430 | 0.2301 |
naive2step_c0FFFF |
81.7050 | — | 16.000 | 1746.77 † | 1.807× † | 14.259 § | 0.6122 § | 0.2437 § |
reuse_FRRF_c0FFFF |
81.1816 | 12.000 | 16.000 | 1766.47 † | 1.787× † | 14.502 § | 0.6254 § | 0.2413 § |
| ≈2× | ||||||||
teacache_x2_c0FFFF |
81.1816 | 12.000 | 16.000 | 1764.22 | 1.789× | 14.431 § | 0.6423 § | 0.2327 § |
| ≈2.85–3× | ||||||||
teacache_Fxxx_x3_c0FFFF |
65.6584 | 16.558 | 11.442 | 1225.90 | 2.574× | 12.895 | 0.4612 | 0.5070 |
taylorseer_Fxxx_x2.85_c0FFFF |
65.4647 | 16.000 | 12.000 | 1334.99 | 2.364× | 12.802 | 0.4509 | 0.5047 |
motioncache_Fxxx_x2.85_c0FFFF |
64.0830 | 16.900 | 11.100 | 1792.95 | 1.760× | 12.959 | 0.4250 | 0.5596 |
naive1step_c0FFFF |
79.1501 | — | 10.000 | 1035.46 † | 3.048× † | 14.104 § | 0.5977 § | 0.2779 § |
reuse_FRRR_c0FFFF |
59.5377 | 18.000 | 10.000 | 1061.93 † | 2.972× † | 12.433 § | 0.3890 § | 0.6052 § |
Causal-Forcing-a(Predictor)
| 策略 | VBench-251 (%) | 平均 P | Full | 模型路径耗时 (ms) | 加速比 | PSNR | SSIM | LPIPS |
|---|---|---|---|---|---|---|---|---|
| 7 chunk(81 帧) | ||||||||
ffff |
81.1659 | 0.000 | 28.000 | 3225.29 | 1.000× | 120.000 | 1.0000 | 0.0000 |
| ≈1.3× | ||||||||
atc_chunk_s2_fpff |
80.9902 | 6.000 | 22.000 | 2519.19 † | 1.280× † | 14.667 | 0.6761 | 0.1970 |
| ≈1.75× | ||||||||
atc_chunk_fppf |
81.5505 | 12.000 | 16.000 | 1900.49 | 1.697× | 14.635 | 0.6532 | 0.2215 |
atc_chunk_s2_fppf |
81.2486 | 12.000 | 16.000 | 1871.26 † | 1.724× † | 14.452 | 0.6460 | 0.2260 |
atc_last_frame_fppf |
81.2733 | 12.000 | 16.000 | 1897.37 | 1.700× | 14.622 | 0.6531 | 0.2217 |
disca_fppf |
81.4375 | 12.000 | 16.000 | 1857.48 | 1.736× | 14.551 | 0.6516 | 0.2213 |
disca_s1000_fppf |
81.2360 | 12.000 | 16.000 | 1824.35 ‡ | 1.768× ‡ | 14.830 § | 0.6229 § | 0.2380 § |
atc_chunk_fpf |
81.2960 | 6.000 | 16.000 | 1819.13 | 1.773× | 14.523 § | 0.6117 § | 0.2419 § |
| ≈2.85–3× | ||||||||
atc_chunk_fppp |
77.3396 | 18.000 | 10.000 | 1238.59 | 2.604× | 14.328 | 0.6088 | 0.3012 |
atc_chunk_s2_fppp |
78.6374 | 18.000 | 10.000 | 1221.75 † | 2.640× † | 14.135 | 0.5971 | 0.2976 |
atc_last_frame_fppp |
77.3843 | 18.000 | 10.000 | 1234.61 | 2.612× | 14.298 | 0.6096 | 0.3005 |
disca_fppp |
75.9581 | 18.000 | 10.000 | 1157.33 | 2.787× | 14.073 | 0.5782 | 0.3242 |
disca_s1000_fppp |
72.2150 | 18.000 | 10.000 | 1153.31 ‡ | 2.797× ‡ | 13.858 § | 0.5182 § | 0.4040 § |
| 14 chunk(165 帧) | ||||||||
14c_ffff |
81.0061 | 0.000 | 56.000 | 7410.82 | 1.000× | 120.000 | 1.0000 | 0.0000 |
| ≈1.75× | ||||||||
atc_chunk_14c_fppf |
80.5734 | 26.000 | 30.000 | 4196.75 | 1.766× | 12.824 | 0.5568 | 0.3382 |
atc_chunk_s2_14c_fppf |
80.9730 | 26.000 | 30.000 | 4196.14 | 1.766× | 12.715 | 0.5512 | 0.3452 |
atc_chunk_s2_s500_14c_fppf |
81.0817 | 26.000 | 30.000 | 4167.73 | 1.778× | 12.817 § | 0.5299 § | 0.3522 § |
atc_chunk_s2_s1000_14c_fppf |
81.1134 | 26.000 | 30.000 | 4167.71 | 1.778× | 12.748 § | 0.5311 § | 0.3524 § |
disca_14c_fppf |
80.5953 | 26.000 | 30.000 | 4075.89 | 1.818× | 12.806 § | 0.5328 § | 0.3462 § |
disca_s500_14c_fppf |
80.1191 | 26.000 | 30.000 | 4075.51 | 1.818× | 12.268 § | 0.5120 § | 0.3670 § |
disca_s1000_14c_fppf |
80.5057 | 26.000 | 30.000 | 4075.84 | 1.818× | 13.040 § | 0.5250 § | 0.3631 § |
naive2step_14c |
80.7865 | — | 30.000 | 3880.86 | 1.910× | 12.597 § | 0.5211 § | 0.3578 § |
| 28 chunk(333 帧) | ||||||||
28c_ffff |
77.9850 | 0.000 | 112.000 | 15832.56 | 1.000× | 120.000 | 1.0000 | 0.0000 |
| ≈1.75× | ||||||||
atc_chunk_28c_fppf |
77.4779 | 54.000 | 58.000 | 8831.55 | 1.793× | 11.004 | 0.4520 | 0.4727 |
atc_chunk_s2_28c_fppf |
78.6544 | 54.000 | 58.000 | 8830.84 | 1.793× | 11.077 | 0.4412 | 0.4814 |
atc_chunk_s2_s500_28c_fppf |
78.5516 | 54.000 | 58.000 | 8790.80 | 1.801× | 11.109 § | 0.4214 § | 0.4906 § |
atc_chunk_s2_s1000_28c_fppf |
78.8416 | 54.000 | 58.000 | 8790.42 | 1.801× | 11.092 § | 0.4255 § | 0.4850 § |
disca_28c_fppf |
77.8652 | 54.000 | 58.000 | 8598.80 | 1.841× | 10.985 § | 0.4235 § | 0.4813 § |
disca_s500_28c_fppf |
75.4569 | 54.000 | 58.000 | 8599.47 | 1.841× | 10.342 § | 0.3920 § | 0.5037 § |
disca_s1000_28c_fppf |
77.3960 | 54.000 | 58.000 | 8599.13 | 1.841× | 11.171 § | 0.4119 § | 0.5065 § |
| ≈2× | ||||||||
naive2step_28c |
78.7351 | — | 58.000 | 8139.14 | 1.945× | 11.024 § | 0.4163 § | 0.4844 § |
HY-WorldPlay(I2V,VBench-I2V-100)
第三个基模:HY-WorldPlay 的 4-step 蒸馏自回归 I2V 模型(HunyuanVideo-1.5 架构,54 个 double-stream block,480×832,125 帧 = 8 chunk × 4 步 = 32 次去噪 forward)。评测集为 DEV 项目的 validation25:25 张 VBench-I2V 图 × 4 组双向相机动作 = 100 个视频,seed 0。两列 VBench 都基于 custom_input 模式下的同一组 Core5 五个画质维度(subject_consistency、background_consistency、motion_smoothness、aesthetic_quality、imaging_quality,后者先除以 100):原始列是五项原始分的简单平均,口径与 HY-WorldPlay-DEV-Predictor 项目 experiment.md 第 8 节的 VBench Core5 一致,便于直接对照;归一列先按 VBench 官方 min-max 归一再平均,即 ((sc−0.1462)/0.8538 + (bc−0.2615)/0.7385 + (ms−0.7060)/0.2915 + aq + iq) / 5,与 251 表的质量组口径一致。平均 P = 32 − Full。耗时列为去噪路径(32 次 forward)的 GPU 时间,不含每 chunk 一次的 context KV pass 和文本 KV pass;加速比与同进程内同一 job 的 FFFF 配对。
| 策略 | VBench-I2V-100 原始 (%) | VBench-I2V-100 归一 (%) | 平均 P | Full | 模型路径耗时 (ms) | 加速比 | PSNR | SSIM | LPIPS |
|---|---|---|---|---|---|---|---|---|---|
| 原始调度(chunk 0 与其它 chunk 相同) | |||||||||
ffff |
84.2562 | 83.3246 | 0.000 | 32.000 | 26412.97 | 1.000× | 120.000 | 1.0000 | 0.0000 |
| ≈1.3× | |||||||||
teacache_x1.3 |
84.3669 | 83.4689 | 8.000 | 24.000 | 19930.69 | 1.325× | 20.117 | 0.7697 | 0.1102 |
taylorseer_x1.3 |
84.2522 | 83.3337 | 7.000 | 25.000 | 22387.68 | 1.180× | 18.140 | 0.6780 | 0.1582 |
motioncache_x1.3 |
84.2313 | 83.3155 | 8.000 | 24.000 | 23101.18 | 1.143× | 17.845 | 0.6725 | 0.1642 |
naive3step |
84.2911 | 83.3647 | — | 24.000 | 20351.22 | 1.330× | 19.353 | 0.7400 | 0.1261 |
reuse_FRFF |
84.2897 | 83.3844 | 8.000 | 24.000 | 20673.89 | 1.309× | 18.187 | 0.6792 | 0.1575 |
| ≈1.75× | |||||||||
teacache_x1.75 |
84.2693 | 83.3820 | 11.320 | 20.680 | 17177.16 | 1.538× | 17.638 | 0.6630 | 0.1781 |
taylorseer_x1.75 |
84.2668 | 83.3677 | 15.000 | 17.000 | 15685.12 | 1.684× | 16.903 | 0.6269 | 0.2090 |
motioncache_x1.75 |
84.2535 | 83.3566 | 14.382 | 17.618 | 17322.76 | 1.525× | 17.001 | 0.6305 | 0.2058 |
| ≈2× | |||||||||
naive2step |
84.2625 | 83.3436 | — | 16.000 | 13670.78 | 1.979× | 18.023 | 0.6641 | 0.1771 |
reuse_FRRF |
84.2277 | 83.3291 | 16.000 | 16.000 | 13895.92 | 1.947× | 17.001 | 0.6288 | 0.2081 |
| ≈2.85–3× | |||||||||
teacache_Fxxx_x2.85 |
82.8598 | 81.7531 | 19.380 | 12.620 | 10516.41 | 2.512× | 16.115 | 0.5980 | 0.2634 |
taylorseer_Fxxx_x2.85 |
82.4336 | 81.1889 | 21.000 | 11.000 | 10475.24 | 2.522× | 15.394 | 0.5608 | 0.3208 |
motioncache_Fxxx_x2.85 |
81.3278 | 79.9229 | 22.295 | 9.705 | 10594.27 | 2.494× | 15.160 | 0.5474 | 0.3761 |
| ≈3.3–4× | |||||||||
naive1step |
83.1146 | 82.0591 | — | 8.000 | 6940.58 | 3.899× | 16.096 | 0.5808 | 0.2998 |
reuse_FRRR |
81.2746 | 79.8838 | 24.000 | 8.000 | 7182.47 | 3.767× | 15.043 | 0.5461 | 0.3698 |
首 chunk FFFF(_c0FFFF;Predictor 行 chunk 0 固定全算) |
|||||||||
| ≈1.3× | |||||||||
naive3step_c0FFFF |
84.2618 | 83.3402 | — | 25.000 | 20247.11 | 1.305× | 21.728 § | 0.7794 § | 0.1072 § |
reuse_FRFF_c0FFFF |
84.2477 | 83.3293 | 7.000 | 25.000 | 20320.55 | 1.300× | 19.967 § | 0.7262 § | 0.1315 § |
| ≈1.75× | |||||||||
teacache_x1.75_c0FFFF |
84.2781 | 83.3869 | 14.000 | 18.000 | 14225.79 | 1.857× | 18.616 § | 0.6855 § | 0.1668 § |
taylorseer_x1.75_c0FFFF |
84.2736 | 83.3736 | 14.000 | 18.000 | 15502.48 | 1.704× | 18.598 § | 0.6845 § | 0.1670 § |
motioncache_x1.75_c0FFFF |
84.2630 | 83.3633 | 13.930 | 18.070 | 16165.60 | 1.634× | 18.587 § | 0.6843 § | 0.1672 § |
disca_s1_fppf |
84.1670 | 83.2478 | 14.000 | 18.000 | 14662.50 ¶ | 1.801× ¶ | 19.668 | 0.7233 | 0.1346 |
disca_s500_fppf |
待打分 | 待打分 | 14.000 | 18.000 | 14841.37 ¶ | 1.780× ¶ | 19.350 | 0.7120 | 0.1410 |
disca_s1000_fppf |
84.1546 | 83.2336 | 14.000 | 18.000 | 14720.59 ¶ | 1.794× ¶ | 19.660 | 0.7216 | 0.1350 |
atc_s1_fppf |
84.1847 | 83.2703 | 14.000 | 18.000 | 15812.57 ¶ | 1.670× ¶ | 20.056 | 0.7439 | 0.1257 |
atc_s2_s500_fppf_c0FFFF |
84.2119 | 83.3056 | 14.000 | 18.000 | 20950.51 ¶ | 1.261× ¶ | 20.183 | 0.7480 | 0.1205 |
atc_s2_s800_fppf_c0FFFF |
84.2323 | 83.3288 | 14.000 | 18.000 | 15629.35 ¶ | 1.690× ¶ | 20.457 | 0.7570 | 0.1163 |
atc_s2_s1000_fppf_c0FFFF |
84.2230 | 83.3159 | 14.000 | 18.000 | 15566.46 ¶ | 1.697× ¶ | 20.265 | 0.7537 | 0.1176 |
atc_s2_s1500_fppf_c0FFFF |
84.2264 | 83.3206 | 14.000 | 18.000 | 15546.63 ¶ | 1.699× ¶ | 20.581 | 0.7628 | 0.1137 |
atc_s2_s2000_fppf_c0FFFF |
84.2402 | 83.3379 | 14.000 | 18.000 | 18191.28 ¶ | 1.452× ¶ | 20.519 | 0.7611 | 0.1144 |
naive2step_c0FFFF |
84.2625 | 83.3447 | — | 18.000 | 14095.82 | 1.874× | 19.723 § | 0.7122 § | 0.1480 § |
reuse_FRRF_c0FFFF |
84.2781 | 83.3869 | 14.000 | 18.000 | 14188.73 | 1.862× | 18.616 § | 0.6855 § | 0.1668 § |
| ≈2.85–3× | |||||||||
teacache_Fxxx_x2.85_c0FFFF |
82.6370 | 81.4356 | 18.320 | 13.680 | 10420.56 | 2.535× | 17.402 § | 0.6493 § | 0.2323 § |
taylorseer_Fxxx_x2.85_c0FFFF |
81.6863 | 80.2616 | 21.000 | 11.000 | 9202.77 | 2.870× | 16.731 § | 0.6155 § | 0.2800 § |
motioncache_Fxxx_x2.85_c0FFFF |
81.4090 | 79.9492 | 20.875 | 11.125 | 10491.83 | 2.517× | 16.788 § | 0.6167 § | 0.2840 § |
disca_s1_fppp |
81.9808 | 80.7777 | 21.000 | 11.000 | 8802.08 ¶ | 3.001× ¶ | 18.980 | 0.6791 | 0.2445 |
disca_s1000_fppp |
82.0229 | 80.8101 | 21.000 | 11.000 | 8728.97 ¶ | 3.026× ¶ | 18.891 | 0.6772 | 0.2430 |
atc_s1_fppp |
81.9767 | 80.7813 | 21.000 | 11.000 | 10200.68 ¶ | 2.589× ¶ | 19.270 | 0.6931 | 0.2328 |
atc_s2_s500_fppp_c0FFFF |
82.8711 | 81.7725 | 21.000 | 11.000 | 12327.93 ¶ | 2.143× ¶ | 19.203 | 0.6956 | 0.2063 |
atc_s2_s800_fppp_c0FFFF |
82.7394 | 81.6377 | 21.000 | 11.000 | 9916.60 ¶ | 2.664× ¶ | 19.352 | 0.6991 | 0.2087 |
atc_s2_s1000_fppp_c0FFFF |
82.7097 | 81.5668 | 21.000 | 11.000 | 10035.86 ¶ | 2.632× ¶ | 19.248 | 0.6952 | 0.2097 |
atc_s2_s1500_fppp_c0FFFF |
82.7710 | 81.6625 | 21.000 | 11.000 | 9942.50 ¶ | 2.657× ¶ | 19.317 | 0.6989 | 0.2069 |
atc_s2_s2000_fppp_c0FFFF |
82.7682 | 81.6582 | 21.000 | 11.000 | 11259.37 ¶ | 2.346× ¶ | 19.336 | 0.6989 | 0.2077 |
naive1step_c0FFFF |
83.6264 | 82.6327 | — | 11.000 | 7928.52 | 3.331× | 17.717 § | 0.6393 § | 0.2345 § |
reuse_FRRR_c0FFFF |
81.5309 | 80.0960 | 21.000 | 11.000 | 8070.78 | 3.273× | 16.796 § | 0.6174 § | 0.2812 § |
LingBot-World-V2-1.3B-Causal-Fast(I2V,VBench-I2V-100)
第四个基模:LingBot-World-V2 的 1.3B causal-fast 蒸馏自回归 I2V 世界模型(Wan2.1-1.3B block-causal 架构,30 个 block,相机 Plucker 条件,480×832,16 fps,125 帧 = 8 chunk × 4 latent × 4 步 = 32 次去噪 forward,KV 窗口 18 latent、sink 6)。评测协议与 HY-WorldPlay 完全相同:validation25 的 25 张图 × 4 组双向相机动作 = 100 个视频,seed 0,Core5 五维、原始/归一两列同上;相机动作把 HY 的逐 latent 位姿(前进 0.08 单位/latent、旋转 3°/latent,前半程正向、后半程反向)换算成 LingBot 需要的逐帧 OpenCV c2w 位姿(4 帧/latent),内参取模型 480×832 示例数据的 fx = fy ≈ 415.6。这里的 reuse_* 复用的是 velocity 而不是 block 残差:R 步完全不调用 DiT,直接把上一次算出的 flow 预测当作本步预测(x0 = x_t − σ_t·v_prev),再照常 renoise;因此 R 步耗时≈0,FRFF/FRRF/FRRR 的 Full 精确为 24/16/8。三个缓存方法(TeaCache / TaylorSeer / MotionCache)按 cachelib 的同一套移植接在 30 个 block 的循环上(block 级重实现与官方 forward 逐位一致,lb_test_exact.py),操作点沿用 HY 的流程:TeaCache 的 rescale 多项式用 3 个 case × 125 帧标定(lb_coeff.json,一次多项式,R² 0.63);x1.3 由 compute fraction 二分得到(lb_sweep_*.json,61 帧);x1.75 / Fxxx_x2.85 及其 _c0FFFF 变体在 61 帧、配对 FFFF 的实测加速比网格上定点(lb_point_v2.json / lb_point_c0.json,选点规则与 HY 相同)。naive 减步按 Self-Forcing 的规则取 4 步网格的均匀子集(4 步网格 t = 999/937/833/624;3 步 = 999/833/624、2 步 = 999/624、1 步 = 999)。atc_chunk_* / disca_* 为 Layer-17 Predictor(lingbot-world-v2-a,Causal-Forcing-a 的同款移植:复制教师 block 17 + 融合模块,预测 head 输入的 final hidden;离线集 = 100 组 HY 训练图 × 4 动作 × 7 chunk × 3 相邻转移 = 8400 个样本,Stage-1 监督蒸馏 2000 步、全局 batch 64、fusion lr 1e-4 / block lr 1e-5,未做 Stage-2);chunk 0 固定 FFFF,FPPF / FPPP 中 P 步锚定同 chunk 上一步的 hidden,FPF 只走 t = 999 / 937 / 624 三步(P 锚定 t = 999);P 列为 Predictor 调用次数,Full 为完整 DiT 次数,Predictor 按 1/30 次 forward 计入算量。耗时列为去噪路径的 GPU 时间,不含每 chunk 一次的 context KV pass(t=0 的 KV 重写);加速比与同进程内同一 job 的 FFFF 配对。
| 策略 | VBench-I2V-100 原始 (%) | VBench-I2V-100 归一 (%) | 平均 P | Full | 模型路径耗时 (ms) | 加速比 | PSNR | SSIM | LPIPS |
|---|---|---|---|---|---|---|---|---|---|
| 原始调度(chunk 0 与其它 chunk 相同) | |||||||||
ffff |
82.3539 | 80.2586 | 0.000 | 32.000 | 6093.68 | 1.000× | 120.000 | 1.0000 | 0.0000 |
| ≈1.3× | |||||||||
teacache_x1.3 |
82.1485 | 80.1311 | 8.000 | 24.000 | 4645.01 | 1.313× | 15.926 | 0.5619 | 0.3094 |
taylorseer_x1.3 |
81.8251 | 79.8054 | 7.000 | 25.000 | 5023.59 | 1.214× | 16.037 | 0.5614 | 0.3130 |
motioncache_x1.3 |
81.2355 | 79.1397 | 7.286 | 24.714 | 5070.72 | 1.203× | 16.005 | 0.5622 | 0.3111 |
naive3step |
82.1337 | 80.0778 | — | 24.000 | 4581.98 | 1.331× | 15.369 | 0.4767 | 0.3358 |
reuse_FRFF |
82.0735 | 80.0272 | 8.000 | 24.000 | 4573.81 | 1.332× | 15.855 | 0.5632 | 0.3077 |
| ≈1.75× | |||||||||
teacache_x1.75 |
80.9831 | 78.8059 | 9.930 | 22.070 | 4330.60 | 1.408× | 15.655 | 0.5365 | 0.3393 |
taylorseer_x1.75 |
76.6210 | 73.8544 | 16.000 | 16.000 | 3405.13 | 1.791× | 15.126 | 0.4776 | 0.4592 |
motioncache_x1.75 |
79.4888 | 77.0818 | 13.937 | 18.063 | 3835.59 | 1.590× | 15.496 | 0.5152 | 0.3733 |
| ≈2× | |||||||||
naive2step |
80.5176 | 78.3186 | — | 16.000 | 3061.56 | 1.992× | 14.945 | 0.4544 | 0.3699 |
reuse_FRRF |
76.7683 | 73.5659 | 16.000 | 16.000 | 3059.20 | 1.992× | 14.869 | 0.4767 | 0.4288 |
| ≈2.85–3× | |||||||||
teacache_Fxxx_x2.85 |
75.1360 | 71.6186 | 17.590 | 14.410 | 2895.33 | 2.106× | 13.435 | 0.4067 | 0.5503 |
taylorseer_Fxxx_x2.85 |
70.8612 | 65.4422 | 21.000 | 11.000 | 2534.78 | 2.406× | 11.432 | 0.2408 | 0.7647 |
motioncache_Fxxx_x2.85 |
71.0194 | 64.6213 | 23.623 | 8.377 | 2357.22 | 2.587× | 11.080 | 0.2028 | 0.7918 |
| ≈3.3–4× | |||||||||
naive1step |
75.1651 | 72.2501 | — | 8.000 | 1542.10 | 3.955× | 14.197 | 0.4394 | 0.4368 |
reuse_FRRR |
71.5376 | 65.4500 | 24.000 | 8.000 | 1541.77 | 3.952× | 10.160 | 0.1762 | 0.8437 |
首 chunk FFFF(_c0FFFF;Predictor 行 chunk 0 固定全算) |
|||||||||
| ≈1.3× | |||||||||
naive3step_c0FFFF |
82.1607 | 80.1107 | — | 25.000 | 4720.24 | 1.292× | 16.469 | 0.5485 | 0.2759 |
reuse_FRFF_c0FFFF |
82.1895 | 80.1582 | 7.000 | 25.000 | 4720.73 | 1.292× | 17.293 | 0.6455 | 0.2377 |
| ≈1.75× | |||||||||
teacache_x1.75_c0FFFF |
78.9073 | 76.3152 | 14.000 | 18.000 | 3439.77 | 1.773× | 16.656 | 0.5814 | 0.3268 |
taylorseer_x1.75_c0FFFF |
77.4694 | 74.7649 | 13.000 | 19.000 | 3860.07 | 1.580× | 16.253 | 0.5518 | 0.3966 |
motioncache_x1.75_c0FFFF |
78.9094 | 76.3180 | 13.992 | 18.008 | 3733.35 | 1.634× | 16.659 | 0.5815 | 0.3267 |
atc_chunk_fppf |
80.0022 | 77.8061 | 14.000 | 18.000 | 3536.15 | 1.728× | 17.301 | 0.6297 | 0.2778 |
disca_fppf |
80.0298 | 77.8495 | 14.000 | 18.000 | 3481.70 | 1.755× | 17.275 | 0.6279 | 0.2766 |
atc_chunk_fpf |
80.2317 | 78.0594 | 7.000 | 18.000 | 3445.52 | 1.774× | 16.765 | 0.5490 | 0.2936 |
disca_fpf |
80.3026 | 78.1454 | 7.000 | 18.000 | 3413.59 | 1.790× | 16.731 | 0.5497 | 0.2933 |
naive2step_c0FFFF |
80.8730 | 78.7215 | — | 18.000 | 3342.15 | 1.825× | 16.162 | 0.5342 | 0.3007 |
reuse_FRRF_c0FFFF |
76.9432 | 73.7413 | 14.000 | 18.000 | 3340.95 | 1.825× | 15.996 | 0.5476 | 0.3793 |
| ≈2.85–3× | |||||||||
teacache_Fxxx_x2.85_c0FFFF |
76.7028 | 73.5163 | 14.650 | 17.350 | 3323.93 | 1.835× | 15.709 | 0.5422 | 0.3865 |
taylorseer_Fxxx_x2.85_c0FFFF |
62.0634 | 53.7016 | 21.000 | 11.000 | 2371.54 | 2.572× | 12.114 | 0.2968 | 0.7078 |
motioncache_Fxxx_x2.85_c0FFFF |
62.0254 | 53.9066 | 20.996 | 11.004 | 2265.94 | 2.691× | 12.192 | 0.3137 | 0.6975 |
atc_chunk_fppp |
73.6541 | 70.6632 | 21.000 | 11.000 | 2257.30 | 2.707× | 16.577 | 0.5786 | 0.3895 |
disca_fppp |
73.6381 | 70.4325 | 21.000 | 11.000 | 2166.88 | 2.820× | 16.518 | 0.5565 | 0.3864 |
naive1step_c0FFFF |
76.6593 | 73.9502 | — | 11.000 | 1960.37 | 3.111× | 15.430 | 0.5203 | 0.3572 |
reuse_FRRR_c0FFFF |
62.1155 | 53.9646 | 21.000 | 11.000 | 1961.77 | 3.109× | 11.297 | 0.2748 | 0.7399 |
† 耗时来自该策略自己的生成运行(独占 GPU、单进程),与各基模 FFFF 首批记录相比得到加速比,未做同进程配对计时;按约定不再做 FFFF 重计时。其中 atc_chunk_s2_fpff(153/251 条)、atc_chunk_s2_fppf(155/251 条)、atc_chunk_s2_fppp(156/251 条) 的耗时只来自生成时计时未被破坏的那部分 prompt:其余记录的原始计时被一次中断且遭遇 GPU 争用的配对重计时覆盖,已在记录中标记 latency_excluded 并从耗时均值剔除,VBench 与像素指标仍用全部 251 条。
‡ 该行有部分记录在生成时 GPU 被其他进程短暂共用(Sep 7 的 disca_s1000_*:GPU 4/7 上的 gpu_burn 占位,06:22–06:40,每策略约 84 条),这些记录事后在空闲 GPU 上只重跑策略路径重新计时(FFFF 不重跑,逐条核对算量一致,旧值保留在记录的 generation_run_latency);其余记录为独占 GPU 的生成运行值。所有记录均为单进程计时。
§ 像素指标以 FFFF 运行写出的 MP4 解码帧为参考(其余行以 MP4 编码前的原始帧为参考);同一批视频上实测差异:PSNR +0.10 dB、SSIM −0.024、LPIPS +0.012。cf_teacache_x2_c0FFFF 为混合(75/251 条用 MP4 参考)。
¶ hy_atc_s1_* / hy_disca_s1_* 来自 HY-WorldPlay-DEV-Predictor 的 validation25 评测(ATC Stage-1,predictor_v4_atc-full_transport-global-chunk_…_4gpu_bs8x2_steps2000,step 2000,FPPF/FPPP,chunk 0 四步全算——DEV 的 rollout 固定如此,Predictor 需要前一 chunk;FPPF = 18 full + 14 Predictor,FPPP = 11 + 21),耗时为该项目生成器的 host 端分段计时(ar_step_transformer + ar_step_predictor,即去噪路径,不含 context/history KV),与本表其它行的 CUDA event 计时口径接近但不完全相同;像素指标对照 DEV 项目 validation 的 FFFF 视频(与 hy_ffff 同源)。DisCa 为双 block Predictor(blocks [0,53],Sep 8 用 --force_first_chunk_full 重跑)。hy_atc_s2_s<N>_* 为同一 ATC Stage-1 再经 on-policy detached chunk+timestep FPPP rollout 微调(4 卡、每卡 1 条轨迹 × 累积 2、flr 5e-5 / blr 5e-6、2000 steps)后第 N 步的权重,Sep 10 评测(DEV experiment.md 第 12 节),生成设置与 hy_atc_s1_* 相同。Predictor 步按 1/54(DisCa 2/54)次 forward 计入 Full。
读数备注
- 2.0× 是
FxxF的算术上限(14/28),到了这一档 TeaCache / FlowCache / MotionCache 全部退化成"中间两步整体跳过、残差拷贝",走的是同一条代码路径,所以三者数字一致;TaylorSeer 在 2.0× 上不同(逐模块拷贝 + 当前步调制),且略差。 FxxF下 TaylorSeer 的一阶预测从未被触发:跳步前 chunk 内只算过 step 0,差分导数不存在,实际走的是 order-0(拷贝)。FFxx调度就是为了让预测真正生效。- 像素指标(PSNR 12–15 dB)与 VBench(掉 0–1.4 分)严重脱钩;在这个设定里 PSNR/SSIM 只能当"偏离 FFFF 的程度"读,不是质量代理。
- 第一个 chunk 不该被缓存。
teacache_x2_c0FFFF与teacache_x2用同一个阈值,唯一区别是 chunk 0 走满 FFFF 四步(算力 16/28 vs 14/28)。Self-Forcing 上 VBench 从 78.7743 升到 79.7515(**+0.98,把相对 FFFF 的 1.76 分差距砍掉 55%),像素保真度改善更大:PSNR 13.02→16.61(+3.59 dB)、SSIM 0.4222→0.6511、LPIPS 0.4854→0.1883(几乎减半)。逐维增益集中在外观类(imaging_quality +0.021、aesthetic_quality +0.021、subject_consistency +0.014、scene +0.011),dynamic_degree −0.014(画面更稳)。机理很直接:第一个 chunk 没有前序 chunk 可复用,且整段视频的外观都继承自它,缓存它等于把误差灌进后面所有 chunk。值得注意的是它同时又快又好于**teacache_x1.3(1.788× vs 1.240×,79.75 vs 79.59,PSNR 16.61 vs 15.16)——「首 chunk 全算 + 后续激进缓存」比「全程温和缓存」是更优的算力分配。 - 首 chunk FFFF 对三种方法、三个档位都成立(SF,
_c0FFFF行,Sep 6)。 同参数下 VBench 一律上升:TeaCache 1.3× 79.59→80.39、1.6× 78.99→80.06(+1.07,1.353×)、Fxxx3× 58.68→61.31;TaylorSeer 1.3× 79.83→80.44、1.75× 78.63→79.44、Fxxx2.85× 60.30→65.54(**+5.2);MotionCache 1.3× 79.23→79.97、1.75× 79.03→80.34(+1.31**,已到 FFFF 的 80.54 只差 0.2)、Fxxx2.85× 58.60→62.04。像素保真度更是整体抬升一个台阶:FxxF各档 PSNR 从 13.0–15.2 dB 升到 16.7–20.4 dB、LPIPS 从 0.32–0.52 降到 0.09–0.21;Fxxx档 PSNR 也从 11.7–11.9 升到 14.0–14.3。代价是首 chunk 多算 1–3 次 forward,实测加速比回落 0.08–0.6×(1.3× 档几乎不亏:1.24→1.16、1.30→1.26、1.14→1.13;3× 档亏最多:3.47→2.89、2.95→2.37、2.54→1.90)。两点值得写进论文:(i)motioncache_x1.75_c0FFFF在 1.445× 上达到 80.34 / PSNR 16.75,是 SF 上所有非 FFFF 配置里最接近 FFFF 的一档;(ii) 即便首 chunk 全算,Fxxx仍停在 61–66 分——最后一步的损失是逐 chunk 局部的,不是从首 chunk 传下来的,所以两条规则相互独立:首 chunk 全算、最后一步全算。 - 首 chunk FFFF 在 Causal-Forcing 上同样成立,但 1.3× 档没有余量。 CF 的 FFFF 是 81.17,而三种方法的 1.3× 原版已经在 81.2–81.6(与 FFFF 持平或更高,属评测噪声),所以
_c0FFFF在这一档 VBench 变化在 ±0.3 内(TeaCache 81.22→81.04、TaylorSeer 81.62→81.31、MotionCache 81.25→81.39);但只要原版有损失,首 chunk 全算就把损失补回来:TeaCache 2× 79.97→81.18(+1.21,1.789× 下回到 FFFF 的 81.17;PSNR 11.90→14.43),1.75× TaylorSeer 79.95→80.74、MotionCache 80.67→81.11(回到 FFFF 水平),Fxxx档 TaylorSeer 60.96→65.46、MotionCache 59.58→64.08(各 +4.5)、TeaCache 65.02→65.66。像素保真度则和 SF 一样全面抬升:FxxF各档 PSNR 12.0–13.2→14.4–16.5、LPIPS 0.34–0.52→0.14–0.27。SF/CF 两个基模合起来,16 组同参数对照中 VBench 14 升 2 平(2 平的都是原本已到 FFFF 的 CF 1.3× 档),PSNR 16/16 上升。 - naive 减步是很强的对照。 在 Causal-Forcing 上按等算力配对(Full 完全相同):21/28 档
naive3step81.40 vsreuse_FRFF81.31,14/28 档 80.57 vs 80.04,7/28 档 75.52 vs 58.86——直接少走几步全面不输于、低算力时远好于固定位置的残差复用,因为FRRR只算首步、其余三步复用同一个残差,误差累积到崩溃。更关键的是naive2step(14/28、80.57)优于所有缓存方法在同一算力下的成绩(teacache_x2/motioncache_x2均为 79.97–79.99),即在这个基模上「直接少走两步」比「走满四步再缓存两步」更划算。 - HY-WorldPlay 上 naive 减步几乎免费,直接复用不是(Sep 6,Core5 原始分)。
naive3step84.29、naive2step84.26 与 FFFF 84.26 持平,naive1step83.11(−1.1)却拿到 3.90×;像素上 naive3/2/1 的 PSNR 19.4 / 18.0 / 16.1。等算力对照:24/32 档naive3step84.29 ≈reuse_FRFF84.29 ≈teacache_x1.384.37;16/32 档naive2step84.26 ≈reuse_FRRF84.23;8/32 档naive1step83.11 vsreuse_FRRR81.27(**+1.8**,PSNR 16.1 vs 15.0)。也就是说 HY 这类蒸馏 AR 模型对步数极不敏感(4 步→2 步无损、→1 步只掉 1 分),三种缓存方法在FxxF下做到的 1.5–1.7× 都被naive2step的 1.98× 无损覆盖;缓存方法唯一还能争的是 2.5–2.9× 那一档,而那一档它们(81.3–82.9)也输给naive1step(83.1,3.9×)。把 Self-Forcing/Causal-Forcing 上「naive 减步强于缓存」的结论推广到 HY 是成立的,而且更极端。 - 首 chunk FFFF + naive 减步是 CF 上目前最强的算力分配(Sep 7)。 后 6 个 chunk 减步、chunk 0 仍走 4 步:
naive3step_c0FFFF81.39(22/28,1.284×)、naive2step_c0FFFF81.71(16/28,1.807×,高于 FFFF 的 81.17)、naive1step_c0FFFF79.15(10/28,3.048×)。对比同算力的其它配置:16/28 档teacache_x2_c0FFFF=reuse_FRRF_c0FFFF81.18、taylorseer_x1.75_c0FFFF(17) 80.74;10/28 档所有Fxxx缓存方法 61–66、reuse_FRRR_c0FFFF59.5,而naive1step_c0FFFF79.15 领先 13 分以上——原因同前:减步让最后一次预测仍在 t=1000 这一训练过的时间步上做(对 1 步就是唯一一步),而Fxxx是把最后一步换成过期残差。首 chunk FFFF 对 naive 的增益随减步幅度放大:3 步 −0.01、2 步 +1.14、1 步 +3.63(75.52→79.15),像素指标也从 11.5–11.9 dB 抬到 14.1–14.4 dB。直接复用(reuse)在同算力下始终不如减步:22/28 档 81.34 vs 81.39,16/28 档 81.18 vs 81.71,10/28 档 59.5 vs 79.2。 - HY 上首 chunk FFFF 对基线的作用小得多(Sep 7)。 naive/reuse 六个
_c0FFFF变体里,VBench 只有本来有损的两个动了:naive1step83.11→83.63(+0.51,3.90×→3.33×)、reuse_FRRR81.27→81.53(+0.26,3.77×→3.27×);已在 FFFF 水平的 3 步 / 2 步 / FRFF / FRRF 保持不变(±0.05)。像素指标仍全面上升(PSNR +1.6–2.4 dB,如naive2step18.0→19.7、naive3step19.4→21.7)。这与 HY 是 I2V 一致:chunk 0 有输入图像做强条件,外观不像 T2V 那样完全由首 chunk 决定,所以 SF/CF 上 +1~+3.6 的 VBench 增益在 HY 上只剩零点几分。ATC Stage-1 predictor(atc_s1_fppf,DEV 项目 validation25)在 1.67× 下 84.18 / PSNR 20.1,像素保真度高于同速的teacache_x1.75(PSNR 17.6)、与naive2step_c0FFFF(1.87×,PSNR 19.7)相当。 - HY 缓存方法在 c0FFFF 下重新搜参后达到了目标档位(Sep 8,
*_x1.75_c0FFFF/*_Fxxx_x2.85_c0FFFF)。 实测加速比 TeaCache 1.857× / 2.535×、TaylorSeer 1.704× / 2.870×、MotionCache 1.634× / 2.517×(之前为 1.54 / 2.51、1.68 / 2.52、1.53 / 2.49)。FxxF档三者 VBench 全部保持 FFFF 水平(84.26–84.28 vs 84.26),像素指标比原版高 1–2 dB(PSNR 18.6 vs 16.9–17.6);但这一档 TeaCache 与 TaylorSeer 落到的都是「后 7 chunk 中间两步全跳」的量化上限点(Full = 18/32),与reuse_FRRF_c0FFFF算力等价、结果也几乎一样(84.28 / PSNR 18.6),只有 MotionCache 仍保留 27% 的 token 级活跃步。Fxxx档 VBench 82.6 / 81.7 / 81.4,与原版持平或略低(TaylorSeer 82.43→81.69 是换了更激进的 interval 3.9 以换取 2.52×→2.87×),像素指标同样 +1.2–1.6 dB。同算力对照仍然是 naive 减步占优:16–18/32 档naive2step_c0FFFF84.26 / 1.87× / PSNR 19.7 不输任何缓存方法,11/32 档naive1step_c0FFFF83.63 / 3.33× 高出所有Fxxx缓存点 1–2 分。ATC Stage-1 predictoratc_s1_fppp在 2.59× 下 81.98 / PSNR 19.3——VBench 与Fxxx缓存点相当,像素保真度高 2–3 dB。DisCa Stage-1(双 block,blocks [0,53],同样 chunk 0 全算)disca_s1_fppf84.17 / PSNR 19.7 / LPIPS 0.135,1.80×:VBench 与 ATC 持平,像素保真度介于 ATC(20.1 / 0.126)与 naive2step_c0FFFF(19.7 / 0.148)之间,高于残差复用类(18.6 / 0.167)。FPPP 档disca_s1_fppp81.98 / PSNR 19.0(3.00×)与atc_s1_fppp81.98 / 19.3(2.59×)持平,仍低于naive1step_c0FFFF83.63。DisCa 的 step-1000 与 step-2000 checkpoint 几乎无差别(FPPF 84.15 vs 84.17,FPPP 82.02 vs 81.98,像素指标差 <0.1 dB)——HY 上 DisCa 在 1000 步已收敛,与 CF 上 DisCa 1000→2000 步 FPPP +3.7 的情况不同。 - 长视频(Sep 8,
*_14c_*/*_28c_*:14 / 28 chunk = 165 / 333 帧,超过 21 帧训练上下文后 KV 走 21 帧滚动窗口)。 14 chunk 时 FFFF 自身从 81.17 降到 81.01(14c_ffff;subject_consistency 95.7→92.7、background 95.8→94.1,scene 反而 56.0→61.3),说明滚动窗口下长程一致性本身在退化。ATC-chunk FPPF 在 14 chunk 上 1.766×:Stage-1 80.57(相对14c_ffff−0.43,7 chunk 时是 +0.38)、Stage-2 80.97(−0.03);像素指标从 7 chunk 的 PSNR 14.6 / LPIPS 0.22 降到 12.8 / 0.34——Predictor 的误差随 chunk 累积(前 7 chunk 之后没有 FFFF 的「重锚定」),Stage-2(随机出口 DMD)在长视频上比 Stage-1 稳得多(VBench +0.40,主要是 subject/background consistency)。28 chunk(333 帧)时趋势放大:FFFF 自身掉到 77.99(subject 95.7→88.3、background 95.8→89.6、aesthetic 66.6→62.2——滚动窗口下的长程漂移是基模本身的问题),ATC Stage-1 FPPF 77.48(−0.51)、Stage-2 78.65(+0.67,高于同长度 FFFF;subject 89.1 vs 88.3、background 91.3 vs 89.6),加速比 1.793×;像素指标继续下滑到 PSNR 11.0 / LPIPS 0.47–0.48。三种长度合起来:Stage-1 相对同长度 FFFF 为 +0.38 / −0.43 / −0.51,Stage-2 为 +0.08 / −0.03 / +0.67——随机出口 DMD 训练出来的 Predictor 不会随视频变长而退化,反而在 FFFF 自己漂移最严重的 28 chunk 上略优于 FFFF。 - 长视频上的 checkpoint 扫描(Sep 11–12,CF 14 / 28 chunk,FPPF,chunk 0 FFFF;HY 16 / 32 chunk 进行中)。 对比 DisCa Stage-1 的 step 500 / 1000 / 2000、ATC Stage-2(随机出口 DMD,EMA)的 step 500 / 1000 / 2000 与 naive 2 步(
naive2step_<n>c:chunk 0 四步全算,之后每 chunk 只走 t=1000 / 250,与cf_naive2step_c0FFFF同一子集),三者 Full 完全相同(14 chunk 30/56、28 chunk 58/112),参考帧读同长度 FFFF 的 MP4(§)。14 chunk:ATC Stage-2 s500 / s1000 / s2000 = 81.08 / 81.11 / 80.97(FFFF 81.01,1.77–1.78×),DisCa s500 / s1000 / s2000 = 80.12 / 80.51 / 80.60(1.82×),naive2step_14c80.79(1.91×);28 chunk:ATC Stage-2 78.55 / 78.84 / 78.65(FFFF 77.99,1.80×),DisCa 75.46 / 77.40 / 77.87(1.84×),naive2step_28c78.74(1.95×)。三点读数:(i) ATC Stage-2 三个 step 相差不到 0.15(14c)/ 0.3(28c),s500 就已经到达平台并且不低于同长度 FFFF——Stage-2 对长视频的增益来得很早,2000 步不是必要条件;(ii) DisCa 随步数单调上升,但 2000 步仍低于 FFFF 与 naive,且视频越长早期权重掉得越多(28c 的 s500 比 FFFF 低 2.5)——没有前一 chunk 通道的 Predictor 在长视频上误差累积更快;(iii) 等 Full 的 naive 2 步与最好的 ATC Stage-2 在 14c 只差 0.3、28c 持平(78.74 vs 78.84),像素指标也几乎相同(PSNR 12.6 vs 12.7–12.8、11.0 vs 11.1),而 naive 的实测加速比更高(Predictor 调用的真实开销高于按 1/30 forward 记的算量)——在 CF 的长视频上,ATC Stage-2 相对 naive 减步的优势只剩零点几分,主要收益是不低于 FFFF 的一致性指标(subject / background consistency)。HY 的 16 / 32 chunk 行(64 / 128 latent,相机动作等比拉长)生成中,完成后补入 HY 表。 FPF(Sep 8):chunk 内只走 3 个时间步——t=1000 全算、t=750 一步 Predictor(锚定 t=1000,与训练一致)、跳过 t=500、t=250 全算。 ATC-chunk Stage-1 的atc_chunk_fpf在 1.773× 下 81.30(FFFF 81.17,同算力 16 full 的atc_chunk_fppf81.55 / 1.697×,naive3step81.40 / 1.327×),像素指标 PSNR 14.5 / LPIPS 0.24 与 FPPF 相当。也就是说少调用一次 Predictor、直接跳过一个时间步,质量几乎不变而更快——和 naive 减步同一逻辑:中间步的价值主要在于让最后一步有一个好的 起点,而不在于步数本身。- MotionCache 在 1.3×/1.6× 的实测加速比明显低于 compute 折算(差 9–11 个百分点):逐 token 选择与 selective forward 的簿记开销是真实存在的;
Fxxx下更甚,compute 3.0× 只换来 实测 1.85–1.95×。 - 最后一步不能缓存。 凡是让 step 3 走缓存的配置——
Fxxx全部、FFxx在 ≥1.6× 时——VBench 掉 15–25 分:imaging/aesthetic 从 ~0.66 掉到 0.41–0.50,scene 从 ~0.57 掉到 0.03–0.37,而 dynamic_degree 从 0.69–0.82 升到 0.89–0.96,即残留噪声没有被去掉、画面在抖。FFxx ×1.3实际是 FFxF(最后一步仍算),质量与FxxF ×1.3相当。 - TaylorSeer 的一阶预测在
FFxx下确实被触发了,但 ≥1.6× 时把预测用在了最后一步,"预测 vs 拷贝"与"跳不跳最后一步"在这组数据里是混在一起的;要单独检验预测本身,需要最后一步必算、中间步用一阶预测的调度(如 FFxF,上限 1.33×)。 Fxxx下 TeaCache/FlowCache 的阈值在 3 条 prompt 上搜到 ~3.0× compute,251 条上实际为 3.4–3.6×(Self-Forcing)/ 2.8–2.9×(Causal-Forcing):indicator 跨 chunk 几乎不变,可达点是 {1, 2, 4}× 的台阶,中间值靠少数 chunk 落在台阶另一侧凑出,随 prompt 集漂移。MotionCache(逐 token)和 TaylorSeer(确定性调度)不漂。
2. 各策略的配置参数
阈值类方法(TeaCache / FlowCache / MotionCache)的 thresh 作用在重标定后的累计相对 L1 距离上(calibrate.py 按 TeaCache 的拟合流程得到的 1 次多项式,见下方系数),indicator 为时间步调制后的噪声输入(TeaCache 原始定义,非 Wan 移植的 e0)。TaylorSeer 的 interval 为平均刷新间隔,小数部分用 Bresenham 交替在相邻整数间隔间实现,max_order=1。固定超参:FlowCache group_size=1(3 帧组/chunk);MotionCache weight_norm=mean、min_update_ratio=0、无 temporal consistency。"搜索时 Full"是定参数时在搜索/配对 prompt 上的 compute,251 条上的实际值见第 1 节。
Self-Forcing
重标定多项式系数(最高次在前):0.611279, -0.168851
| 策略 | 方法 | 调度 | 参数 | 取值 | 目标加速比 | 搜索时 Full | 来源 |
|---|---|---|---|---|---|---|---|
ffff |
无缓存 | FFFF | — | — | 1.0× | 28.000 | — |
teacache_x1.3 |
TeaCache | FxxF | thresh |
0.634766 | 1.3× | 21.600 | final_self_forcing.json,held-out 漂移 -0.079 |
teacache_x1.3 |
TeaCache | FxxF(首 chunk FFFF) | thresh |
0.634766 | 1.3× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
teacache_x1.6 |
TeaCache | FxxF | thresh |
1.25065 | 1.6× | 19.200 | final_self_forcing.json,held-out 漂移 -0.032 |
teacache_x1.6 |
TeaCache | FxxF(首 chunk FFFF) | thresh |
1.25065 | 1.6× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
teacache_x1.75 |
TeaCache | FxxF | thresh |
1.2496 | 1.75× | 21.000 | final_self_forcing_v2.json,按实测加速比定点(扫描 1.337×);below band (reachable speedups are quantised) |
teacache_x2 |
TeaCache | FxxF | thresh |
1.29167 | 2× | 14.000 | final_self_forcing.json,held-out 漂移 +0.000 |
teacache_x2 |
TeaCache | FxxF(首 chunk FFFF) | thresh |
1.29167 | 2× | nan | final_self_forcing_c0full.json,3-prompt 搜索点,未经 finalize |
teacache_Fxxx_x2.85 |
TeaCache | Fxxx | thresh |
0.9 | 2.85× | 14.000 | final_self_forcing_v2.json,按实测加速比定点(扫描 1.969×);below band (reachable speedups are quantised) |
teacache_Fxxx_x3 |
TeaCache | Fxxx(首 chunk FFFF) | thresh |
1.72656 | 3× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
teacache_Fxxx_x3 |
TeaCache | Fxxx | thresh |
1.72656 | 3× | 9.667 | final_self_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
flowcache_x1.3 |
FlowCache | FxxF | thresh |
0.635946 | 1.3× | 21.433 | final_self_forcing.json,held-out 漂移 -0.038 |
flowcache_x1.6 |
FlowCache | FxxF | thresh |
1.25 | 1.6× | 18.333 | final_self_forcing.json,held-out 漂移 -0.070 |
flowcache_x2 |
FlowCache | FxxF | thresh |
1.29167 | 2× | 14.000 | final_self_forcing.json,held-out 漂移 +0.000 |
flowcache_Fxxx_x3 |
FlowCache | Fxxx | thresh |
1.72461 | 3× | 10.111 | final_self_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_x1.3 |
TaylorSeer | FxxF | interval |
2.08333 | 1.3× | 21.000 | final_self_forcing.json,held-out 漂移 +0.000 |
taylorseer_x1.3 |
TaylorSeer | FxxF(首 chunk FFFF) | interval |
2.08333 | 1.3× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
taylorseer_x1.6 |
TaylorSeer | FxxF | interval |
2.58333 | 1.6× | 17.000 | final_self_forcing.json,held-out 漂移 +0.000 |
taylorseer_x1.75 |
TaylorSeer | FxxF(首 chunk FFFF) | interval |
2.75 | 1.75× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
taylorseer_x1.75 |
TaylorSeer | FxxF | interval |
2.75 | 1.75× | 15.000 | final_self_forcing_v2.json,按实测加速比定点(扫描 1.777×) |
taylorseer_x2 |
TaylorSeer | FxxF | interval |
2.91667 | 2× | 14.000 | final_self_forcing.json,held-out 漂移 +0.000 |
taylorseer_FFxx_x1.3 |
TaylorSeer | FFxx | interval |
1.8125 | 1.3× | 22.000 | final_self_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_FFxx_x1.6 |
TaylorSeer | FFxx | interval |
2.375 | 1.6× | 18.000 | final_self_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_FFxx_x2 |
TaylorSeer | FFxx | interval |
2.875 | 2× | 14.000 | final_self_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_Fxxx_x2.85 |
TaylorSeer | Fxxx(首 chunk FFFF) | interval |
3.65 | 2.85× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
taylorseer_Fxxx_x2.85 |
TaylorSeer | Fxxx | interval |
3.65 | 2.85× | 9.000 | final_self_forcing_v2.json,按实测加速比定点(扫描 2.870×) |
motioncache_x1.3 |
MotionCache | FxxF(首 chunk FFFF) | thresh |
0.755981 | 1.3× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
motioncache_x1.3 |
MotionCache | FxxF | thresh |
0.755981 | 1.3× | 21.574 | final_self_forcing_mc.json,held-out 漂移 +0.003 |
motioncache_x1.6 |
MotionCache | FxxF | thresh |
1.24609 | 1.6× | 17.333 | final_self_forcing_mc.json,held-out 漂移 -0.008 |
motioncache_x1.75 |
MotionCache | FxxF(首 chunk FFFF) | thresh |
1.35 | 1.75× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
motioncache_x1.75 |
MotionCache | FxxF | thresh |
1.35 | 1.75× | 16.023 | final_self_forcing_v2.json,按实测加速比定点(扫描 1.536×,活跃步 50%,选中 28%);below band (token-wise decision goes vacuous above this point) |
motioncache_x2 |
MotionCache | FxxF | thresh |
2.5 | 2× | 14.000 | final_self_forcing_mc.json,held-out 漂移 +0.000 |
motioncache_Fxxx_x2.85 |
MotionCache | Fxxx(首 chunk FFFF) | thresh |
1.95 | 2.85× | nan | final_self_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
motioncache_Fxxx_x2.85 |
MotionCache | Fxxx | thresh |
1.95 | 2.85× | 7.550 | final_self_forcing_v2.json,按实测加速比定点(扫描 2.537×,活跃步 43%,选中 8%);below band (token-wise decision goes vacuous above this point) |
motioncache_Fxxx_x3 |
MotionCache | Fxxx | thresh |
1.79297 | 3× | 9.342 | final_self_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
euler_FFFF |
euler | FFFF | — | — | — | — | 基线(无搜索参数) |
reuse_FRFF |
reuse | FRFF | — | — | — | — | 基线(无搜索参数) |
reuse_FRRF |
reuse | FRRF | — | — | — | — | 基线(无搜索参数) |
reuse_FRRR |
reuse | FRRR | — | — | — | — | 基线(无搜索参数) |
Causal-Forcing
重标定多项式系数(最高次在前):0.807724, -0.413696
| 策略 | 方法 | 调度 | 参数 | 取值 | 目标加速比 | 搜索时 Full | 来源 |
|---|---|---|---|---|---|---|---|
ffff |
无缓存 | FFFF | — | — | 1.0× | 28.000 | — |
teacache_x1.3 |
TeaCache | FxxF | thresh |
0.649089 | 1.3× | 21.400 | final_causal_forcing.json,held-out 漂移 +0.025 |
teacache_x1.3 |
TeaCache | FxxF(首 chunk FFFF) | thresh |
0.649089 | 1.3× | nan | final_causal_forcing_c0full.json,3-prompt 搜索点,未经 finalize |
teacache_x1.6 |
TeaCache | FxxF | thresh |
1.27604 | 1.6× | 17.900 | final_causal_forcing.json,held-out 漂移 +0.024 |
teacache_x1.75 |
TeaCache | FxxF | thresh |
1.2754 | 1.75× | 16.000 | final_causal_forcing_v2.json,按实测加速比定点(扫描 1.785×) |
teacache_x2 |
TeaCache | FxxF | thresh |
1.29167 | 2× | 14.000 | final_causal_forcing.json,held-out 漂移 +0.000 |
teacache_x2 |
TeaCache | FxxF(首 chunk FFFF) | thresh |
1.29167 | 2× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
teacache_Fxxx_x3 |
TeaCache | Fxxx(首 chunk FFFF) | thresh |
1.70117 | 3× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
teacache_Fxxx_x3 |
TeaCache | Fxxx | thresh |
1.70117 | 3× | 9.000 | final_causal_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
flowcache_x1.3 |
FlowCache | FxxF | thresh |
0.648763 | 1.3× | 22.083 | final_causal_forcing.json,held-out 漂移 +0.005 |
flowcache_x1.6 |
FlowCache | FxxF | thresh |
1.27604 | 1.6× | 17.125 | final_causal_forcing.json,held-out 漂移 +0.004 |
flowcache_x2 |
FlowCache | FxxF | thresh |
1.29167 | 2× | 14.000 | final_causal_forcing.json,held-out 漂移 +0.000 |
flowcache_Fxxx_x3 |
FlowCache | Fxxx | thresh |
1.69922 | 3× | 9.556 | final_causal_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_x1.3 |
TaylorSeer | FxxF(首 chunk FFFF) | interval |
2.08333 | 1.3× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
taylorseer_x1.3 |
TaylorSeer | FxxF | interval |
2.08333 | 1.3× | 21.000 | final_causal_forcing_ts.json,held-out 漂移 +0.000 |
taylorseer_x1.6 |
TaylorSeer | FxxF | interval |
2.58333 | 1.6× | 17.000 | final_causal_forcing_ts.json,held-out 漂移 +0.000 |
taylorseer_x1.75 |
TaylorSeer | FxxF(首 chunk FFFF) | interval |
2.75 | 1.75× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
taylorseer_x1.75 |
TaylorSeer | FxxF | interval |
2.75 | 1.75× | 15.000 | final_causal_forcing_v2.json,按实测加速比定点(扫描 1.779×) |
taylorseer_x2 |
TaylorSeer | FxxF | interval |
2.91667 | 2× | 14.000 | final_causal_forcing_ts.json,held-out 漂移 +0.000 |
taylorseer_FFxx_x1.3 |
TaylorSeer | FFxx | interval |
1.8125 | 1.3× | 22.000 | final_causal_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_FFxx_x1.6 |
TaylorSeer | FFxx | interval |
2.375 | 1.6× | 18.000 | final_causal_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_FFxx_x2 |
TaylorSeer | FFxx | interval |
2.875 | 2× | 14.000 | final_causal_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
taylorseer_Fxxx_x2.85 |
TaylorSeer | Fxxx(首 chunk FFFF) | interval |
3.65 | 2.85× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
taylorseer_Fxxx_x2.85 |
TaylorSeer | Fxxx | interval |
3.65 | 2.85× | 9.000 | final_causal_forcing_v2.json,按实测加速比定点(扫描 2.866×) |
motioncache_x1.3 |
MotionCache | FxxF(首 chunk FFFF) | thresh |
0.769531 | 1.3× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
motioncache_x1.3 |
MotionCache | FxxF | thresh |
0.769531 | 1.3× | 21.450 | final_causal_forcing_mc.json,held-out 漂移 -0.007 |
motioncache_x1.6 |
MotionCache | FxxF | thresh |
1.26471 | 1.6× | 17.612 | final_causal_forcing_mc.json,held-out 漂移 +0.006 |
motioncache_x1.75 |
MotionCache | FxxF(首 chunk FFFF) | thresh |
1.55 | 1.75× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
motioncache_x1.75 |
MotionCache | FxxF | thresh |
1.55 | 1.75× | 14.393 | final_causal_forcing_v2.json,按实测加速比定点(扫描 1.550×,活跃步 52%,选中 7%);below band (token-wise decision goes vacuous above this point) |
motioncache_x2 |
MotionCache | FxxF | thresh |
2.875 | 2× | 14.000 | final_causal_forcing_mc.json,held-out 漂移 +0.000 |
motioncache_Fxxx_x2.85 |
MotionCache | Fxxx(首 chunk FFFF) | thresh |
1.9 | 2.85× | nan | final_causal_forcing_c0full_more.json,3-prompt 搜索点,未经 finalize |
motioncache_Fxxx_x2.85 |
MotionCache | Fxxx | thresh |
1.9 | 2.85× | 8.043 | final_causal_forcing_v2.json,按实测加速比定点(扫描 2.316×,活跃步 65%,选中 8%);below band (token-wise decision goes vacuous above this point) |
motioncache_Fxxx_x3 |
MotionCache | Fxxx | thresh |
1.76953 | 3× | 9.308 | final_causal_forcing_newsched.json,3-prompt 搜索点,未经 finalize |
naive3step |
FFFF | FFF | — | — | — | — | 基线(无搜索参数) |
naive2step |
FFFF | FF | — | — | — | — | 基线(无搜索参数) |
naive1step |
FFFF | F | — | — | — | — | 基线(无搜索参数) |
reuse_FRFF |
reuse | FRFF | — | — | — | — | 基线(无搜索参数) |
reuse_FRRF |
reuse | FRRF | — | — | — | — | 基线(无搜索参数) |
reuse_FRRR |
reuse | FRRR | — | — | — | — | 基线(无搜索参数) |
naive3step_c0FFFF |
FFFF | FFF | — | — | — | — | 基线(无搜索参数) |
naive2step_c0FFFF |
FFFF | FF | — | — | — | — | 基线(无搜索参数) |
naive1step_c0FFFF |
FFFF | F | — | — | — | — | 基线(无搜索参数) |
reuse_FRFF_c0FFFF |
reuse | FRFF | — | — | — | — | 基线(无搜索参数) |
reuse_FRRF_c0FFFF |
reuse | FRRF | — | — | — | — | 基线(无搜索参数) |
reuse_FRRR_c0FFFF |
reuse | FRRR | — | — | — | — | 基线(无搜索参数) |
HY-WorldPlay
| 策略 | 方法 | 调度 | 参数 | 取值 | 目标加速比 | 来源 |
|---|---|---|---|---|---|---|
ffff |
无缓存 | FxxF | — | — | 1× | — |
teacache_x1.3 |
TeaCache | FxxF | thresh |
0.242188 | 1.3× | hy_sweep_teacache.json;rescale 系数 hy_coeff.json |
teacache_x1.75 |
TeaCache | FxxF | thresh |
0.4767 | 1.75× | hy_point_v2.json;rescale 系数 hy_coeff.json |
teacache_x1.75_c0FFFF |
TeaCache | FxxF(首 chunk FFFF) | thresh |
0.55 | 1.75× | hy_point_c0.json;rescale 系数 hy_coeff.json |
teacache_Fxxx_x2.85 |
TeaCache | Fxxx | thresh |
0.655 | 2.85× | hy_point_v2.json;rescale 系数 hy_coeff.json |
teacache_Fxxx_x2.85_c0FFFF |
TeaCache | Fxxx(首 chunk FFFF) | thresh |
0.665 | 2.85× | hy_point_c0.json;rescale 系数 hy_coeff.json |
taylorseer_x1.3 |
TaylorSeer | FxxF | interval |
1.83333 | 1.3× | hy_sweep_taylorseer.json |
taylorseer_x1.75 |
TaylorSeer | FxxF | interval |
2.85 | 1.75× | hy_point_v2.json |
taylorseer_x1.75_c0FFFF |
TaylorSeer | FxxF(首 chunk FFFF) | interval |
3 | 1.75× | hy_point_c0.json |
taylorseer_Fxxx_x2.85 |
TaylorSeer | Fxxx | interval |
3.65 | 2.85× | hy_point_v2.json |
taylorseer_Fxxx_x2.85_c0FFFF |
TaylorSeer | Fxxx(首 chunk FFFF) | interval |
3.9 | 2.85× | hy_point_c0.json |
motioncache_x1.3 |
MotionCache | FxxF | thresh |
0.09375 | 1.3× | hy_sweep_motioncache.json |
motioncache_x1.75 |
MotionCache | FxxF | thresh |
0.2 | 1.75× | hy_point_v2.json |
motioncache_x1.75_c0FFFF |
MotionCache | FxxF(首 chunk FFFF) | thresh |
0.36 | 1.75× | hy_point_c0.json |
motioncache_Fxxx_x2.85 |
MotionCache | Fxxx | thresh |
0.6 | 2.85× | hy_point_v2.json |
motioncache_Fxxx_x2.85_c0FFFF |
MotionCache | Fxxx(首 chunk FFFF) | thresh |
0.9 | 2.85× | hy_point_c0.json |
naive3step |
无缓存 | FFF | — | — | — | naive baseline |
naive2step |
无缓存 | FF | — | — | — | naive baseline |
naive1step |
无缓存 | F | — | — | — | naive baseline |
reuse_FRFF |
reuse | FRFF | — | — | — | naive cache baseline |
reuse_FRRF |
reuse | FRRF | — | — | — | naive cache baseline |
reuse_FRRR |
reuse | FRRR | — | — | — | naive cache baseline |
naive3step_c0FFFF |
无缓存 | FFF(首 chunk FFFF) | — | — | — | naive baseline (chunk 0 FFFF) |
naive2step_c0FFFF |
无缓存 | FF(首 chunk FFFF) | — | — | — | naive baseline (chunk 0 FFFF) |
naive1step_c0FFFF |
无缓存 | F(首 chunk FFFF) | — | — | — | naive baseline (chunk 0 FFFF) |
reuse_FRFF_c0FFFF |
reuse | FRFF(首 chunk FFFF) | — | — | — | naive cache baseline (chunk 0 FFFF) |
reuse_FRRF_c0FFFF |
reuse | FRRF(首 chunk FFFF) | — | — | — | naive cache baseline (chunk 0 FFFF) |
reuse_FRRR_c0FFFF |
reuse | FRRR(首 chunk FFFF) | — | — | — | naive cache baseline (chunk 0 FFFF) |
atc_s1_fppf / atc_s1_fppp |
ATC Stage-1 predictor | FPPF / FPPP | — | — | — | HY-WorldPlay-DEV-Predictor validation25(¶) |
atc_s2_s{500,800,1000,1500,2000}_fppf / _fppp |
ATC Stage-1 + on-policy detached chunk+timestep FPPP rollout(step 500/800/1000/1500/2000) | FPPF / FPPP | — | — | — | HY-WorldPlay-DEV-Predictor validation25(¶) |
disca_s1_fppf / disca_s1_fppp |
DisCa Stage-1 predictor(双 block,step 2000) | FPPF / FPPP | — | — | — | HY-WorldPlay-DEV-Predictor validation25(¶) |
disca_s1000_fppf / disca_s1000_fppp |
DisCa Stage-1 predictor(step 1000) | FPPF / FPPP | — | — | — | HY-WorldPlay-DEV-Predictor validation25(¶) |
disca_s500_fppf |
DisCa Stage-1 predictor(step 500) | FPPF | — | — | — | HY-WorldPlay-DEV-Predictor validation25(¶) |
<n>c_ffff / naive2step_<n>c_c0FFFF(n = 16 / 32) |
长视频 FFFF 参考 / naive 2 步(首 chunk FFFF),253 / 509 帧 | FFFF / FF | — | — | — | hycache,同进程配对 FFFF |
atc_s2_s{500,1000,2000}_<n>c_fppf_c0FFFF、disca_s{500,1000,2000}_<n>c_fppf(n = 16 / 32) |
ATC rollout / DisCa Stage-1 predictor 各 step 的长视频行(64 / 128 latent,相机动作等比拉长,pose-retrieved memory 上限 20 latent) | FPPF | — | — | — | HY-WorldPlay-DEV-Predictor 生成器(hy_dev_gen_long.py,¶),像素指标对照 <n>c_ffff 的 MP4 |
LingBot-World-V2-1.3B-Causal-Fast
| 策略 | 方法 | 调度 | 参数 | 取值 | 目标加速比 | 来源 |
|---|---|---|---|---|---|---|
ffff |
无缓存 | FxxF | — | — | 1× | — |
teacache_x1.3 |
TeaCache | FxxF | thresh |
1 | 1.3× | lb_sweep_teacache.json;rescale 系数 lb_coeff.json |
teacache_x1.75 |
TeaCache | FxxF | thresh |
1.395 | 1.75× | lb_point_v2.json;rescale 系数 lb_coeff.json |
teacache_x1.75_c0FFFF |
TeaCache | FxxF(首 chunk FFFF) | thresh |
1.48 | 1.75× | lb_point_c0.json;rescale 系数 lb_coeff.json |
teacache_Fxxx_x2.85 |
TeaCache | Fxxx | thresh |
1.905 | 2.85× | lb_point_v2.json;rescale 系数 lb_coeff.json |
teacache_Fxxx_x2.85_c0FFFF |
TeaCache | Fxxx(首 chunk FFFF) | thresh |
1.9 | 2.85× | lb_point_c0.json;rescale 系数 lb_coeff.json |
taylorseer_x1.3 |
TaylorSeer | FxxF | interval |
1.83333 | 1.3× | lb_sweep_taylorseer.json |
taylorseer_x1.75 |
TaylorSeer | FxxF | interval |
3 | 1.75× | lb_point_v2.json |
taylorseer_x1.75_c0FFFF |
TaylorSeer | FxxF(首 chunk FFFF) | interval |
2.85 | 1.75× | lb_point_c0.json |
taylorseer_Fxxx_x2.85 |
TaylorSeer | Fxxx | interval |
3.65 | 2.85× | lb_point_v2.json |
taylorseer_Fxxx_x2.85_c0FFFF |
TaylorSeer | Fxxx(首 chunk FFFF) | interval |
3.9 | 2.85× | lb_point_c0.json |
motioncache_x1.3 |
MotionCache | FxxF | thresh |
1.40625 | 1.3× | lb_sweep_motioncache.json |
motioncache_x1.75 |
MotionCache | FxxF | thresh |
2.6 | 1.75× | lb_point_v2.json |
motioncache_x1.75_c0FFFF |
MotionCache | FxxF(首 chunk FFFF) | thresh |
3.6 | 1.75× | lb_point_c0.json |
motioncache_Fxxx_x2.85 |
MotionCache | Fxxx | thresh |
3.9 | 2.85× | lb_point_v2.json |
motioncache_Fxxx_x2.85_c0FFFF |
MotionCache | Fxxx(首 chunk FFFF) | thresh |
5 | 2.85× | lb_point_c0.json |
naive3step |
无缓存 | FFF | — | — | — | naive baseline |
naive2step |
无缓存 | FF | — | — | — | naive baseline |
naive1step |
无缓存 | F | — | — | — | naive baseline |
reuse_FRFF |
reuse(velocity) | FRFF | — | — | — | naive cache baseline (velocity reuse) |
reuse_FRRF |
reuse(velocity) | FRRF | — | — | — | naive cache baseline (velocity reuse) |
reuse_FRRR |
reuse(velocity) | FRRR | — | — | — | naive cache baseline (velocity reuse) |
naive3step_c0FFFF |
无缓存 | FFF(首 chunk FFFF) | — | — | — | naive baseline (chunk 0 FFFF) |
naive2step_c0FFFF |
无缓存 | FF(首 chunk FFFF) | — | — | — | naive baseline (chunk 0 FFFF) |
naive1step_c0FFFF |
无缓存 | F(首 chunk FFFF) | — | — | — | naive baseline (chunk 0 FFFF) |
reuse_FRFF_c0FFFF |
reuse(velocity) | FRFF(首 chunk FFFF) | — | — | — | naive cache baseline (velocity reuse) (chunk 0 FFFF) |
reuse_FRRF_c0FFFF |
reuse(velocity) | FRRF(首 chunk FFFF) | — | — | — | naive cache baseline (velocity reuse) (chunk 0 FFFF) |
reuse_FRRR_c0FFFF |
reuse(velocity) | FRRR(首 chunk FFFF) | — | — | — | naive cache baseline (velocity reuse) (chunk 0 FFFF) |
atc_chunk_fpf / atc_chunk_fppf / atc_chunk_fppp |
ATC Stage-1 predictor(block 17,previous_scope=chunk) | FPF / FPPF / FPPP(首 chunk FFFF) | — | — | — | lingbot-world-v2-a Stage-1,100 组图 × 4 动作离线集,2000 步 |
disca_fpf / disca_fppf / disca_fppp |
DisCa Stage-1 predictor(block 17,无 previous-chunk 通道) | FPF / FPPF / FPPP(首 chunk FFFF) | — | — | — | lingbot-world-v2-a Stage-1,100 组图 × 4 动作离线集,2000 步 |