Runware
/

xziayro commited on
Commit
9ec7087
·
verified ·
1 Parent(s): 2c05d7d

Upload 4 files

Browse files
Files changed (4) hide show
  1. config_3b.yaml +91 -0
  2. config_7b.yaml +88 -0
  3. neg_emb.pt +3 -0
  4. pos_emb.pt +3 -0
config_3b.yaml ADDED
@@ -0,0 +1,91 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ __object__:
2
+ path: projects.video_diffusion_sr.train
3
+ name: VideoDiffusionTrainer
4
+
5
+ dit:
6
+ model:
7
+ __object__:
8
+ path: "dit_3b.nadit"
9
+ name: "NaDiT"
10
+ args: "as_params"
11
+ vid_in_channels: 33
12
+ vid_out_channels: 16
13
+ vid_dim: 2560
14
+ vid_out_norm: fusedrms
15
+ txt_in_dim: 5120
16
+ txt_in_norm: fusedln
17
+ txt_dim: ${.vid_dim}
18
+ emb_dim: ${eval:'6 * ${.vid_dim}'}
19
+ heads: 20
20
+ head_dim: 128 # llm-like
21
+ expand_ratio: 4
22
+ norm: fusedrms
23
+ norm_eps: 1.0e-05
24
+ ada: single
25
+ qk_bias: False
26
+ qk_norm: fusedrms
27
+ patch_size: [1, 2, 2]
28
+ num_layers: 32 # llm-like
29
+ mm_layers: 10
30
+ mlp_type: swiglu
31
+ msa_type: None
32
+ block_type: ${eval:'${.num_layers} * ["mmdit_sr"]'} # space-full
33
+ window: ${eval:'${.num_layers} * [(4,3,3)]'} # space-full
34
+ window_method: ${eval:'${.num_layers} // 2 * ["720pwin_by_size_bysize","720pswin_by_size_bysize"]'} # space-full
35
+ rope_type: mmrope3d
36
+ rope_dim: 128
37
+ compile: False
38
+ gradient_checkpoint: True
39
+ fsdp:
40
+ sharding_strategy: _HYBRID_SHARD_ZERO2
41
+
42
+ ema:
43
+ decay: 0.9998
44
+
45
+ vae:
46
+ model:
47
+ __object__:
48
+ path: "video_vae_v3.modules.attn_video_vae"
49
+ name: "VideoAutoencoderKLWrapper"
50
+ args: "as_params"
51
+ freeze_encoder: False
52
+ gradient_checkpoint: True # Disabled to prevent VRAM leaks in inference
53
+ slicing:
54
+ split_size: 4
55
+ memory_device: same
56
+ memory_limit:
57
+ conv_max_mem: 0.5
58
+ norm_max_mem: 0.5
59
+ checkpoint: ema_vae_fp16.safetensors
60
+ scaling_factor: 0.9152
61
+ compile: False
62
+ grouping: False
63
+ dtype: float16
64
+
65
+ diffusion:
66
+ schedule:
67
+ type: lerp
68
+ T: 1000.0
69
+ sampler:
70
+ type: euler
71
+ prediction_type: v_lerp
72
+ timesteps:
73
+ training:
74
+ type: logitnormal
75
+ loc: 0.0
76
+ scale: 1.0
77
+ sampling:
78
+ type: uniform_trailing
79
+ steps: 50
80
+ transform: True
81
+ loss:
82
+ type: v_lerp
83
+ cfg:
84
+ scale: 7.5
85
+ rescale: 0
86
+
87
+ condition:
88
+ i2v: 0.0
89
+ v2v: 0.0
90
+ sr: 1.0
91
+ noise_scale: 0.25
config_7b.yaml ADDED
@@ -0,0 +1,88 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ __object__:
2
+ path: projects.video_diffusion_sr.train
3
+ name: VideoDiffusionTrainer
4
+
5
+ dit:
6
+ model:
7
+ __object__:
8
+ path: "dit_7b.nadit"
9
+ name: "NaDiT"
10
+ args: "as_params"
11
+ vid_in_channels: 33
12
+ vid_out_channels: 16
13
+ vid_dim: 3072
14
+ txt_in_dim: 5120
15
+ txt_dim: ${.vid_dim}
16
+ emb_dim: ${eval:'6 * ${.vid_dim}'}
17
+ heads: 24
18
+ head_dim: 128 # llm-like
19
+ expand_ratio: 4
20
+ norm: fusedrms
21
+ norm_eps: 1e-5
22
+ ada: single
23
+ qk_bias: False
24
+ qk_rope: True
25
+ qk_norm: fusedrms
26
+ patch_size: [1, 2, 2]
27
+ num_layers: 36 # llm-like
28
+ shared_mlp: False
29
+ shared_qkv: False
30
+ mlp_type: normal
31
+ block_type: ${eval:'${.num_layers} * ["mmdit_sr"]'} # space-full
32
+ window: ${eval:'${.num_layers} * [(4,3,3)]'} # space-full
33
+ window_method: ${eval:'${.num_layers} // 2 * ["720pwin_by_size_bysize","720pswin_by_size_bysize"]'} # space-full
34
+ compile: False
35
+ gradient_checkpoint: True
36
+ fsdp:
37
+ sharding_strategy: _HYBRID_SHARD_ZERO2
38
+
39
+ ema:
40
+ decay: 0.9998
41
+
42
+ vae:
43
+ model:
44
+ __object__:
45
+ path: "video_vae_v3.modules.attn_video_vae"
46
+ name: "VideoAutoencoderKLWrapper"
47
+ args: "as_params"
48
+ freeze_encoder: False
49
+ # gradient_checkpoint: True
50
+ slicing:
51
+ split_size: 4
52
+ memory_device: same
53
+ memory_limit:
54
+ conv_max_mem: 0.5
55
+ norm_max_mem: 0.5
56
+ checkpoint: ema_vae_fp16.safetensors
57
+ scaling_factor: 0.9152
58
+ compile: False
59
+ grouping: False
60
+ dtype: float16
61
+
62
+ diffusion:
63
+ schedule:
64
+ type: lerp
65
+ T: 1000.0
66
+ sampler:
67
+ type: euler
68
+ prediction_type: v_lerp
69
+ timesteps:
70
+ training:
71
+ type: logitnormal
72
+ loc: 0.0
73
+ scale: 1.0
74
+ sampling:
75
+ type: uniform_trailing
76
+ steps: 50
77
+ transform: True
78
+ loss:
79
+ type: v_lerp
80
+ cfg:
81
+ scale: 7.5
82
+ rescale: 0
83
+
84
+ condition:
85
+ i2v: 0.0
86
+ v2v: 0.0
87
+ sr: 1.0
88
+ noise_scale: 0.25
neg_emb.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6a43e5800ef2354f1c156d27535834da055cbec8248298b8923492bba2076581
3
+ size 656540
pos_emb.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fa07a14844314772266b66c3b95deb0027696d8fe7065721263db5176f45d799
3
+ size 595100