biali wushuang98 commited on
Commit
ffff366
·
0 Parent(s):

Duplicate from wushuang98/Direct3D-S2

Browse files

Co-authored-by: Shuang Wu <wushuang98@users.noreply.huggingface.co>

.gitattributes ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ assets/teaserv6.png filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,109 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ tags:
4
+ - image-to-3d
5
+ - 3d-aigc
6
+ - 3d-reconstruction
7
+ - 3d-models
8
+ - 3d-generation
9
+ ---
10
+
11
+
12
+ # Direct3D‑S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention
13
+
14
+ <div align="center">
15
+ <a href=https://www.neural4d.com/research/direct3d-s2 target="_blank"><img src=https://img.shields.io/badge/Project%20Page-333399.svg?logo=googlehome height=22px></a>
16
+ <a href=https://huggingface.co/spaces/wushuang98/Direct3D-S2-v1.0-demo target="_blank"><img src=https://img.shields.io/badge/%F0%9F%A4%97%20Demo-276cb4.svg height=22px></a>
17
+ <a href=https://huggingface.co/spaces/wushuang98/Direct3D-S2-v1.0-demo target="_blank"><img src=https://img.shields.io/badge/%F0%9F%A4%97%20Models-d96902.svg height=22px></a>
18
+ <a href=https://arxiv.org/pdf/2505.17412 target="_blank"><img src=https://img.shields.io/badge/Arxiv-b5212f.svg?logo=arxiv height=22px></a>
19
+ </div>
20
+
21
+ <div style="background: #fff; box-shadow: 0 4px 12px rgba(0,0,0,.15); display: inline-block; padding: 0px;">
22
+ <img id="teaser" src="assets/teaserv6.png" alt="Teaser image of Direct3D-S2"/>
23
+ </div>
24
+
25
+ ---
26
+
27
+ ## ✨ News
28
+
29
+ - May 30, 2025: 🤯 We have released both v1.0 and v1.1. The new model offers even greater speed compared to FlashAttention-2, with **12.2×** faster forward pass and **19.7×** faster backward pass, resulting in nearly **2×** inference speedup over v1.0.
30
+ - May 30, 2025: 🔨 Release inference code and model.
31
+ - May 26, 2025: 🎁 Release live demo on 🤗 [Hugging Face](https://huggingface.co/spaces/wushuang98/Direct3D-S2-v1.0-demo).
32
+ - May 26, 2025: 🚀 Release paper and project page.
33
+
34
+ ## 📝 Abstract
35
+
36
+ Generating high-resolution 3D shapes using volumetric representations such as Signed Distance Functions (SDFs) presents substantial computational and memory challenges. We introduce <strong class="has-text-weight-bold">Direct3D‑S2</strong>, a scalable 3D generation framework based on sparse volumes that achieves superior output quality with dramatically reduced training costs. Our key innovation is the <strong class="has-text-weight-bold">Spatial Sparse Attention (SSA)</strong> mechanism, which greatly enhances the efficiency of Diffusion Transformer (DiT) computations on sparse volumetric data. SSA allows the model to effectively process large token sets within sparse volumes, substantially reducing computational overhead and achieving a <em>3.9&times;</em> speedup in the forward pass and a <em>9.6&times;</em> speedup in the backward pass. Our framework also includes a variational autoencoder (VAE) that maintains a consistent sparse volumetric format across input, latent, and output stages. Compared to previous methods with heterogeneous representations in 3D VAE, this unified design significantly improves training efficiency and stability. Our model is trained on public available datasets, and experiments demonstrate that <strong class="has-text-weight-bold">Direct3D‑S2</strong> not only surpasses state-of-the-art methods in generation quality and efficiency, but also enables <strong class="has-text-weight-bold">training at 1024<sup>3</sup> resolution with just 8 GPUs</strong>, a task typically requiring at least 32 GPUs for volumetric representations at 256<sup>3</sup> resolution, thus making gigascale 3D generation both practical and accessible.
37
+
38
+ ## 🌟 Highlight
39
+
40
+ - **Gigascale 3D Generation**: Direct3D-S2 enables training at 1024<sup>3</sup> resolution with only 8 GPUs.
41
+ - **Spatial Sparse Attention (SSA)**: A novel attention mechanism designed for sparse volumetric data, enabling efficient processing of large token sets.
42
+ - **Unified Sparse VAE**: A variational autoencoder that maintains a consistent sparse volumetric format across input, latent, and output stages, improving training efficiency and stability.
43
+
44
+ ## 🚀 Getting Started
45
+
46
+ ### Installation
47
+
48
+ ```sh
49
+ git clone https://github.com/DreamTechAI/Direct3D-S2.git
50
+
51
+ cd Direct3D-S2
52
+
53
+ pip install -r requirements.txt
54
+
55
+ pip install -e .
56
+
57
+ ```
58
+
59
+ ### Usage
60
+
61
+ ```python
62
+ from direct3d_s2.pipeline import Direct3DS2Pipeline
63
+ pipeline = Direct3DS2Pipeline.from_pretrained(
64
+ 'wushuang98/Direct3D-S2',
65
+ subfolder="direct3d-s2-v-1-1"
66
+ ).to("cuda:0")
67
+
68
+ mesh = pipeline(
69
+ 'assets/test/13.png',
70
+ sdf_resolution=1024, # 512 or 1024
71
+ remesh=False, # Switch to True if you need to reduce the number of triangles.
72
+ )["mesh"]
73
+
74
+ mesh.export('output.obj')
75
+ ```
76
+
77
+ ### Web Demo
78
+
79
+ We provide a Gradio web demo for Direct3D-S2, which allows you to generate 3D meshes from images interactively.
80
+
81
+ ```bash
82
+ python app.py
83
+ ```
84
+
85
+ ## 🤗 Acknowledgements
86
+
87
+ Thanks to the following repos for their great work, which helps us a lot in the development of Direct3D-S2:
88
+
89
+ - [Trellis](https://github.com/microsoft/TRELLIS)
90
+ - [SparseFlex](https://github.com/VAST-AI-Research/TripoSF)
91
+ - [native-sparse-attention-triton](https://github.com/XunhaoLai/native-sparse-attention-triton)
92
+ - [diffusers](https://github.com/huggingface/diffusers)
93
+
94
+ ## 📄 License
95
+
96
+ Direct3D-S2 is released under the MIT License. See [LICENSE](LICENSE) for details.
97
+
98
+ ## 📖 Citation
99
+
100
+ If you find our work useful, please consider citing our paper:
101
+
102
+ ```bibtex
103
+ @article{wu2025direct3ds2gigascale3dgeneration,
104
+ title={Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention},
105
+ author={Shuang Wu and Youtian Lin and Feihu Zhang and Yifei Zeng and Yikang Yang and Yajie Bao and Jiachen Qian and Siyu Zhu and Philip Torr and Xun Cao and Yao Yao},
106
+ journal={arXiv preprint arXiv:2505.17412},
107
+ year={2025}
108
+ }
109
+ ```
assets/teaserv6.png ADDED

Git LFS Details

  • SHA256: 4e58eefff81cee52dbc11d65949fe99c3e8b23e2a0a5e677505aca8799a22564
  • Pointer size: 132 Bytes
  • Size of remote file: 3.28 MB
config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "Name": [
3
+ "Direct3D-S2"
4
+ ],
5
+ }
direct3d-s2-v-1-0/config.yaml ADDED
@@ -0,0 +1,171 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ dense_vae:
2
+ target: direct3d_s2.models.autoencoders.dense_vae.DenseShapeVAE
3
+ params:
4
+ use_checkpoint: true
5
+ embed_dim: 8
6
+ in_channels: 1
7
+ out_channels: 1
8
+ model_channels_encoder: [32, 128, 512]
9
+ num_res_blocks_encoder: 2
10
+ num_res_blocks_middle_encoder: 2
11
+ model_channels_decoder: [512, 128, 64]
12
+ num_res_blocks_decoder: 4
13
+ num_res_blocks_middle_decoder: 4
14
+ use_fp16: true
15
+ latents_scale: 1.0
16
+ latents_shift: 0.0
17
+
18
+ dense_dit:
19
+ target: direct3d_s2.models.transformers.dense_dit.DenseDiT
20
+ params:
21
+ resolution: 16
22
+ in_channels: 8
23
+ out_channels: 8
24
+ model_channels: 1024
25
+ cond_channels: 1024
26
+ num_blocks: 24
27
+ num_heads: 16
28
+ mlp_ratio: 4
29
+ patch_size: 1
30
+ pe_mode: ape
31
+ qk_rms_norm: true
32
+ use_checkpoint: true
33
+ use_fp16: true
34
+ latent_shape: [8, 16, 16, 16]
35
+
36
+ dense_image_encoder:
37
+ target: direct3d_s2.models.conditioner.DinoEncoder
38
+ params:
39
+ model: facebookresearch/dinov2
40
+ version: dinov2_vitl14_reg
41
+ size: 518
42
+
43
+ dense_scheduler:
44
+ target: diffusers.schedulers.FlowMatchEulerDiscreteScheduler
45
+ params:
46
+ num_train_timesteps: 1000
47
+ shift: 6.0
48
+
49
+ sparse_vae_512:
50
+ target: direct3d_s2.models.autoencoders.ss_vae.SparseSDFVAE
51
+ params:
52
+ use_checkpoint: true
53
+ embed_dim: 16
54
+ num_head_channels_encoder: 64
55
+ model_channels_encoder: 512
56
+ num_heads_encoder: 8
57
+ num_blocks_encoder: 4
58
+ num_head_channels_decoder: 64
59
+ model_channels_decoder: 512
60
+ num_heads_decoder: 8
61
+ num_blocks_decoder: 4
62
+ resolution: 64
63
+ out_channels: 1
64
+ use_fp16: true
65
+ latents_scale: 1.0
66
+ latents_shift: 0.0
67
+
68
+ sparse_dit_512:
69
+ target: direct3d_s2.models.transformers.sparse_dit.SparseDiT
70
+ params:
71
+ resolution: 64
72
+ in_channels: 16
73
+ out_channels: 16
74
+ model_channels: 1024
75
+ cond_channels: 1024
76
+ num_blocks: 24
77
+ num_heads: 32
78
+ num_kv_heads: 2
79
+ compression_block_size: 4
80
+ selection_block_size: 8
81
+ topk: 32
82
+ compression_version: v2
83
+ pe_mode: ape
84
+ factor: 1.0
85
+ sparse_conditions: true
86
+ qk_rms_norm: true
87
+ use_shift: true
88
+ use_checkpoint: true
89
+ use_fp16: true
90
+
91
+ sparse_scheduler_512:
92
+ target: diffusers.schedulers.FlowMatchEulerDiscreteScheduler
93
+ params:
94
+ num_train_timesteps: 1000
95
+ shift: 6.0
96
+
97
+ sparse_vae_1024:
98
+ target: direct3d_s2.models.autoencoders.ss_vae.SparseSDFVAE
99
+ params:
100
+ use_checkpoint: true
101
+ embed_dim: 16
102
+ num_head_channels_encoder: 64
103
+ model_channels_encoder: 512
104
+ num_heads_encoder: 8
105
+ num_blocks_encoder: 4
106
+ num_head_channels_decoder: 64
107
+ model_channels_decoder: 512
108
+ num_heads_decoder: 8
109
+ num_blocks_decoder: 4
110
+ resolution: 128
111
+ out_channels: 1
112
+ use_fp16: true
113
+ latents_scale: 1.0
114
+ latents_shift: 0.0
115
+ chunk_size: 4
116
+
117
+ sparse_dit_1024:
118
+ target: direct3d_s2.models.transformers.sparse_dit.SparseDiT
119
+ params:
120
+ resolution: 128
121
+ in_channels: 16
122
+ out_channels: 16
123
+ model_channels: 1024
124
+ cond_channels: 1024
125
+ num_blocks: 24
126
+ num_heads: 32
127
+ num_kv_heads: 2
128
+ compression_block_size: 4
129
+ selection_block_size: 8
130
+ topk: 8
131
+ compression_version: v2
132
+ pe_mode: ape
133
+ factor: 0.5
134
+ sparse_conditions: true
135
+ qk_rms_norm: true
136
+ use_shift: true
137
+ use_checkpoint: true
138
+ use_fp16: true
139
+
140
+ sparse_scheduler_1024:
141
+ target: diffusers.schedulers.FlowMatchEulerDiscreteScheduler
142
+ params:
143
+ num_train_timesteps: 1000
144
+ shift: 8.0
145
+
146
+ sparse_image_encoder:
147
+ target: direct3d_s2.models.conditioner.DinoEncoder
148
+ params:
149
+ model: facebookresearch/dinov2
150
+ version: dinov2_vitl14_reg
151
+ size: 518
152
+
153
+ refiner:
154
+ target: direct3d_s2.models.refiner.unet_refiner.Voxel_RefinerXL
155
+ params:
156
+ in_channels: 1
157
+ out_channels: 1
158
+ layers_per_block: 2
159
+ layers_mid_block: 2
160
+ patch_size: 192
161
+ use_fp16: true
162
+
163
+ refiner_1024:
164
+ target: direct3d_s2.models.refiner.unet_refiner.Voxel_RefinerXL_sign
165
+ params:
166
+ in_channels: 1
167
+ out_channels: 1
168
+ layers_per_block: 2
169
+ layers_mid_block: 2
170
+ patch_size: 256
171
+ use_fp16: true
direct3d-s2-v-1-0/model_dense.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5e6598155f907ca15eb9e4fb96905f9df4d10ebc319f9567ea947db8c684d8fd
3
+ size 1505767932
direct3d-s2-v-1-0/model_refiner.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2eb0f70d323a43d63ab37c91790c8a7c2b9ada1d7771ffe99ef7a647bdbc99e4
3
+ size 269562302
direct3d-s2-v-1-0/model_refiner_1024.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e75e405067f5c3eed48b2e46ee752e1f6593bf9a0db421cb4d694a677958460a
3
+ size 269498584
direct3d-s2-v-1-0/model_sparse_1024.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b2fe3f7daab2a07b99248665501ddb52ced65b632557688227921b79faf8b9a1
3
+ size 1116239946
direct3d-s2-v-1-0/model_sparse_512.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9cc7fe7d4978cf8ff96121ece226b5344c543486283f05d108b7acb3126f0c69
3
+ size 1116238952
direct3d-s2-v-1-1/config.yaml ADDED
@@ -0,0 +1,171 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ dense_vae:
2
+ target: direct3d_s2.models.autoencoders.dense_vae.DenseShapeVAE
3
+ params:
4
+ use_checkpoint: true
5
+ embed_dim: 8
6
+ in_channels: 1
7
+ out_channels: 1
8
+ model_channels_encoder: [32, 128, 512]
9
+ num_res_blocks_encoder: 2
10
+ num_res_blocks_middle_encoder: 2
11
+ model_channels_decoder: [512, 128, 64]
12
+ num_res_blocks_decoder: 4
13
+ num_res_blocks_middle_decoder: 4
14
+ use_fp16: true
15
+ latents_scale: 1.0
16
+ latents_shift: 0.0
17
+
18
+ dense_dit:
19
+ target: direct3d_s2.models.transformers.dense_dit.DenseDiT
20
+ params:
21
+ resolution: 16
22
+ in_channels: 8
23
+ out_channels: 8
24
+ model_channels: 1024
25
+ cond_channels: 1024
26
+ num_blocks: 24
27
+ num_heads: 16
28
+ mlp_ratio: 4
29
+ patch_size: 1
30
+ pe_mode: ape
31
+ qk_rms_norm: true
32
+ use_checkpoint: true
33
+ use_fp16: true
34
+ latent_shape: [8, 16, 16, 16]
35
+
36
+ dense_image_encoder:
37
+ target: direct3d_s2.models.conditioner.DinoEncoder
38
+ params:
39
+ model: facebookresearch/dinov2
40
+ version: dinov2_vitl14_reg
41
+ size: 518
42
+
43
+ dense_scheduler:
44
+ target: diffusers.schedulers.FlowMatchEulerDiscreteScheduler
45
+ params:
46
+ num_train_timesteps: 1000
47
+ shift: 6.0
48
+
49
+ sparse_vae_512:
50
+ target: direct3d_s2.models.autoencoders.ss_vae.SparseSDFVAE
51
+ params:
52
+ use_checkpoint: true
53
+ embed_dim: 16
54
+ num_head_channels_encoder: 64
55
+ model_channels_encoder: 512
56
+ num_heads_encoder: 8
57
+ num_blocks_encoder: 4
58
+ num_head_channels_decoder: 64
59
+ model_channels_decoder: 512
60
+ num_heads_decoder: 8
61
+ num_blocks_decoder: 4
62
+ resolution: 64
63
+ out_channels: 1
64
+ use_fp16: true
65
+ latents_scale: 1.0
66
+ latents_shift: 0.0
67
+
68
+ sparse_dit_512:
69
+ target: direct3d_s2.models.transformers.sparse_dit.SparseDiT
70
+ params:
71
+ resolution: 64
72
+ in_channels: 16
73
+ out_channels: 16
74
+ model_channels: 1024
75
+ cond_channels: 1024
76
+ num_blocks: 24
77
+ num_heads: 32
78
+ num_kv_heads: 2
79
+ compression_block_size: 8
80
+ selection_block_size: 8
81
+ topk: 8
82
+ compression_version: v1
83
+ pe_mode: ape
84
+ factor: 1.0
85
+ sparse_conditions: false
86
+ qk_rms_norm: true
87
+ use_shift: true
88
+ use_checkpoint: true
89
+ use_fp16: true
90
+
91
+ sparse_scheduler_512:
92
+ target: diffusers.schedulers.FlowMatchEulerDiscreteScheduler
93
+ params:
94
+ num_train_timesteps: 1000
95
+ shift: 6.0
96
+
97
+ sparse_vae_1024:
98
+ target: direct3d_s2.models.autoencoders.ss_vae.SparseSDFVAE
99
+ params:
100
+ use_checkpoint: true
101
+ embed_dim: 16
102
+ num_head_channels_encoder: 64
103
+ model_channels_encoder: 512
104
+ num_heads_encoder: 8
105
+ num_blocks_encoder: 4
106
+ num_head_channels_decoder: 64
107
+ model_channels_decoder: 512
108
+ num_heads_decoder: 8
109
+ num_blocks_decoder: 4
110
+ resolution: 128
111
+ out_channels: 1
112
+ use_fp16: true
113
+ latents_scale: 1.0
114
+ latents_shift: 0.0
115
+ chunk_size: 4
116
+
117
+ sparse_dit_1024:
118
+ target: direct3d_s2.models.transformers.sparse_dit.SparseDiT
119
+ params:
120
+ resolution: 128
121
+ in_channels: 16
122
+ out_channels: 16
123
+ model_channels: 1024
124
+ cond_channels: 1024
125
+ num_blocks: 24
126
+ num_heads: 32
127
+ num_kv_heads: 2
128
+ compression_block_size: 8
129
+ selection_block_size: 8
130
+ topk: 8
131
+ compression_version: v1
132
+ pe_mode: ape
133
+ factor: 0.5
134
+ sparse_conditions: false
135
+ qk_rms_norm: true
136
+ use_shift: true
137
+ use_checkpoint: true
138
+ use_fp16: true
139
+
140
+ sparse_scheduler_1024:
141
+ target: diffusers.schedulers.FlowMatchEulerDiscreteScheduler
142
+ params:
143
+ num_train_timesteps: 1000
144
+ shift: 8.0
145
+
146
+ sparse_image_encoder:
147
+ target: direct3d_s2.models.conditioner.DinoEncoder
148
+ params:
149
+ model: facebookresearch/dinov2
150
+ version: dinov2_vitl14_reg
151
+ size: 518
152
+
153
+ refiner:
154
+ target: direct3d_s2.models.refiner.unet_refiner.Voxel_RefinerXL
155
+ params:
156
+ in_channels: 1
157
+ out_channels: 1
158
+ layers_per_block: 2
159
+ layers_mid_block: 2
160
+ patch_size: 192
161
+ use_fp16: true
162
+
163
+ refiner_1024:
164
+ target: direct3d_s2.models.refiner.unet_refiner.Voxel_RefinerXL_sign
165
+ params:
166
+ in_channels: 1
167
+ out_channels: 1
168
+ layers_per_block: 2
169
+ layers_mid_block: 2
170
+ patch_size: 256
171
+ use_fp16: true
direct3d-s2-v-1-1/model_dense.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5e6598155f907ca15eb9e4fb96905f9df4d10ebc319f9567ea947db8c684d8fd
3
+ size 1505767932
direct3d-s2-v-1-1/model_refiner.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2eb0f70d323a43d63ab37c91790c8a7c2b9ada1d7771ffe99ef7a647bdbc99e4
3
+ size 269562302
direct3d-s2-v-1-1/model_refiner_1024.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e75e405067f5c3eed48b2e46ee752e1f6593bf9a0db421cb4d694a677958460a
3
+ size 269498584
direct3d-s2-v-1-1/model_sparse_1024.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c3349a91b1ee0d5843bfca4077e4d526f8e0856bd8a03c9f097b3312f386642d
3
+ size 1094546938
direct3d-s2-v-1-1/model_sparse_512.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c54cd5527d6b040a931e00f7f6edd9460180726bce21cde03c7fe5c4f646e151
3
+ size 1094546234