WopperSet commited on
Commit
72afa4e
·
verified ·
1 Parent(s): 6bc0124

Upload folder using huggingface_hub

Browse files
checkpoint.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3a5d906d64f23927c0ab433e67cecc51f86c08787179ea81db7560eb01e86cad
3
+ size 3775448385
condition_embedder.ckpt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:75c09b31c05ea2d05d0cff6b59bc325fb1ba3c34f7a68e46730584fa9cf482f6
3
+ size 2538205923
galp.yaml ADDED
@@ -0,0 +1,130 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ module:
2
+ condition_embedder:
3
+ backbone:
4
+ _target_: sam3d_objects.model.backbone.dit.embedder.embedder_fuser.EmbedderFuser
5
+ embedder_list:
6
+ - - _target_: sam3d_objects.model.backbone.dit.embedder.dino.Dino
7
+ dino_model: dinov2_vitl14_reg
8
+ input_size: 518
9
+ normalize_images: true
10
+ - - - rgb_image
11
+ - full
12
+ - - _target_: sam3d_objects.model.backbone.dit.embedder.dino.Dino
13
+ dino_model: dinov2_vitl14_reg
14
+ input_size: 518
15
+ normalize_images: true
16
+ - - - rgb_image_mask
17
+ - full
18
+ - - _target_: sam3d_objects.model.backbone.dit.embedder.pointmap.PointPatchEmbed
19
+ embed_dim: 512
20
+ input_size: 256
21
+ patch_size: 8
22
+ remap_output: linear
23
+ - - - pointmap
24
+ - cropped
25
+ - - rgb_pointmap
26
+ - full
27
+ freeze: true
28
+ projection_net_hidden_dim_multiplier: 4.0
29
+ use_pos_embedding: learned
30
+ generator:
31
+ backbone:
32
+ _target_: src.sam3d_objects.model.backbone.generator.shortcut.model.ShortCut
33
+ batch_mode: true
34
+ cfg_modalities:
35
+ - shape
36
+ inference_steps: 2
37
+ loss_weights:
38
+ 6drotation_normalized: 0.1
39
+ _target_: src.sam3d_objects.config.utils.make_dict
40
+ scale: 0.1
41
+ shape: 0
42
+ translation: 1.0
43
+ ratio_cfg_samples_in_self_consistency_target: 0.25
44
+ rescale_t: 1
45
+ reverse_fn:
46
+ _target_: src.sam3d_objects.model.backbone.generator.classifier_free_guidance.ClassifierFreeGuidanceWithExternalUnconditionalProbability
47
+ backbone:
48
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mot_sparse_structure_flow.SparseStructureFlowTdfyWrapper
49
+ cond_channels: 1024
50
+ condition_embedder: null
51
+ force_zeros_cond: true
52
+ freeze_d_time_embedder: true
53
+ freeze_shared_parameters: true
54
+ in_channels: 8
55
+ is_shortcut_model: false
56
+ latent_mapping:
57
+ 6drotation_normalized:
58
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.Latent_out
59
+ in_channels: 6
60
+ model_channels: 1024
61
+ pos_embedder:
62
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.LearntPositionEmbedder
63
+ model_channels: 1024
64
+ token_len: 1
65
+ scale:
66
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.Latent_out
67
+ in_channels: 3
68
+ model_channels: 1024
69
+ pos_embedder:
70
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.LearntPositionEmbedder
71
+ model_channels: 1024
72
+ token_len: 1
73
+ shape:
74
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.Latent_in
75
+ in_channels: 8
76
+ model_channels: 1024
77
+ pos_embedder:
78
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.ShapePositionEmbedder
79
+ model_channels: 1024
80
+ patch_size: 1
81
+ resolution: 8
82
+ translation:
83
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.Latent_out
84
+ in_channels: 3
85
+ model_channels: 1024
86
+ pos_embedder:
87
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.LearntPositionEmbedder
88
+ model_channels: 1024
89
+ token_len: 1
90
+ xz2f_rot:
91
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.Latent_out
92
+ in_channels: 6
93
+ model_channels: 1024
94
+ pos_embedder:
95
+ _target_: src.sam3d_objects.model.backbone.tdfy_dit.models.mm_latent.LearntPositionEmbedder
96
+ model_channels: 1024
97
+ token_len: 1
98
+ latent_share_transformer:
99
+ 6drotation_normalized:
100
+ - 6drotation_normalized
101
+ - translation
102
+ - scale
103
+ - xz2f_rot
104
+ mlp_ratio: 4
105
+ model_channels: 1024
106
+ num_blocks: 24
107
+ num_heads: 16
108
+ out_channels: 8
109
+ patch_size: 1
110
+ pe_mode: ape
111
+ qk_rms_norm: true
112
+ resolution: 16
113
+ use_checkpoint: false
114
+ use_fp16: false
115
+ interval:
116
+ - 0
117
+ - 500
118
+ p_unconditional: 0.1
119
+ strength: 2.0
120
+ unconditional_handling: add_flag
121
+ self_consistency_cfg_strength: 2.0
122
+ self_consistency_prob: 0.25
123
+ shortcut_loss_weight: 1.0
124
+ sigma_min: 0.0
125
+ time_scale: 1000.0
126
+ training_time_sampler_fn:
127
+ _partial_: true
128
+ _target_: src.sam3d_objects.model.backbone.generator.flow_matching.model.lognorm_sampler
129
+ mean: -1.0
130
+ std: 1.0
pipeline.yaml ADDED
@@ -0,0 +1,102 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _target_: src.sam3d_objects.pipeline.inference_pipeline_pointmap.InferencePipelinePointMap
2
+ ss_generator_config_path: ss_generator.yaml
3
+ ss_generator_ckpt_path: ss_generator.ckpt
4
+ slat_generator_config_path: slat_generator.yaml
5
+ slat_generator_ckpt_path: slat_generator.ckpt
6
+ ss_decoder_config_path: ss_decoder.yaml
7
+ ss_decoder_ckpt_path: ss_decoder.ckpt
8
+ slat_decoder_gs_config_path: slat_decoder_gs.yaml
9
+ slat_decoder_gs_ckpt_path: slat_decoder_gs.ckpt
10
+ slat_decoder_gs_4_config_path: slat_decoder_gs_4.yaml
11
+ slat_decoder_gs_4_ckpt_path: slat_decoder_gs_4.ckpt
12
+ slat_decoder_mesh_config_path: slat_decoder_mesh.yaml
13
+ slat_decoder_mesh_ckpt_path: slat_decoder_mesh.ckpt
14
+ pad_size: 1.0
15
+ dtype: float16
16
+ version: 3dfy_v9
17
+ slat_cfg_strength: 1
18
+ slat_rescale_t: 1
19
+ downsample_ss_dist: 1
20
+ compile_model: true
21
+ ss_condition_input_mapping: []
22
+ ss_preprocessor:
23
+ _target_: src.sam3d_objects.data.dataset.tdfy.preprocessor.PreProcessor
24
+ img_mask_joint_transform: []
25
+ img_mask_pointmap_joint_transform:
26
+ - _partial_: true
27
+ _target_: src.sam3d_objects.data.dataset.tdfy.img_and_mask_transforms.resize_all_to_same_size
28
+ - _partial_: true
29
+ _target_: src.sam3d_objects.data.dataset.tdfy.img_and_mask_transforms.crop_around_mask_with_padding
30
+ box_size_factor: 1.2
31
+ padding_factor: 0.0
32
+ img_transform:
33
+ _target_: torchvision.transforms.Compose
34
+ transforms:
35
+ - _partial_: true
36
+ _target_: src.sam3d_objects.data.dataset.tdfy.img_processing.pad_to_square_centered
37
+ - _target_: torchvision.transforms.Resize
38
+ size: 518
39
+ mask_transform:
40
+ _target_: torchvision.transforms.Compose
41
+ transforms:
42
+ - _partial_: true
43
+ _target_: src.sam3d_objects.data.dataset.tdfy.img_processing.pad_to_square_centered
44
+ - _target_: torchvision.transforms.Resize
45
+ interpolation: 0
46
+ size: 518
47
+ normalize_pointmap: false
48
+ pointmap_transform:
49
+ _target_: torchvision.transforms.Compose
50
+ transforms:
51
+ - _partial_: true
52
+ _target_: src.sam3d_objects.data.dataset.tdfy.img_processing.pad_to_square_centered
53
+ - _target_: torchvision.transforms.Resize
54
+ interpolation: 0
55
+ size: 518
56
+ pose_decoder_name: ScaleShiftInvariant
57
+ depth_model:
58
+ _target_: src.sam3d_objects.pipeline.depth_models.moge.MoGe
59
+ model:
60
+ _target_: moge.model.v1.MoGeModel.from_pretrained
61
+ pretrained_model_name_or_path: Ruicheng/moge-vitl
62
+ slat_condition_input_mapping: []
63
+ slat_preprocessor:
64
+ _target_: src.sam3d_objects.data.dataset.tdfy.preprocessor.PreProcessor
65
+ img_transform:
66
+ _target_: torchvision.transforms.Compose
67
+ transforms:
68
+ - _target_: src.sam3d_objects.data.dataset.tdfy.img_processing.pad_to_square_centered
69
+ _partial_: true
70
+ - _target_: torchvision.transforms.Resize
71
+ size: 518
72
+ mask_transform:
73
+ _target_: torchvision.transforms.Compose
74
+ transforms:
75
+ - _target_: src.sam3d_objects.data.dataset.tdfy.img_processing.pad_to_square_centered
76
+ _partial_: true
77
+ - _target_: torchvision.transforms.Resize
78
+ size: 518
79
+ interpolation: 0
80
+ img_mask_joint_transform:
81
+ - _target_: src.sam3d_objects.data.dataset.tdfy.img_and_mask_transforms.crop_around_mask_with_padding
82
+ _partial_: true
83
+ box_size_factor: 1.2
84
+ padding_factor: 0.0
85
+ slat_mean:
86
+ - 0.12211431
87
+ - 0.37204156
88
+ - -1.26521907
89
+ - -2.05276058
90
+ - -3.10432536
91
+ - -0.11294304
92
+ - -0.85146744
93
+ - 0.45506954
94
+ slat_std:
95
+ - 2.37326008
96
+ - 2.13174402
97
+ - 2.2413953
98
+ - 2.30589401
99
+ - 2.1191894
100
+ - 1.8969511
101
+ - 2.41684989
102
+ - 2.08374642
ss_enc_conv3d_16l8_fp16.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+
2
+ {
3
+ "name": "SparseStructureEncoder",
4
+ "args": {
5
+ "in_channels": 1,
6
+ "latent_channels": 8,
7
+ "num_res_blocks": 2,
8
+ "num_res_blocks_middle": 2,
9
+ "channels": [32, 128, 512],
10
+ "use_fp16": true
11
+ }
12
+ }
ss_enc_conv3d_16l8_fp16.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:107874eeaa0feb82f51b19db5da7db534fb7e7f19e5a122b9ff1bc2e258bfc6d
3
+ size 119068016
ss_encoder.yaml ADDED
File without changes