jamal-one commited on
Commit
e3ea216
·
verified ·
1 Parent(s): c4d23ac

Upload PyraFuse v1.0.0 checkpoints

Browse files

Publish small, small_plus, base, and large PyTorch checkpoint bundles for skin-fabric-background segmentation.

.gitkeep ADDED
File without changes
base/backbone/config.json ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "apply_layernorm": true,
3
+ "architectures": [
4
+ "DINOv3ViTModel"
5
+ ],
6
+ "attention_dropout": 0.0,
7
+ "drop_path_rate": 0.0,
8
+ "dtype": "float32",
9
+ "hidden_act": "gelu",
10
+ "hidden_size": 768,
11
+ "image_size": 224,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 3072,
14
+ "key_bias": false,
15
+ "layer_norm_eps": 1e-05,
16
+ "layerscale_value": 1.0,
17
+ "mlp_bias": true,
18
+ "model_type": "dinov3_vit",
19
+ "num_attention_heads": 12,
20
+ "num_channels": 3,
21
+ "num_hidden_layers": 12,
22
+ "num_register_tokens": 4,
23
+ "out_features": [
24
+ "stage12"
25
+ ],
26
+ "out_indices": [
27
+ 12
28
+ ],
29
+ "patch_size": 16,
30
+ "pos_embed_jitter": null,
31
+ "pos_embed_rescale": 2.0,
32
+ "pos_embed_shift": null,
33
+ "proj_bias": true,
34
+ "query_bias": true,
35
+ "reshape_hidden_states": true,
36
+ "rope_theta": 100.0,
37
+ "stage_names": [
38
+ "stem",
39
+ "stage1",
40
+ "stage2",
41
+ "stage3",
42
+ "stage4",
43
+ "stage5",
44
+ "stage6",
45
+ "stage7",
46
+ "stage8",
47
+ "stage9",
48
+ "stage10",
49
+ "stage11",
50
+ "stage12"
51
+ ],
52
+ "transformers_version": "5.12.0",
53
+ "use_gated_mlp": false,
54
+ "value_bias": true
55
+ }
base/backbone/feature_norms.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4d5a61faad4dd91304479c1754e0fd636738e54cb802e833884c307df043a5
3
+ size 28257
base/backbone/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9a21ac3df0c63839d62612dda6f454d816c25611cc7a52966ed5a5a94921dc8b
3
+ size 342662192
base/config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "encoder_type": "dinov3",
3
+ "encoder_model_id": "facebook/dinov3-vitb16-pretrain-lvd1689m",
4
+ "text_prompts": null,
5
+ "decoder_type": "pyrafuse",
6
+ "num_classes": 3,
7
+ "decoder_channels": 128,
8
+ "image_size": 448,
9
+ "use_bn": false,
10
+ "drop_path_rate": 0.05,
11
+ "dropout": 0.1,
12
+ "num_queries": 10,
13
+ "num_transformer_layers": 3,
14
+ "freeze_backbone": true,
15
+ "ema_decay": 0.9995
16
+ }
base/decoder.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:adfdd5b87ac8aa6fb7d8292039e47b5d4ffb226c4dd717f62ecd77e7bcde349d
3
+ size 5033596
base/ema.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b6493e86f55c7623ce4edc134c40067a2798af0d565eb0eff93ad3a4c950f37
3
+ size 347766007
large/backbone/config.json ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "apply_layernorm": true,
3
+ "architectures": [
4
+ "DINOv3ViTModel"
5
+ ],
6
+ "attention_dropout": 0.0,
7
+ "drop_path_rate": 0.0,
8
+ "dtype": "float32",
9
+ "hidden_act": "gelu",
10
+ "hidden_size": 1024,
11
+ "image_size": 224,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "key_bias": false,
15
+ "layer_norm_eps": 1e-05,
16
+ "layerscale_value": 1.0,
17
+ "mlp_bias": true,
18
+ "model_type": "dinov3_vit",
19
+ "num_attention_heads": 16,
20
+ "num_channels": 3,
21
+ "num_hidden_layers": 24,
22
+ "num_register_tokens": 4,
23
+ "out_features": [
24
+ "stage24"
25
+ ],
26
+ "out_indices": [
27
+ 24
28
+ ],
29
+ "patch_size": 16,
30
+ "pos_embed_jitter": null,
31
+ "pos_embed_rescale": 2.0,
32
+ "pos_embed_shift": null,
33
+ "proj_bias": true,
34
+ "query_bias": true,
35
+ "reshape_hidden_states": true,
36
+ "rope_theta": 100.0,
37
+ "stage_names": [
38
+ "stem",
39
+ "stage1",
40
+ "stage2",
41
+ "stage3",
42
+ "stage4",
43
+ "stage5",
44
+ "stage6",
45
+ "stage7",
46
+ "stage8",
47
+ "stage9",
48
+ "stage10",
49
+ "stage11",
50
+ "stage12",
51
+ "stage13",
52
+ "stage14",
53
+ "stage15",
54
+ "stage16",
55
+ "stage17",
56
+ "stage18",
57
+ "stage19",
58
+ "stage20",
59
+ "stage21",
60
+ "stage22",
61
+ "stage23",
62
+ "stage24"
63
+ ],
64
+ "transformers_version": "5.12.0",
65
+ "use_gated_mlp": false,
66
+ "value_bias": true
67
+ }
large/backbone/feature_norms.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:574a36d1d0113200e90db2139fb70733be3a51e26334d0ca96fa5a2caa9606db
3
+ size 36449
large/backbone/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dcb2e45127cccbf1601e5f42fef165eea275c8e5213197e8dcf3f48822718179
3
+ size 1212559808
large/config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "encoder_type": "dinov3",
3
+ "encoder_model_id": "facebook/dinov3-vitl16-pretrain-lvd1689m",
4
+ "text_prompts": null,
5
+ "decoder_type": "pyrafuse",
6
+ "num_classes": 3,
7
+ "decoder_channels": 128,
8
+ "image_size": 448,
9
+ "use_bn": false,
10
+ "drop_path_rate": 0.05,
11
+ "dropout": 0.1,
12
+ "num_queries": 10,
13
+ "num_transformer_layers": 3,
14
+ "freeze_backbone": true,
15
+ "ema_decay": 0.9995
16
+ }
large/decoder.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:115df5d62da6be30a735ff7c65ed144436a8b1f5e1cfd1fee4c7f63b6cfa927c
3
+ size 5557884
large/ema.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:005780d62e1fb2c0dc0009a6faf237d9333b7523d529f2e183de5e3395cf16a1
3
+ size 1218240175
small/backbone/config.json ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "apply_layernorm": true,
3
+ "architectures": [
4
+ "DINOv3ViTModel"
5
+ ],
6
+ "attention_dropout": 0.0,
7
+ "drop_path_rate": 0.0,
8
+ "dtype": "float32",
9
+ "hidden_act": "gelu",
10
+ "hidden_size": 384,
11
+ "image_size": 224,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 1536,
14
+ "key_bias": false,
15
+ "layer_norm_eps": 1e-05,
16
+ "layerscale_value": 1.0,
17
+ "mlp_bias": true,
18
+ "model_type": "dinov3_vit",
19
+ "num_attention_heads": 6,
20
+ "num_channels": 3,
21
+ "num_hidden_layers": 12,
22
+ "num_register_tokens": 4,
23
+ "out_features": [
24
+ "stage12"
25
+ ],
26
+ "out_indices": [
27
+ 12
28
+ ],
29
+ "patch_size": 16,
30
+ "pos_embed_jitter": null,
31
+ "pos_embed_rescale": 2.0,
32
+ "pos_embed_shift": null,
33
+ "proj_bias": true,
34
+ "query_bias": true,
35
+ "reshape_hidden_states": true,
36
+ "rope_theta": 100.0,
37
+ "stage_names": [
38
+ "stem",
39
+ "stage1",
40
+ "stage2",
41
+ "stage3",
42
+ "stage4",
43
+ "stage5",
44
+ "stage6",
45
+ "stage7",
46
+ "stage8",
47
+ "stage9",
48
+ "stage10",
49
+ "stage11",
50
+ "stage12"
51
+ ],
52
+ "transformers_version": "5.12.0",
53
+ "use_gated_mlp": false,
54
+ "value_bias": true
55
+ }
small/backbone/feature_norms.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:63c9e79901c942663e78a16fb4eefe54a12b5a0411797f3c5b4d6b57b3534204
3
+ size 15969
small/backbone/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4610ad75edef83e75afdebf162d148dc628045ea6cbb83d67d4708c709c4f91d
3
+ size 86406384
small/config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "encoder_type": "dinov3",
3
+ "encoder_model_id": "facebook/dinov3-vits16-pretrain-lvd1689m",
4
+ "text_prompts": null,
5
+ "decoder_type": "pyrafuse",
6
+ "num_classes": 3,
7
+ "decoder_channels": 128,
8
+ "image_size": 448,
9
+ "use_bn": false,
10
+ "drop_path_rate": 0.05,
11
+ "dropout": 0.1,
12
+ "num_queries": 10,
13
+ "num_transformer_layers": 3,
14
+ "freeze_backbone": true,
15
+ "ema_decay": 0.9995
16
+ }
small/decoder.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b3d1f92e74a01b95020ceabb8be78e036eb44a0afb89c7282edc46748867dfd2
3
+ size 4247164
small/ema.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:70e24d7b4e16d0c57951467d8f51fc9678def698bb5995492b6860b35dd96449
3
+ size 90711799
small_plus/backbone/config.json ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "apply_layernorm": true,
3
+ "architectures": [
4
+ "DINOv3ViTModel"
5
+ ],
6
+ "attention_dropout": 0.0,
7
+ "drop_path_rate": 0.0,
8
+ "dtype": "float32",
9
+ "hidden_act": "silu",
10
+ "hidden_size": 384,
11
+ "image_size": 224,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 1536,
14
+ "key_bias": false,
15
+ "layer_norm_eps": 1e-05,
16
+ "layerscale_value": 1.0,
17
+ "mlp_bias": true,
18
+ "model_type": "dinov3_vit",
19
+ "num_attention_heads": 6,
20
+ "num_channels": 3,
21
+ "num_hidden_layers": 12,
22
+ "num_register_tokens": 4,
23
+ "out_features": [
24
+ "stage12"
25
+ ],
26
+ "out_indices": [
27
+ 12
28
+ ],
29
+ "patch_size": 16,
30
+ "pos_embed_jitter": null,
31
+ "pos_embed_rescale": 2.0,
32
+ "pos_embed_shift": null,
33
+ "proj_bias": true,
34
+ "query_bias": true,
35
+ "reshape_hidden_states": true,
36
+ "rope_theta": 100.0,
37
+ "stage_names": [
38
+ "stem",
39
+ "stage1",
40
+ "stage2",
41
+ "stage3",
42
+ "stage4",
43
+ "stage5",
44
+ "stage6",
45
+ "stage7",
46
+ "stage8",
47
+ "stage9",
48
+ "stage10",
49
+ "stage11",
50
+ "stage12"
51
+ ],
52
+ "transformers_version": "5.12.0",
53
+ "use_gated_mlp": true,
54
+ "value_bias": true
55
+ }
small_plus/backbone/feature_norms.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:585279e5e6d3f03a6be7fbae0e59cc2638a61fa1141245a2597e0ee9a493c0f8
3
+ size 15969
small_plus/backbone/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:208146e499dace99e4c9376ddb8a26f77d64c31c46c4dc4b86ff8bc63b0235e2
3
+ size 114794096
small_plus/config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "encoder_type": "dinov3",
3
+ "encoder_model_id": "facebook/dinov3-vits16plus-pretrain-lvd1689m",
4
+ "text_prompts": null,
5
+ "decoder_type": "pyrafuse",
6
+ "num_classes": 3,
7
+ "decoder_channels": 128,
8
+ "image_size": 448,
9
+ "use_bn": false,
10
+ "drop_path_rate": 0.05,
11
+ "dropout": 0.1,
12
+ "num_queries": 10,
13
+ "num_transformer_layers": 3,
14
+ "freeze_backbone": true,
15
+ "ema_decay": 0.9995
16
+ }
small_plus/decoder.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:80fd03b879f3e098a46922f30714f786351ed7c9d5bfad53165fbef23ca1b571
3
+ size 4247164
small_plus/ema.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:17d70dcc506de187190dd0803c7fc64df2f7b65ac268ca317216282aadc38b11
3
+ size 119104231