linxin02 commited on
Commit
7204fc4
·
verified ·
1 Parent(s): b93add5

Upload viz/preference/pref_predict.yaml with huggingface_hub

Browse files
Files changed (1) hide show
  1. viz/preference/pref_predict.yaml +135 -0
viz/preference/pref_predict.yaml ADDED
@@ -0,0 +1,135 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # lightning.pytorch==2.4.0
2
+ seed_everything: true
3
+ tags:
4
+ exp: &exp sftpix512ema
5
+ torch_hub_dir: ~/.cache/torch/hub
6
+ huggingface_cache_dir: null
7
+ trainer:
8
+ default_root_dir: ./workdir_dpg_base
9
+ accelerator: auto
10
+ strategy: ddp
11
+ devices: auto
12
+ num_nodes: 1
13
+ accumulate_grad_batches: 4
14
+ precision: bf16-mixed
15
+ logger:
16
+ class_path: lightning.pytorch.loggers.TensorBoardLogger
17
+ init_args:
18
+ save_dir: ./universal_pix_flow_t2i
19
+ name: *exp
20
+ num_sanity_val_steps: 2
21
+ max_steps: 340000
22
+ gradient_clip_val: 1.0
23
+ gradient_clip_algorithm: norm
24
+ val_check_interval: 40000
25
+ check_val_every_n_epoch: null
26
+ log_every_n_steps: 50
27
+ deterministic: null
28
+ inference_mode: true
29
+ use_distributed_sampler: false
30
+ callbacks:
31
+ - class_path: src.callbacks.model_checkpoint.CheckpointHook
32
+ init_args:
33
+ every_n_train_steps: 10000
34
+ save_top_k: -1
35
+ save_last: true
36
+ - class_path: src.callbacks.save_images.SaveImagesHook
37
+ init_args:
38
+ save_dir: val
39
+ plugins:
40
+ - src.plugins.bd_env.BDEnvironment
41
+ model:
42
+ vae:
43
+ class_path: src.models.autoencoder.pixel.PixelAE
44
+ denoiser:
45
+ class_path: src.models.transformer.dit_t2i_DeCo.PixNerDiT
46
+ init_args:
47
+ in_channels: 3
48
+ patch_size: 16
49
+ num_groups: 24
50
+ hidden_size: &hidden_dim 1536
51
+ txt_embed_dim: &txt_embed_dim 2048
52
+ txt_max_length: 128
53
+ num_text_blocks: 4
54
+ decoder_hidden_size: 32
55
+ num_encoder_blocks: 16
56
+ num_decoder_blocks: 3
57
+ conditioner:
58
+ class_path: src.models.conditioner.qwen3_text_encoder.Qwen3TextEncoder
59
+ init_args:
60
+ weight_path: Qwen/Qwen3-1.7B
61
+ embed_dim: *txt_embed_dim
62
+ max_length: 128
63
+ diffusion_trainer:
64
+ class_path: src.diffusion.flow_matching.training_repa_DeCo.REPATrainer
65
+ init_args:
66
+ lognorm_t: true
67
+ feat_loss_weight: 0.5
68
+ timeshift: 4.0
69
+ encoder:
70
+ class_path: src.models.encoder.DINOv2
71
+ init_args:
72
+ weight_path: /root/.cache/torch/hub/checkpoints/dinov2_vitb14_pretrain.pth
73
+ align_layer: 6
74
+ proj_denoiser_dim: *hidden_dim
75
+ proj_hidden_dim: *hidden_dim
76
+ proj_encoder_dim: 768
77
+ scheduler: &scheduler src.diffusion.flow_matching.scheduling.LinearScheduler
78
+ diffusion_sampler:
79
+ class_path: src.diffusion.flow_matching.adam_sampling.AdamLMSampler
80
+ init_args:
81
+ num_steps: 25
82
+ guidance: 4.0
83
+ timeshift: 3.0 # 3.0 for geneval
84
+ order: 2
85
+ scheduler: *scheduler
86
+ guidance_fn: src.diffusion.base.guidance.simple_guidance_fn
87
+ ema_tracker:
88
+ class_path: src.callbacks.simple_ema.SimpleEMA
89
+ init_args:
90
+ decay: 0.9999
91
+ optimizer:
92
+ class_path: torch.optim.AdamW
93
+ init_args:
94
+ lr: 1e-5
95
+ betas:
96
+ - 0.9
97
+ - 0.999
98
+ weight_decay: 0.00
99
+ data:
100
+ train_dataset:
101
+ class_path: src.data.dataset.image_txt.ImageText
102
+ init_args:
103
+ root: /data/datasets/BLIP-3o/BLIP3o-60k
104
+ resolution: 512
105
+ # train_dataset:
106
+ # class_path: src.data.dataset.blip3o_dataset.WebDatasetPackedDataset
107
+ # init_args:
108
+ # urls: [/data/datasets/BLIP-3o/BLIP3o-60k] # [/data/datasets/BLIP-3o/BLIP3o-Pretrain-JourneyDB,]
109
+ # resolution: 512
110
+ # random_crop: false
111
+ # shuffle_buffer: 2000
112
+ # sample_shuffle: true
113
+ # repeat: true
114
+ eval_dataset:
115
+ class_path: src.data.dataset.geneval.GenEvalDataset
116
+ init_args:
117
+ meta_json_path: ./evaluations/geneval/evaluation_metadata.jsonl
118
+ num_samples_per_instance: 1
119
+ latent_shape:
120
+ - 3
121
+ - 512
122
+ - 512
123
+ pred_dataset:
124
+ class_path: src.data.dataset.dpg.DPGDataset
125
+ init_args:
126
+ prompt_path: /mnt/localssd/colligo/contrib/Mori/collections/foundation_exploration/configs/genrender6/ganloss/DeCo/evaluations/dpg/prompts
127
+ num_samples_per_instance: 1
128
+ latent_shape:
129
+ - 3
130
+ - 512
131
+ - 512
132
+ train_batch_size: 16
133
+ train_num_workers: 8
134
+ pred_batch_size: 8
135
+ pred_num_workers: 1