test2 / export_info.json
amir0907's picture
Upload model files from Kaggle
e56fafc verified
Raw History Blame Contribute Delete
2.89 kB
{
"base_model": "microsoft/VibeVoice-1.5B",
"checkpoint_dir": "/kaggle/working/vibevoice-finetune/out_tpu/final",
"dtype": "bfloat16",
"components_merged": [
"language_model",
"prediction_head",
"acoustic_connector",
"semantic_connector"
],
"tensors_changed_vs_base": 365,
"training_state": {
"step": 230,
"args": {
"model_name_or_path": "microsoft/VibeVoice-1.5B",
"data_dir": "/kaggle/working/vibevoice-finetune/preprocessed_tpu/train",
"eval_data_dir": null,
"output_dir": "out_tpu",
"lazy_data": false,
"max_seq_len": 0,
"max_latents": 0,
"max_segments": 0,
"buckets": null,
"auto_buckets": 0,
"per_device_batch_size": 2,
"gradient_accumulation_steps": 4,
"learning_rate": 1e-05,
"head_lr_multiplier": 2.0,
"weight_decay": 0.01,
"adam_beta1": 0.9,
"adam_beta2": 0.95,
"adam_eps": 1e-08,
"max_grad_norm": 1.0,
"no_master_weights": false,
"num_train_epochs": 2.0,
"max_steps": 0,
"warmup_ratio": 0.05,
"warmup_steps": 0,
"lr_scheduler": "cosine",
"min_lr_ratio": 0.05,
"seed": 42,
"ce_loss_weight": 1.0,
"diffusion_loss_weight": 1.5,
"ddpm_batch_mul": 4,
"ce_chunk_size": 256,
"no_semantic": false,
"no_latent_noise": false,
"ce_acoustic_supervision": "target",
"freeze_components": null,
"freeze_llm_layers": null,
"train_llm_layers": null,
"freeze_head_layers": null,
"freeze_embeddings": false,
"freeze_lm_head": false,
"freeze_regex": null,
"bf16": true,
"gradient_checkpointing": true,
"no_spmd": false,
"logging_steps": 10,
"save_steps": 300,
"save_total_limit": 3,
"eval_steps": 0,
"eval_batches": 20,
"resume_from_checkpoint": null,
"dataloader_workers": 0,
"profile_first_steps": 3
},
"shapes": {
"max_seq_len": 512,
"max_latents": 224,
"max_segments": 8,
"acoustic_dim": 64,
"semantic_dim": 128
},
"preprocess_metadata": {
"model_name_or_path": "microsoft/VibeVoice-1.5B",
"processor_name_or_path": "vibevoice/processor",
"compress_ratio": 3200,
"acoustic_dim": 64,
"semantic_dim": 128,
"fix_std": 0.5,
"latent_dtype": "float16",
"speech_scaling_factor": 0.1962890625,
"speech_bias_factor": -0.04931640625,
"scaling_source": "checkpoint",
"corpus_latent_mean": -0.1338784531259102,
"corpus_latent_var": 23.753134242682215,
"shapes": {
"max_seq_len": 512,
"max_latents": 224,
"max_segments": 8,
"acoustic_dim": 64,
"semantic_dim": 128
},
"pad_token_id": 151655,
"augment_target_silence": true,
"normalize_target_audio": false
}
}
}