{ "architectures": [ "VibeVoiceAcousticTokenizerEncoderModel" ], "channels": 1, "depths": [ 1, 1 ], "downsampling_ratios": [ 2 ], "dtype": "float32", "ffn_expansion": 4, "hidden_act": "gelu", "hidden_size": 32, "initializer_range": 0.01, "kernel_size": 3, "layer_scale_init_value": 1e-06, "model_type": "vibevoice_acoustic_tokenizer_encoder", "n_filters": 4, "num_filters": 32, "rms_norm_eps": 1e-05, "transformers_version": "5.16.0.dev0", "vae_std": 0.625 }