{ "model_type": "neurovoice", "architectures": [ "NeuroVoiceModel" ], "auto_map": { "AutoConfig": "configuration_neurovoice.NeuroVoiceConfig", "AutoModel": "modeling_neurovoice.NeuroVoiceModel" }, "torch_dtype": "bfloat16", "model_name": "NeuroVoice-0.5B", "version": "v0.1-alpha", "architecture": "TwoStageAudioLM", "text_backbone": "Qwen/Qwen2.5-0.5B", "audio_codec": "kyutai/mimi", "text_vocab_size": 151936, "audio_vocab_size": 2048, "num_codebooks": 8, "d_model": 896, "num_heads": 14, "num_kv_heads": 2, "num_layers": 24, "num_depth_layers": 4, "d_ff": 4864, "max_seq_len": 2048, "rope_theta": 1000000.0, "dropout_rate": 0.0, "activation": "swiglu", "dtype": "bfloat16", "use_qk_norm": false, "pad_token_id": 0, "bos_token_id": 1, "eos_token_id": 2, "unk_token_id": 3, "instruct_token_id": 4, "text_token_id": 5, "ref_audio_token_id": 6, "audio_start_token_id": 7, "audio_end_token_id": 8 }