defaults: - _base_transformer_bert - _self_ # === Model Identity === model_name: transformer_353M_prediction # === Model Architecture === hidden_size: 1024 num_hidden_layers: 24 num_attention_heads: 16 intermediate_size: 4096 max_position_embeddings: 1024 max_seq_len: 1024