| |
| config_target: lmr.models.transformer_bert.TransformerConfig |
| model_target: lmr.models.transformer_bert.TransformerForMaskedLM |
| model_name: transformer |
|
|
| |
| vocab_size: 50257 |
| hidden_size: 1024 |
| embedding_size: null |
| num_hidden_layers: 24 |
| num_attention_heads: 16 |
| intermediate_size: 4096 |
| max_position_embeddings: 1024 |
| tie_word_embeddings: true |
| use_causal_attention: false |
|
|
| |
| initializer_range: 0.02 |
|
|
| |
| use_cache: false |
| self.truncate_activation_size: false |
|
|
| |
| tokenizer_type: bert-base-uncased |
| bos_token_id: null |
| eos_token_id: null |
| pad_token_id: null |