{ "architectures": [ "BertModel" ], "model_type": "bert", "attention_probs_dropout_prob": 0.1, "hidden_act": "gelu", "hidden_dropout_prob": 0.1, "initializer_range": 0.02, "num_attention_heads": 12, "pad_token_id": 0, "position_embedding_type": "absolute", "tokenizer_class": "XLMRobertaTokenizer", "vocab_size": 250000, "hidden_size": 384, "num_hidden_layers": 12, "intermediate_size": 1536, "max_position_embeddings": 512, "type_vocab_size": 2, "layer_norm_eps": 1e-12, "ultracode": { "format": "raw-safetensors/1", "exported_from": "model.onnx", "onnx_sha256": "3d527785e74b24fa53f3c04dccd5e71f95288411b523be013052181acce86c9c", "head": "mean_l2", "position_ids": "absolute", "pooling": "mean over attention_mask", "normalize": "l2", "vocab_remap_folded": { "input_ids": 250000, "pruned_rows": 142076 }, "input_ids": "raw SentencePiece ids (no fairseq offset), as the graph takes them" } }