devoppro commited on
Commit
dd334bd
·
verified ·
1 Parent(s): af0d032

Upload configuration_modern_llm.py with huggingface_hub

Browse files
Files changed (1) hide show
  1. configuration_modern_llm.py +12 -4
configuration_modern_llm.py CHANGED
@@ -1,5 +1,12 @@
1
  from transformers import PretrainedConfig
2
 
 
 
 
 
 
 
 
3
 
4
  class ModernLLMConfig(PretrainedConfig):
5
  model_type = "modern_llm"
@@ -11,13 +18,13 @@ class ModernLLMConfig(PretrainedConfig):
11
  intermediate_size: int = 2048,
12
  num_hidden_layers: int = 12,
13
  num_attention_heads: int = 12,
14
- num_key_value_heads: int = 4, # Grouped-Query Attention (GQA)
15
  max_position_embeddings: int = 2048,
16
  rms_norm_eps: float = 1e-6,
17
  rope_theta: float = 1000000.0,
18
- pad_token_id: int = 0,
19
- bos_token_id: int = 1,
20
- eos_token_id: int = 2,
21
  **kwargs,
22
  ):
23
  self.vocab_size = vocab_size
@@ -29,6 +36,7 @@ class ModernLLMConfig(PretrainedConfig):
29
  self.max_position_embeddings = max_position_embeddings
30
  self.rms_norm_eps = rms_norm_eps
31
  self.rope_theta = rope_theta
 
32
  super().__init__(
33
  pad_token_id=pad_token_id,
34
  bos_token_id=bos_token_id,
 
1
  from transformers import PretrainedConfig
2
 
3
+ QWEN_TOKEN_ID = 151643
4
+
5
+ AUTO_MAP = {
6
+ "AutoConfig": "configuration_modern_llm.ModernLLMConfig",
7
+ "AutoModelForCausalLM": "modeling_modern_llm.ModernLLMForCausalLM",
8
+ }
9
+
10
 
11
  class ModernLLMConfig(PretrainedConfig):
12
  model_type = "modern_llm"
 
18
  intermediate_size: int = 2048,
19
  num_hidden_layers: int = 12,
20
  num_attention_heads: int = 12,
21
+ num_key_value_heads: int = 4,
22
  max_position_embeddings: int = 2048,
23
  rms_norm_eps: float = 1e-6,
24
  rope_theta: float = 1000000.0,
25
+ pad_token_id: int = QWEN_TOKEN_ID,
26
+ bos_token_id: int = QWEN_TOKEN_ID,
27
+ eos_token_id: int = QWEN_TOKEN_ID,
28
  **kwargs,
29
  ):
30
  self.vocab_size = vocab_size
 
36
  self.max_position_embeddings = max_position_embeddings
37
  self.rms_norm_eps = rms_norm_eps
38
  self.rope_theta = rope_theta
39
+ self.auto_map = dict(AUTO_MAP)
40
  super().__init__(
41
  pad_token_id=pad_token_id,
42
  bos_token_id=bos_token_id,