Dat1710 commited on
Commit
8dcebac
·
verified ·
1 Parent(s): 1fd44ad

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +60 -0
README.md ADDED
@@ -0,0 +1,60 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model: google/gemma-4-E2B-it-qat-q4_0-unquantized
4
+ tags:
5
+ - dgmc
6
+ - boolq
7
+ - gemma
8
+ - yes-no-question-answering
9
+ - reading-comprehension
10
+ - pytorch
11
+ datasets:
12
+ - boolq
13
+ metrics:
14
+ - accuracy
15
+ - f1
16
+ ---
17
+
18
+ # Gemma + DGMC (Dual-Gated Memory Consolidation) — fine-tuned on BoolQ
19
+
20
+ Adapter DGMC (Dual-Gated Memory Consolidation) huấn luyện trên bộ dữ liệu
21
+ [BoolQ](https://huggingface.co/datasets/google/boolq), gắn thêm vào mô hình nền tảng
22
+ **đóng băng hoàn toàn** `google/gemma-4-E2B-it-qat-q4_0-unquantized`. Chỉ các tham số của module DGMC được
23
+ huấn luyện (`dgmc_params/1e6:.1f`M tham số).
24
+
25
+ ## Kết quả
26
+
27
+ | Model | Method | Trainable Params | Accuracy | F1 Macro |
28
+ |---|---|---|---|---|
29
+ | Gemma (Zero-Shot) | Next-token logit scoring | 0 | 72.84% | 0.7279 |
30
+ | Gemma + DGMC | DGMC fine-tuned (LM) | 28.3M | 81.07% | 0.7974 |
31
+
32
+ Cải thiện: **+8.23 điểm phần trăm** so với zero-shot.
33
+
34
+ ## Cấu hình DGMC
35
+
36
+ - `block_size`: 64
37
+ - `memory_dim`: 1536
38
+ - `decay_alpha`: 0.1
39
+
40
+ ## Cách sử dụng
41
+
42
+ Tải file `dgmc_boolq_weights.pt` rồi load lại vào module DGMC tương ứng với
43
+ kiến trúc trong notebook huấn luyện gốc:
44
+
45
+ ```python
46
+ import torch
47
+ ckpt = torch.load("dgmc_boolq_weights.pt", map_location="cpu")
48
+ dgmc.load_state_dict(ckpt["dgmc_state_dict"])
49
+ ```
50
+
51
+ Model nền tảng `google/gemma-4-E2B-it-qat-q4_0-unquantized` cần được tải riêng và giữ đóng băng (frozen);
52
+ adapter DGMC này chỉ bổ sung một module memory consolidation nhẹ, không thay
53
+ thế attention gốc của model.
54
+
55
+ ## Huấn luyện
56
+
57
+ - Epochs: 10
58
+ - Learning rate: 0.0002
59
+ - Gradient accumulation steps: 16
60
+ - Max sequence length: 256