Upload train.py with huggingface_hub
Browse files
train.py
CHANGED
|
@@ -106,6 +106,11 @@ def train(args):
|
|
| 106 |
print(f"[train] model params = {sum(p.numel() for p in YKDiff(cfg).parameters())/1e6:.1f}M")
|
| 107 |
|
| 108 |
model = YKDiff(cfg).to(device)
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 109 |
n_params = sum(p.numel() for p in model.parameters())
|
| 110 |
print(f"[train] allocated params = {n_params/1e6:.1f}M")
|
| 111 |
|
|
|
|
| 106 |
print(f"[train] model params = {sum(p.numel() for p in YKDiff(cfg).parameters())/1e6:.1f}M")
|
| 107 |
|
| 108 |
model = YKDiff(cfg).to(device)
|
| 109 |
+
# Train in bf16 weights so a large model fits a 22 GB L4: fp32 weights would
|
| 110 |
+
# need ~21.6 GB just for params+grads+Adam states (OOM). bf16 halves that.
|
| 111 |
+
if device.type in ("cuda", "xla"):
|
| 112 |
+
model = model.to(torch.bfloat16)
|
| 113 |
+
print("[train] using bfloat16 weights")
|
| 114 |
n_params = sum(p.numel() for p in model.parameters())
|
| 115 |
print(f"[train] allocated params = {n_params/1e6:.1f}M")
|
| 116 |
|