Upload train.py with huggingface_hub
Browse files
train.py
CHANGED
|
@@ -30,7 +30,8 @@ os.makedirs(CKPTDIR, exist_ok=True)
|
|
| 30 |
# default architecture tuned for 16 GB (RTX 5060 Ti)
|
| 31 |
DEFAULT_CFG = dict(
|
| 32 |
d_model=768, n_layers=12, n_heads=12, d_ff=2048,
|
| 33 |
-
max_len=
|
|
|
|
| 34 |
)
|
| 35 |
|
| 36 |
|
|
@@ -40,6 +41,8 @@ def build_cfg(args):
|
|
| 40 |
v = getattr(args, k, None)
|
| 41 |
if v is not None:
|
| 42 |
cfg[k] = v
|
|
|
|
|
|
|
| 43 |
return cfg
|
| 44 |
|
| 45 |
|
|
@@ -216,6 +219,10 @@ if __name__ == "__main__":
|
|
| 216 |
ap.add_argument("--n-layers", type=int, default=None)
|
| 217 |
ap.add_argument("--n-heads", type=int, default=None)
|
| 218 |
ap.add_argument("--d-ff", type=int, default=None)
|
|
|
|
| 219 |
ap.add_argument("--vocab-size", type=int, default=None)
|
| 220 |
ap.add_argument("--seq-len", type=int, default=None)
|
|
|
|
|
|
|
|
|
|
| 221 |
train(ap.parse_args())
|
|
|
|
| 30 |
# default architecture tuned for 16 GB (RTX 5060 Ti)
|
| 31 |
DEFAULT_CFG = dict(
|
| 32 |
d_model=768, n_layers=12, n_heads=12, d_ff=2048,
|
| 33 |
+
max_len=8192, vocab_size=32768,
|
| 34 |
+
rope_scale=1.0,
|
| 35 |
)
|
| 36 |
|
| 37 |
|
|
|
|
| 41 |
v = getattr(args, k, None)
|
| 42 |
if v is not None:
|
| 43 |
cfg[k] = v
|
| 44 |
+
if getattr(args, "rope_scale", None) is not None:
|
| 45 |
+
cfg["rope_scale"] = args.rope_scale
|
| 46 |
return cfg
|
| 47 |
|
| 48 |
|
|
|
|
| 219 |
ap.add_argument("--n-layers", type=int, default=None)
|
| 220 |
ap.add_argument("--n-heads", type=int, default=None)
|
| 221 |
ap.add_argument("--d-ff", type=int, default=None)
|
| 222 |
+
ap.add_argument("--rope-scale", type=float, default=None)
|
| 223 |
ap.add_argument("--vocab-size", type=int, default=None)
|
| 224 |
ap.add_argument("--seq-len", type=int, default=None)
|
| 225 |
+
ap.add_argument("--rope-scale", type=float, default=1.0,
|
| 226 |
+
help="NTK RoPE scale for long-context extension "
|
| 227 |
+
"(e.g. 16 to extend an 8k-trained model to 128k)")
|
| 228 |
train(ap.parse_args())
|