23f2002275 commited on
Commit ·
d2b6a7e
1
Parent(s): 8787bd3
config: scripts/job_train.sh \u2014 Path 3 (qwen_0_5b_smoke + GRPO max_steps=50) for sanity-check run before burning 1.5B credits
Browse files- scripts/job_train.sh +4 -4
scripts/job_train.sh
CHANGED
|
@@ -36,25 +36,25 @@ python -c "import urllib.request, sys; sys.exit(0 if urllib.request.urlopen('htt
|
|
| 36 |
python -m train.smoke_test --env-url http://localhost:8001
|
| 37 |
grep -q "VERDICT: GO" outputs/smoke/SMOKE_RESULT.md || (cat outputs/smoke/SMOKE_RESULT.md; exit 1)
|
| 38 |
|
| 39 |
-
# SFT
|
| 40 |
python <<'PY'
|
| 41 |
from hydra import initialize, compose
|
| 42 |
from train.model_load import load_model_and_tokenizer
|
| 43 |
from train.sft import run_sft
|
| 44 |
with initialize(config_path="../configs", version_base="1.3"):
|
| 45 |
-
cfg = compose(config_name="config", overrides=["model=
|
| 46 |
m, t = load_model_and_tokenizer(cfg)
|
| 47 |
print("SFT adapter:", run_sft(cfg, m, t))
|
| 48 |
PY
|
| 49 |
|
| 50 |
-
# GRPO
|
| 51 |
python <<'PY'
|
| 52 |
from hydra import initialize, compose
|
| 53 |
from train.model_load import load_model_and_tokenizer
|
| 54 |
from train.grpo import run_grpo
|
| 55 |
from rewards.compose import make_reward_fn
|
| 56 |
with initialize(config_path="../configs", version_base="1.3"):
|
| 57 |
-
cfg = compose(config_name="config", overrides=["model=
|
| 58 |
m, t = load_model_and_tokenizer(cfg)
|
| 59 |
print("GRPO merged:", run_grpo(cfg, m, t, make_reward_fn(cfg.reward), "http://localhost:8001"))
|
| 60 |
PY
|
|
|
|
| 36 |
python -m train.smoke_test --env-url http://localhost:8001
|
| 37 |
grep -q "VERDICT: GO" outputs/smoke/SMOKE_RESULT.md || (cat outputs/smoke/SMOKE_RESULT.md; exit 1)
|
| 38 |
|
| 39 |
+
# SFT (Path 3 — 0.5B sanity check; switch to qwen_1_5b for Path 1)
|
| 40 |
python <<'PY'
|
| 41 |
from hydra import initialize, compose
|
| 42 |
from train.model_load import load_model_and_tokenizer
|
| 43 |
from train.sft import run_sft
|
| 44 |
with initialize(config_path="../configs", version_base="1.3"):
|
| 45 |
+
cfg = compose(config_name="config", overrides=["model=qwen_0_5b_smoke","train=sft"])
|
| 46 |
m, t = load_model_and_tokenizer(cfg)
|
| 47 |
print("SFT adapter:", run_sft(cfg, m, t))
|
| 48 |
PY
|
| 49 |
|
| 50 |
+
# GRPO 50 steps (Path 3 — 0.5B sanity check; switch to qwen_1_5b + max_steps=400 for Path 1)
|
| 51 |
python <<'PY'
|
| 52 |
from hydra import initialize, compose
|
| 53 |
from train.model_load import load_model_and_tokenizer
|
| 54 |
from train.grpo import run_grpo
|
| 55 |
from rewards.compose import make_reward_fn
|
| 56 |
with initialize(config_path="../configs", version_base="1.3"):
|
| 57 |
+
cfg = compose(config_name="config", overrides=["model=qwen_0_5b_smoke","train=grpo","train.max_steps=50"])
|
| 58 |
m, t = load_model_and_tokenizer(cfg)
|
| 59 |
print("GRPO merged:", run_grpo(cfg, m, t, make_reward_fn(cfg.reward), "http://localhost:8001"))
|
| 60 |
PY
|