23f2002275 commited on
Commit
d2b6a7e
·
1 Parent(s): 8787bd3

config: scripts/job_train.sh \u2014 Path 3 (qwen_0_5b_smoke + GRPO max_steps=50) for sanity-check run before burning 1.5B credits

Browse files
Files changed (1) hide show
  1. scripts/job_train.sh +4 -4
scripts/job_train.sh CHANGED
@@ -36,25 +36,25 @@ python -c "import urllib.request, sys; sys.exit(0 if urllib.request.urlopen('htt
36
  python -m train.smoke_test --env-url http://localhost:8001
37
  grep -q "VERDICT: GO" outputs/smoke/SMOKE_RESULT.md || (cat outputs/smoke/SMOKE_RESULT.md; exit 1)
38
 
39
- # SFT on 1.5B
40
  python <<'PY'
41
  from hydra import initialize, compose
42
  from train.model_load import load_model_and_tokenizer
43
  from train.sft import run_sft
44
  with initialize(config_path="../configs", version_base="1.3"):
45
- cfg = compose(config_name="config", overrides=["model=qwen_1_5b","train=sft"])
46
  m, t = load_model_and_tokenizer(cfg)
47
  print("SFT adapter:", run_sft(cfg, m, t))
48
  PY
49
 
50
- # GRPO 400 steps
51
  python <<'PY'
52
  from hydra import initialize, compose
53
  from train.model_load import load_model_and_tokenizer
54
  from train.grpo import run_grpo
55
  from rewards.compose import make_reward_fn
56
  with initialize(config_path="../configs", version_base="1.3"):
57
- cfg = compose(config_name="config", overrides=["model=qwen_1_5b","train=grpo"])
58
  m, t = load_model_and_tokenizer(cfg)
59
  print("GRPO merged:", run_grpo(cfg, m, t, make_reward_fn(cfg.reward), "http://localhost:8001"))
60
  PY
 
36
  python -m train.smoke_test --env-url http://localhost:8001
37
  grep -q "VERDICT: GO" outputs/smoke/SMOKE_RESULT.md || (cat outputs/smoke/SMOKE_RESULT.md; exit 1)
38
 
39
+ # SFT (Path 3 — 0.5B sanity check; switch to qwen_1_5b for Path 1)
40
  python <<'PY'
41
  from hydra import initialize, compose
42
  from train.model_load import load_model_and_tokenizer
43
  from train.sft import run_sft
44
  with initialize(config_path="../configs", version_base="1.3"):
45
+ cfg = compose(config_name="config", overrides=["model=qwen_0_5b_smoke","train=sft"])
46
  m, t = load_model_and_tokenizer(cfg)
47
  print("SFT adapter:", run_sft(cfg, m, t))
48
  PY
49
 
50
+ # GRPO 50 steps (Path 3 — 0.5B sanity check; switch to qwen_1_5b + max_steps=400 for Path 1)
51
  python <<'PY'
52
  from hydra import initialize, compose
53
  from train.model_load import load_model_and_tokenizer
54
  from train.grpo import run_grpo
55
  from rewards.compose import make_reward_fn
56
  with initialize(config_path="../configs", version_base="1.3"):
57
+ cfg = compose(config_name="config", overrides=["model=qwen_0_5b_smoke","train=grpo","train.max_steps=50"])
58
  m, t = load_model_and_tokenizer(cfg)
59
  print("GRPO merged:", run_grpo(cfg, m, t, make_reward_fn(cfg.reward), "http://localhost:8001"))
60
  PY