AUBIN-12B-Control / control_trained.json
emrevrg's picture
AUBIN-12B-Control: card + measurement
04f2994 verified
Raw History Blame Contribute Delete
1.71 kB
{
"episodes": 100,
"seed": 0,
"model": "google/gemma-4-12B-it + AUBIN-12B-Control LoRA (Colab T4, 4-bit)",
"train": "control_train.py --episodes 3000 --train 1200 --bs 4 (15161 examples, seeds 1000+), best dev step 1200 (0.875)",
"rows": {
"random": {
"episodes": 100,
"decisions": 668,
"step_accuracy": 0.3533,
"success": 0.06,
"lava_deaths": 40,
"ms_per_decision_median": 0.0
},
"random + safety shield": {
"episodes": 100,
"decisions": 858,
"step_accuracy": 0.5338,
"success": 0.13,
"lava_deaths": 0,
"ms_per_decision_median": 0.0
},
"greedy (ignores obstacles)": {
"episodes": 100,
"decisions": 456,
"step_accuracy": 0.568,
"success": 0.58,
"lava_deaths": 26,
"ms_per_decision_median": 0.0
},
"greedy + safety shield": {
"episodes": 100,
"decisions": 540,
"step_accuracy": 0.8759,
"success": 0.89,
"lava_deaths": 0,
"ms_per_decision_median": 0.0
},
"AUBIN-12B-Control (one pass per move)": {
"episodes": 100,
"decisions": 404,
"step_accuracy": 0.8639,
"success": 0.74,
"lava_deaths": 24,
"ms_per_decision_median": 853.7,
"acc_when_conf_ge_0.8": 0.8773,
"coverage_conf_ge_0.8": 0.6658,
"acc_when_conf_ge_0.9": 0.8972,
"coverage_conf_ge_0.9": 0.5297
},
"AUBIN-12B-Control + safety shield (never steps on visible lava/walls)": {
"episodes": 100,
"decisions": 536,
"step_accuracy": 0.9179,
"success": 0.92,
"lava_deaths": 0,
"ms_per_decision_median": 856.1,
"acc_when_conf_ge_0.8": 0.9815,
"coverage_conf_ge_0.8": 0.6045,
"acc_when_conf_ge_0.9": 0.985,
"coverage_conf_ge_0.9": 0.4981
}
}
}