Commit History

Update handoff with on-policy error-targeted reasoning SFT v4
d714e4c
verified

Asilarkness commited on

V4 final rejection after protected information and reasoning gates
02335ba
verified

Asilarkness commited on

V4 final rejection after protected information and reasoning gates
cfe02e7
verified

Asilarkness commited on

V4 final rejection after protected information and reasoning gates
4086306
verified

Asilarkness commited on

V4 final rejection after protected information and reasoning gates
5c581bc
verified

Asilarkness commited on

V4 recoverable on-policy error-targeted SFT source
bce1e59
verified

Asilarkness commited on

V4 recoverable on-policy error-targeted SFT source
abffa02
verified

Asilarkness commited on

V4 error-targeted SFT dataset and leader anchoring
2fa2fce
verified

Asilarkness commited on

V4 error-targeted SFT dataset and leader anchoring
73c67bd
verified

Asilarkness commited on

V4 error-targeted SFT dataset and leader anchoring
b7bbfd9
verified

Asilarkness commited on

V4 scored on-policy frontier and verified minimal corrections
b69d06e
verified

Asilarkness commited on

V4 scored on-policy frontier and verified minimal corrections
ec5191b
verified

Asilarkness commited on

V4 scored on-policy frontier and verified minimal corrections
5c67cc7
verified

Asilarkness commited on

V4 scored on-policy frontier and verified minimal corrections
516be00
verified

Asilarkness commited on

Complete V4 on-policy rollout generation 300 problems / 600 trajectories
d03b5ee
verified

Asilarkness commited on

V4 on-policy rollout checkpoint 250/300
bb56236
verified

Asilarkness commited on

V4 on-policy rollout checkpoint 200/300
efc4c96
verified

Asilarkness commited on

V4 on-policy rollout checkpoint 150/300
9b5307c
verified

Asilarkness commited on

V4 on-policy rollout checkpoint 100/300
1f3ed65
verified

Asilarkness commited on

V4 on-policy rollout checkpoint 50/300
9c9c328
verified

Asilarkness commited on

Bootstrap on-policy error-targeted reasoning v4
3093e07
verified

Asilarkness commited on

Bootstrap on-policy error-targeted reasoning v4
2912c18
verified

Asilarkness commited on

Bootstrap on-policy error-targeted reasoning v4
4087ed6
verified

Asilarkness commited on

Confirm v3 rejection with extended fixed-MATH alpha line search
6d5909a
verified

Asilarkness commited on

Confirm v3 rejection with extended fixed-MATH alpha line search
d757bd2
verified

Asilarkness commited on

Confirm v3 rejection with extended fixed-MATH alpha line search
ef18aa4
verified

Asilarkness commited on

Update handoff with long reasoning SFT before RL v3
b0a1065
verified

Asilarkness commited on

Add v3 evaluation artifact v3_reasoning_sft_manifest.json
4ebb47e
verified

Asilarkness commited on

Add v3 evaluation artifact v3_fixed_scores.json
24faea4
verified

Asilarkness commited on

Add v3 evaluation artifact v3_math_dev_scores.json
7b717c3
verified

Asilarkness commited on

Add v3 evaluation artifact v3_info_dev.json
8bda0df
verified

Asilarkness commited on

Add v3 evaluation artifact V3_FINAL_DECISION.json
d9b05d6
verified

Asilarkness commited on

Reasoning SFT then RL v3: final Stage A rejection report
bc51733
verified

Asilarkness commited on

Add reasoning SFT v3 encoding manifest
28ff334
verified

Asilarkness commited on

Add reasoning SFT v3 training report
027b0e3
verified

Asilarkness commited on

Reasoning SFT v3: recoverable long verified SFT source
90fe6d3
verified

Asilarkness commited on

Add reasoning SFT then constrained RL v3 policy
9be1e6e
verified

Asilarkness commited on

Add reasoning SFT v3 data manifest
159a233
verified

Asilarkness commited on

Add 208-row held-out verified math calibration split
c51911e
verified

Asilarkness commited on

Bootstrap reasoning SFT v3 with 800 verified long math solutions
80f0edf
verified

Asilarkness commited on

Update handoff with math-augmented constrained information RL v2
a833fe9
verified

Asilarkness commited on

Math-augmented constrained RL v2: final rejection after fixed no-regression gate
a29f14f
verified

Asilarkness commited on

Math-augmented RL v2: constrained joint source with gradient projection
014c05f
verified

Asilarkness commited on

Math-augmented RL v2: add leader log-probabilities for joint constrained training
fe54262
verified

Asilarkness commited on

Math-augmented RL v2: add 96 scored math groups and symbolic rewards
9a568f8
verified

Asilarkness commited on

Bootstrap math-augmented information RL v2 with 96 verified decontaminated math rows
99c70bb
verified

Asilarkness commited on

Update Budgie handoff with information-management RL v1 result
83641cc
verified

Asilarkness commited on

Information RL v1 hygiene: remove superseded and rejected full checkpoints
980a3df
verified

Asilarkness commited on

Information-management RL v1: final rejection after protected reasoning gate
efa1162
verified

Asilarkness commited on

Information RL v1: preliminary alpha-0.025 candidate and held-out decision
d53a83f
verified

Asilarkness commited on