Tiny-agent

loading…

Reinforcement learning (GRPO)

Per-task accuracy

Pretraining & decay

Log

Pipeline events

orchestrator and RL waiter

RL notes

changes made during RL and why (rl/NOTES.md)