Tiny-agent
loading…
◐ theme
Reinforcement learning (GRPO)
Per-task accuracy
Pretraining & decay
Log
Pipeline events
orchestrator and RL waiter
RL notes
changes made during RL and why (rl/NOTES.md)