doze-llm adapters

Thirteen LoRA adapters (r=16, alpha=32, all attention and MLP projections, fp32) trained on Qwen3-4B in the doze-llm experiment (https://github.com/Rj2790/doze-llm): a preregistered comparison of training schedules on a digit-folding puzzle with a hidden shortcut.

folder regime seed
online_seed{1,2,3,4} one verified self-training step per episode (600 episodes) 1โ€“4
sleep_seed{1,2,3,4} nightly consolidation every 50 episodes: verified dreams + replay + 50 steps + 5% decay 1โ€“4
sleep_nodream_seed{0,1,2,3,4} as Sleep without dreams 0โ€“4

Each folder is a standard PEFT adapter (adapter_model.safetensors, adapter_config.json) plus export_info.json (source state, optimizer steps). Load with

from transformers import AutoModelForCausalLM
from peft import PeftModel
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B", dtype="bfloat16")
model = PeftModel.from_pretrained(base, "rushiljain/doze-llm-adapters", subfolder="sleep_nodream_seed4")

What they do: execute the Number Reduction procedure (12 digits over {1,4,9}) at 0.86โ€“0.99 held-out accuracy versus 0.42 for the base model, generalising to strings without the practice structure (0.84โ€“0.89 vs 0.37). They do not encode the hidden shortcut, do not change GSM8K under a normal math prompt (all within ยฑ0.02 of base), and transfer negatively to a puzzle whose rule alternates by step. Full results, caveats and the preregistration are in the repository. The seed 0 pilot Sleep and Online adapters were never saved and do not exist.

Base model licence: Apache 2.0 (Qwen). Adapters: Apache 2.0.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for rushiljain/doze-llm-adapters

Finetuned
Qwen/Qwen3-4B
Adapter
(1184)
this model