mlabonne/harmful_behaviors
Viewer β’ Updated β’ 520 β’ 15.9k β’ 136
How to use asmanovlev/veriloop-coder-e1-heretic with PEFT:
from peft import PeftModel
from transformers import AutoModelForCausalLM
base_model = AutoModelForCausalLM.from_pretrained("/mnt/veriloop")
model = PeftModel.from_pretrained(base_model, "asmanovlev/veriloop-coder-e1-heretic")Model: VeriLoop Coder E1 (27B, based on Qwen 3.6)
Method: Heretic v1.4.0 β 200 trials, full precision, ADAPTER export
| Metric | Value |
|---|---|
| Best trial | Trial 36 |
| Refusals (harmful_behaviors) | 82/100 |
| KL divergence | 0.0003 |
| Model damage | Minimal |
| Export format | LoRA adapter (26 MB) |
The model proved unusually resistant to abliteration. After 200 trials, refusal rate only dropped from ~95% to ~82%. Qwen 3.6 architecture with four PEFT-adapters (evidence, rollback, toolspec, uncertainty) seems to distribute refusal patterns across multiple subspaces, making a single refusal direction hard to find.
| File | Size | Description |
|---|---|---|
adapter_model.safetensors |
26 MB | LoRA adapter weights |
adapter_config.json |
1 KB | LoRA configuration |
from peft import PeftModel
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("tsinghua-sigs-robot-lab/veriloop-coder-e1")
model = PeftModel.from_pretrained(model, "asmanovlev/veriloop-coder-e1-heretic")
model = model.merge_and_unload()
--method aggressive (yields 0% refusals at the cost of KL ~8.7)Base model
Qwen/Qwen3.6-27B