Sven web weights (ONNX) — körs i webbläsaren

Browser-ready export av Sven-0.6B: merged LoRA + pointer head, ett rätlinjigt causal-pass per fråga (dokumentat likvärdigt med Kev:s blockmask på attention-only-basar: max Δ 4e-6 upstream).

| fil | storlek | max |Δp| vs fp32 | noter | |---|---|---|---| | sven_q4.onnx | 0.9 GB | 0.024 | block_size 32, accuracy_level 4 (int4, QOperator) | | sven_fp16.onnx | 1.3 GB | ~0.008 | högsta noggrannhet |

fp32-exporten matchar torch exakt (2.6e-5 på logits); q8-dynamic-year ans kompletteras: drift 0.42, avfärdad — calibrationen är produkten.

Ordning: input_ids [1,L], opt_idx [1,K] (positioner för </opt>-markörerna), dec_idx [1,1] (<decide>); ut: scores [1,K] (softmax i JS). Token-mall och delimiters (<|fim_prefix|>-familjen) spegler Kev:s encode(); byggd & testad i swedish-jev — se scripts/export_onnx.py + scripts/quantize_web.py.

Demo: birgermoell/sven-space (WebGPU med automatisk WASM-fallback). Licens Apache-2.0; basen Qwen3-0.6B-Base + Kev-0.6B av Jared Palmer.

Downloads last month
14
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for birgermoell/sven-web

Quantized
(1)
this model

Space using birgermoell/sven-web 1

Collection including birgermoell/sven-web