Qwen3.5-4B-NQ-rebal (KL-lens rebalanced, MTP removed)

JD97/Qwen3.5-4B-NQ 기반. KL forward-only sensitivity 분석으로 정밀도 재배분:

  • out_proj (GDN 출력): W4 -> W8 — KL 가성비 1위(작고 민감, L0/out_proj outlier). +0.25GB.
  • in_proj_a/b (decay/gate): BF16 -> W4 — KL상 둔감(논문 dt 무감각 일치). latency 회수.
  • 순효과: ~latency 중립, GPQA razor-thin(NQ full=0.6212, gate 0.630) 회복 시도.
  • MTP head 제거 (DFlash draft 사용).

구성 (fused 모듈, vLLM 서빙용)

  • group_0 W4 g32: gate_up_proj, down_proj, in_proj_qkvz, in_proj_ba (a/b)
  • group_1 W8 g32: out_proj
  • group_2 W8 g32: lm_head
  • BF16: full-attn(q/k/v/o), vision
  • RTN(data-free). 서빙 검증 완료(mixed-precision은 fused-name 정규식 필수, "Linear" catch-all 금지 — scheme 충돌).

서빙

W8 lm_head용 docker/lmhead-quant.patch 필요(NQ와 동일). docker/serve.py 참조.

Downloads last month
15
Safetensors
Model size
5B params
Tensor type
I64
·
I32
·
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for JD97/Qwen3.5-4B-NQ-rebal

Finetuned
Qwen/Qwen3.5-4B
Quantized
(313)
this model