Qwen3.5-4B-NQ-rebal (KL-lens rebalanced, MTP removed)
JD97/Qwen3.5-4B-NQ 기반. KL forward-only sensitivity 분석으로 정밀도 재배분:
- out_proj (GDN 출력): W4 -> W8 — KL 가성비 1위(작고 민감, L0/out_proj outlier). +0.25GB.
- in_proj_a/b (decay/gate): BF16 -> W4 — KL상 둔감(논문 dt 무감각 일치). latency 회수.
- 순효과: ~latency 중립, GPQA razor-thin(NQ full=0.6212, gate 0.630) 회복 시도.
- MTP head 제거 (DFlash draft 사용).
구성 (fused 모듈, vLLM 서빙용)
- group_0 W4 g32: gate_up_proj, down_proj, in_proj_qkvz, in_proj_ba (a/b)
- group_1 W8 g32: out_proj
- group_2 W8 g32: lm_head
- BF16: full-attn(q/k/v/o), vision
- RTN(data-free). 서빙 검증 완료(mixed-precision은 fused-name 정규식 필수, "Linear" catch-all 금지 — scheme 충돌).
서빙
W8 lm_head용 docker/lmhead-quant.patch 필요(NQ와 동일). docker/serve.py 참조.
- Downloads last month
- 15
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support