Qwen3.5-4B-NQ-gdnw8 (mixed-precision recovery variant)

JD97/Qwen3.5-4B-NQ 기반. GDN linear_attn 입력 projection(in_proj_qkv, in_proj_z)을 W4→W8로 bump해 GPQA razor-thin 미달(NQ full GPQA=0.6212, gate 0.630) 회복을 노린 변형.

구성 (NQ 대비 변경점만)

  • group_0: W4 g32 (Linear body: MLP, GDN out_proj)
  • group_1: W8 g32 (linear_attn.in_proj_qkv, in_proj_z) ← bumped (SSM 입력 projection, 민감)
  • group_2: W8 g32 (lm_head, NQ와 동일)
  • ignore(BF16): linear_attn.in_proj_a/b, full-attn q/k/v/o(8층), vision, MTP, embed
  • RTN(data-free) 양자화. 멀티모달 구조 보존.

서빙

NQ와 동일하게 docker/lmhead-quant.patch(W8 lm_head용 패치 vLLM) 필요. docker/serve.py 참조.

근거

KL forward-only sensitivity 연구(SSM-Transformer 하이브리드)상 SSM 입력/cross-projection이 가장 민감, decay(dt/a-b)는 둔감. NQ가 a/b는 BF16 보존하면서 민감한 in_proj는 W4로 깎은 배분을 교정.

Downloads last month
4
Safetensors
Model size
5B params
Tensor type
I64
·
I32
·
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for JD97/Qwen3.5-4B-NQ-gdnw8

Finetuned
Qwen/Qwen3.5-4B
Quantized
(413)
this model