RedHatAI/DeepSeek-R1-Distill-Qwen-32B-quantized.w8a8
Text Generation • 33B • Updated • 594 • 13
OpenSource and AI
SNLP: Layer-Parallel Inference via Structured Newton Corrections
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation