-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 24 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 12 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 24 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 24
Inference Optimization
community
AI & ML interests
None defined yet.
Recent Activity
View all activity
-
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch3
2B • Updated • 7 -
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch1
2B • Updated • 8 -
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch2
2B • Updated • 9 -
inference-optimization/Qwen3-Next-80B-A3B-Instruct-GSM8K-MTP-finetuned
81B • Updated • 64
Tiny models used for testing
-
inference-optimization/gemma-4-1B-0.8B-tiny
1B • Updated • 71 • 1 -
inference-optimization/DSV4-tiny-empty
3B • Updated • 2.73k -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 7.79k • 1 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 17.8k • 1
-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 24 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 12 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 24 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 24
Tiny models used for testing
-
inference-optimization/gemma-4-1B-0.8B-tiny
1B • Updated • 71 • 1 -
inference-optimization/DSV4-tiny-empty
3B • Updated • 2.73k -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 7.79k • 1 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 17.8k • 1
-
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch3
2B • Updated • 7 -
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch1
2B • Updated • 8 -
inference-optimization/Qwen3-Next-80B-A3B-Instruct-MTP-ultrachat-epoch2
2B • Updated • 9 -
inference-optimization/Qwen3-Next-80B-A3B-Instruct-GSM8K-MTP-finetuned
81B • Updated • 64