Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
inference-optimization
's Collections
CI Test Models
nvfp4-llama3.1-8b-ablations
Tiny Models
test-models
CI Test Models
updated
about 6 hours ago
Models used in CI tests across llm-compressor, compressed-tensors, and vllm repositories.
Upvote
-
Sort: Collection
inference-optimization/DSV4-tiny-empty
3B
•
Updated
May 18
•
2.81k
inference-optimization/GLM-5.2-0.8B-A0.8B
Text Generation
•
0.8B
•
Updated
27 days ago
•
3.1k
•
2
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation
•
0.5B
•
Updated
Jun 3
•
18.3k
•
1
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation
•
2B
•
Updated
May 24
•
7.94k
•
2
inference-optimization/DeepSeek-V3-debug-add
1B
•
Updated
Jan 23
•
4
inference-optimization/DeepSeek-V3-debug-add-FP8_DYNAMIC
1B
•
Updated
Jan 24
•
6
inference-optimization/DeepSeek-V3-debug-add-NVFP4A16
0.9B
•
Updated
Jan 23
•
1
inference-optimization/DeepSeek-V3-debug-empty
1B
•
Updated
Jan 23
•
1.86k
inference-optimization/DeepSeek-V3-debug-empty-FP8_DYNAMIC
1B
•
Updated
Jan 23
•
34k
inference-optimization/DeepSeek-V3-debug-empty-NVFP4A16
0.9B
•
Updated
Jan 23
•
706
inference-optimization/DeepSeek-V3-debug-multiply
1B
•
Updated
Jan 23
•
3
inference-optimization/DeepSeek-V3-debug-multiply-FP8_DYNAMIC
1B
•
Updated
Jan 24
•
7
inference-optimization/DeepSeek-V3-debug-multiply-NVFP4A16
0.9B
•
Updated
Jan 23
•
4
inference-optimization/Qwen3-0.6B-debug-add
0.6B
•
Updated
Jan 23
•
4
inference-optimization/Qwen3-0.6B-debug-add-FP8_BLOCK
0.6B
•
Updated
Jan 23
•
4
inference-optimization/Qwen3-0.6B-debug-add-W4A16-G128
0.6B
•
Updated
Jan 23
•
2
inference-optimization/Qwen3-0.6B-debug-multiply
0.6B
•
Updated
Jan 23
•
5
inference-optimization/Qwen3-0.6B-debug-multiply-FP8_BLOCK
0.6B
•
Updated
Jan 23
•
2
inference-optimization/Qwen3-0.6B-debug-multiply-W4A16-G128
0.6B
•
Updated
Jan 23
•
2
inference-optimization/Qwen3-0.6B-FP8_BLOCK
0.6B
•
Updated
Jan 23
•
534
inference-optimization/Qwen3-0.6B-W4A16-G128
0.6B
•
Updated
Jan 23
•
783
inference-optimization/Qwen3-8B-speculators.peagle-qwen3arch-ckpt4
2B
•
Updated
Jun 16
•
26.1k
Upvote
-
Sort: Collection
Share collection
View history
Collection guide
Browse collections