-
inference-optimization/Qwen3-8B-DFlash-Gauss-FP8-W8A8
Text Generation • 1B • Updated • 34 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-FP8-W8A8
Text Generation • 1B • Updated • 32 -
inference-optimization/Qwen3-8B-DFlash-Gauss-NVFP4-W4A4
Text Generation • 1B • Updated • 118 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-NVFP4-W4A4
Text Generation • 1B • Updated • 114
Inference Optimization
community
AI & ML interests
None defined yet.
Recent Activity
View all activity
Tiny models used for testing
-
inference-optimization/gemma-4-1B-0.8B-tiny
1B • Updated • 1.37k • 2 -
inference-optimization/DSV4-tiny-empty
3B • Updated • 4.96k • 1 -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 14.7k • 3 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 20.9k • 1
Models used in CI tests across llm-compressor, compressed-tensors, and vllm repositories.
-
inference-optimization/DSV4-tiny-empty
3B • Updated • 4.96k • 1 -
inference-optimization/GLM-5.2-0.8B-A0.8B
Text Generation • 0.8B • Updated • 5.1k • 4 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 20.9k • 1 -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 14.7k • 3
-
inference-optimization/Qwen3-8B-DFlash-Gauss-FP8-W8A8
Text Generation • 1B • Updated • 34 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-FP8-W8A8
Text Generation • 1B • Updated • 32 -
inference-optimization/Qwen3-8B-DFlash-Gauss-NVFP4-W4A4
Text Generation • 1B • Updated • 118 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-NVFP4-W4A4
Text Generation • 1B • Updated • 114
Models used in CI tests across llm-compressor, compressed-tensors, and vllm repositories.
-
inference-optimization/DSV4-tiny-empty
3B • Updated • 4.96k • 1 -
inference-optimization/GLM-5.2-0.8B-A0.8B
Text Generation • 0.8B • Updated • 5.1k • 4 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 20.9k • 1 -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 14.7k • 3
Tiny models used for testing
-
inference-optimization/gemma-4-1B-0.8B-tiny
1B • Updated • 1.37k • 2 -
inference-optimization/DSV4-tiny-empty
3B • Updated • 4.96k • 1 -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 14.7k • 3 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 20.9k • 1