-
inference-optimization/Qwen3-8B-DFlash-Gauss-FP8-W8A8
Text Generation • 1B • Updated • 32 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-FP8-W8A8
Text Generation • 1B • Updated • 30 -
inference-optimization/Qwen3-8B-DFlash-Gauss-NVFP4-W4A4
Text Generation • 1B • Updated • 114 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-NVFP4-W4A4
Text Generation • 1B • Updated • 110
Inference Optimization
community
AI & ML interests
None defined yet.
Recent Activity
View all activity
Models used in CI tests across llm-compressor, compressed-tensors, and vllm repositories.
-
inference-optimization/DSV4-tiny-empty
3B • Updated • 4.98k • 1 -
inference-optimization/GLM-5.2-0.8B-A0.8B
Text Generation • 0.8B • Updated • 5.11k • 4 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 21k • 1 -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 14.7k • 3
-
inference-optimization/Qwen3-8B-DFlash-Gauss-FP8-W8A8
Text Generation • 1B • Updated • 32 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-FP8-W8A8
Text Generation • 1B • Updated • 30 -
inference-optimization/Qwen3-8B-DFlash-Gauss-NVFP4-W4A4
Text Generation • 1B • Updated • 114 -
inference-optimization/Qwen3-8B-DFlash-PerfectBlend-NVFP4-W4A4
Text Generation • 1B • Updated • 110
Models used in CI tests across llm-compressor, compressed-tensors, and vllm repositories.
-
inference-optimization/DSV4-tiny-empty
3B • Updated • 4.98k • 1 -
inference-optimization/GLM-5.2-0.8B-A0.8B
Text Generation • 0.8B • Updated • 5.11k • 4 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 21k • 1 -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 14.7k • 3
models 476
inference-optimization/qwen38-dspark-cooldown-fineweb
2B • Updated • 26
inference-optimization/qwen38-dspark-pretrain-fineweb
2B • Updated • 40
inference-optimization/Qwen3-30B-A3B-Thinking-2507-REAP-25-nonuniform
Text Generation • 23B • Updated • 163
inference-optimization/Qwen3-30B-A3B-Thinking-2507-REAP-25-uniform
Text Generation • 23B • Updated • 260 • 1
inference-optimization/qwen3.8-27B-speculator.dflash2.comparisonrecipe.v2.epoch1_end
2B • Updated • 97
inference-optimization/gemma-4-31B-it-speculator.dflash.latestrecipe.bs8.ckp0
3B • Updated • 33
inference-optimization/Qwen3.8-27B-DSpark-GPTQ-IMatrix-PerfectBlend-NVFP4-W4A4
Text Generation • 2B • Updated • 54
inference-optimization/Qwen3.8-27B-DSpark-GPTQ-IMatrix-Gauss-NVFP4-W4A4
Text Generation • 2B • Updated • 51
inference-optimization/Qwen3.8-27B-DSpark-GPTQ-PerfectBlend-NVFP4-W4A4
Text Generation • 2B • Updated • 51
inference-optimization/Qwen3.8-27B-DSpark-GPTQ-Gauss-NVFP4-W4A4
Text Generation • 2B • Updated • 50
datasets 32
inference-optimization/gemma-4-31b-it-responses-open-perfectblend
Updated • 24
inference-optimization/dflash-code-multilingual-teacher-responses-qwen235b
Viewer • Updated • 303k • 133 • 2
inference-optimization/speculators-ci-datasets
Viewer • Updated • 6.7k • 1.16k
inference-optimization/qwen3-test-model
Updated • 8
inference-optimization/dflash-qwen3-8b-qwen235b-instruct-bs16-prepared-data
Preview • Updated • 36
inference-optimization/every-eval-ever-demo
Viewer • Updated • 1 • 8
inference-optimization/DeepSeek-V4-Flash-responses
Viewer • Updated • 508k • 24
inference-optimization/Qwen3.5-4B-responses
Viewer • Updated • 7.47k • 81
inference-optimization/Qwen3.5-0.8B-responses
Viewer • Updated • 7.47k • 99
inference-optimization/Qwen3.5-9B-responses
Viewer • Updated • 7.67k • 39