nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-FP8 Text Generation • 78B • Updated 24 days ago • 23.5k • 17
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 Text Generation • 45B • Updated 24 days ago • 68.2k • 127
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 Text Generation • 75B • Updated 24 days ago • 4.18k • 58
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 Text Generation • 45B • Updated 24 days ago • 68.2k • 127
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-FP8 Text Generation • 78B • Updated 24 days ago • 23.5k • 17
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 Text Generation • 75B • Updated 24 days ago • 4.18k • 58
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 Text Generation • 45B • Updated 24 days ago • 68.2k • 127
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-FP8 Text Generation • 78B • Updated 24 days ago • 23.5k • 17
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 Text Generation • 75B • Updated 24 days ago • 4.18k • 58
view article Article Introducing SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding nvidia • Mar 19 • 49
FFN Fusion: Rethinking Sequential Computation in Large Language Models Paper • 2503.18908 • Published Mar 24, 2025 • 20
Puzzle: Distillation-Based NAS for Inference-Optimized LLMs Paper • 2411.19146 • Published Nov 28, 2024 • 22