Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 5 days ago • 17
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 5 days ago • 17
Unlocking Lossless Speedups in LLMs via Discrete Diffusion Paper • 2609.04010 • Published 6 days ago • 85
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 5 days ago • 17 • 2
Unlocking Lossless Speedups in LLMs via Discrete Diffusion Paper • 2609.04010 • Published 6 days ago • 85
Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM Paper • 2601.18306 • Published Jan 26
Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation Paper • 2608.15062 • Published 14 days ago • 11