HyQuant: Hybrid-Precision Quantization for LLM Attention Paper • 2608.27875 • Published 18 days ago • 31
BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference Paper • 2609.04971 • Published 11 days ago • 39