MLX-native port of KVarN — variance-normalized KV-cache quantization for Apple Silicon. 3.3× compression at 71% FP16 speed, matches FP16 on GSM8K within ~2%.
mac metal transformer quantization mlx kv-cache apple-silicon llm llm-inference kv-cache-quantization apple-ml
-
Updated
Jun 12, 2026 - Python