ahb-sjsu/turboquant-pro
Consumer-aware compression for embedding indexes and LLM KV caches — compress by the metric the downstream consumer actually uses. PCA-Matryoshka + TurboQuant (27x @ 99.8% recall@10), asymmetric K/V, CUDA/Triton kernels, vLLM plugin, replayable CI-gated claims. MIT.
⭐ 24
⑂ 1
Python
MIT
· 6 天前推送
24
Watchers
0
贡献者
0
Commits
0
Releases
13
Open Issues
6 天前
最近推送
原文
中文
暂无 README