aivrar

aivrar/multi-turboquant

Unified KV-cache compression for LLM inference: 12 Python-native methods, guarded add-on composition and routing, analytical capacity simulation, Godzilla KVarN/TriAttention with SM86/SM89 qualification, CUDA weight sharing, and multi-GPU planning.

⭐ 25 ⑂ 6 Python MIT · 3 小时前推送
25
Watchers
0
贡献者
0
Commits
0
Releases
3
Open Issues
3 小时前
最近推送
原文 中文
暂无 README