CSIM Building, Asian Institute of Technology (AIT)
Efficient Language Model Inference with Adaptive Cache Compression
An adaptive cache compression strategy that reduces memory usage while preserving language-model performance.
An adaptive cache compression strategy that reduces memory usage while preserving language-model performance.