Fetching the paper…

InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management · Around