Fetching the paper…

LightCLIP: Learning Multi-Level Interaction for Lightweight Vision-Language Models · Around