Fetching the paper…

TokenFlow: Rethinking Fine-grained Cross-modal Alignment in Vision-Language Retrieval · Around