Fetching the paper…

CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms · Around