Fetching the paper…
Reading the bibliography…
Visual grounding (VG) is a challenging task to localize an object in an image based on a textual description.
“Modeling context in referring expressions,”
Licheng Yu, Patrick Poirson, Shan Yang, et al., · 2016
Earlier work this paper cites.
“Generation and comprehension of unambiguous object descriptions,”
Junhua Mao, Jonathan Huang, et al., · 2016
Earlier work this paper cites.
“Deep residual learning for image recognition,”
Kaiming He, Xiangyu Zhang, Shaoqing Ren, et al., · 2016
Earlier work this paper cites.
“MAttNet: Modular attention network for referring expression comprehension,”
Licheng Yu, Zhe Lin, Xiaohui Shen, et al., · 2018
Earlier work this paper cites.
“Bert: Pre-training of deep bidirectional transformers for language understanding,”
Jacob Devlin, Ming-Wei Chang, Kenton Lee, et al., · 2018
Earlier work this paper cites.
“A fast and accurate one-stage approach to visual grounding,”
Zhengyuan Yang, Boqing Gong, et al., · 2019
Earlier work this paper cites.
“Parameter-efficient transfer learning for nlp,”
Neil Houlsby, Andrei Giurgiu, et al., · 2019
Earlier work this paper cites.
“Learning to compose and reason with language tree structures for visual grounding,”
Richang Hong, Daqing Liu, Xiaoyu Mo, et al., · 2019
Earlier work this paper cites.
“End-to-end object detection with transformers,”
Nicolas Carion, Francisco Massa, et al., · 2020
Cited alongside, same era.
“TransVG: End-to-end visual grounding with transformers,”
Jiajun Deng, Zhengyuan Yang, et al., · 2021
Cited alongside, same era.
“One-stage visual grounding via semantic-aware feature filter,”
Jiabo Ye, Xin Lin, Liang He, et al., · 2021
Cited alongside, same era.
“AdaptFormer: Adapting vision transformers for scalable visual recognition,”
Shoufa Chen, Chongjian Ge, et al., · 2022
Cited alongside, same era.
“LoRA: Low-rank adaptation of large language models,”
Edward J Hu, Yelong Shen, Phillip Wallis, et al., · 2022
Cited alongside, same era.
“Cross-modal adapter for text-video retrieval,”
Haojun Jiang, Jianke Zhang, Rui Huang, et al., · 2022
“One for all: One-stage referring expression comprehension with dynamic reasoning,”
Zhipeng Zhang, Zhimin Wei, Zhongzhen Huang, et al., · 2023
Later among the works it cites.
“Parameter-efficient transfer learning for remote sensing image-text retrieval,”
Yuan Yuan, Yang Zhan, et al., · 2023
Later among the works it cites.
“VoP: Text-video co-operative prompt tuning for cross-modal retrieval,”
Siteng Huang, Biao Gong, Yulin Pan, et al., · 2023
Later among the works it cites.
“Bridging vision and language encoders: Parameter-efficient tuning for referring image segmentation,”
Zunnan Xu, Zhihong Chen, Yong Zhang, et al., · 2023
Later among the works it cites.
“VGDiffZero: Text-to-image diffusion models can be zero-shot visual grounders,”
Xuyang Liu, Siteng Huang, Yachen Kang, et al., · 2024
Closest in time.
“DAP: Domain-aware prompt learning for vision-and-language navigation,”
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
“A proposal-free one-stage framework for referring expression comprehension and generation via dense cross-attention,”
Mengyang Sun, Wei Suo, Peng Wang, et al., · 2022
Cited alongside, same era.
“Visual grounding with transformers,”
Ye Du, Zehua Fu, Qingjie Liu, et al., · 2022
Cited alongside, same era.
Ting Liu, Yue Hu, Wansen Wu, et al., · 2024
Closest in time.
“MmAP: Multi-modal alignment prompt for cross-domain multi-task learning,”
Yi Xin, Junlong Du, et al., · 2024
Closest in time.