Fetching the paper…
Reading the bibliography…
Cross-modal entity linking refers to the ability to align entities and their attributes across different modalities.
The binding problem
Adina L Roskies. 1999 · 1999
Earlier work this paper cites.
Melanie Sclar, Gastón Bujia, Sebastián Vita, Guillermo Solovey, and Juan Esteban Kamienkowski. 2020 · 2009
Earlier work this paper cites.
A neural basis for real-world visual search in human occipitotemporal cortex
Marius V Peelen and Sabine Kastner. 2011 · 2011
Earlier work this paper cites.
Visual search in scenes involves selective and nonselective pathways
Jeremy M Wolfe, Melissa L-H Võ, Karla K Evans, and Michelle R Greene. 2011 · 2011
Earlier work this paper cites.
Referitgame: Referring to objects in photographs of natural scenes
Sahar Kazemzadeh, Vicente Ordonez, Mark Matten, and Tamara Berg. 2014 · 2014
Earlier work this paper cites.
Clevr: A diagnostic dataset for compositional language and elementary visual reasoning
Justin Johnson, Bharath Hariharan, Laurens Van Der Maaten, Li Fei-Fei, C Lawrence Zitnick, and Ross Girshick. 2017 · 2017
Earlier work this paper cites.
Finding any waldo with zero-shot invariant and efficient visual search
Mengmi Zhang, Jiashi Feng, Keng Teck Ma, Joo Hwee Lim, Qi Zhao, and Gabriel Kreiman. 2018 · 2018
Earlier work this paper cites.
Multimodal entity linking for tweets
Omar Adjali, Romaric Besançon, Olivier Ferret, Hervé Le Borgne, and Brigitte Grau. 2020 · 2020
Earlier work this paper cites.
Situated and interactive multimodal conversations
Seungwhan Moon, Satwik Kottur, Paul Crook, Ankita De, Shivani Poddar, Theodore Levin, David Whitney, Daniel Difranco, Ahmad Beirami, Eunjoon Cho, Rajen Subba, and Alborz Geramifard. 2020 · 2020
Earlier work this paper cites.
Visual search: How do we find what we are looking for?
Jeremy M Wolfe. 2020 · 2020
Cited alongside, same era.
Predicting goal-directed human attention using inverse reinforcement learning
Zhibo Yang, Lihan Huang, Yupei Chen, Zijun Wei, Seoyoung Ahn, Gregory Zelinsky, Dimitris Samaras, and Minh Hoai. 2020 · 2020
Cited alongside, same era.
Multimodal entity linking: a new dataset and a baseline
Jingru Gan, Jinchang Luo, Haiwei Wang, Shuhui Wang, Wei He, and Qingming Huang. 2021 · 2021
Cited alongside, same era.
SIMMC 2.0: A task-oriented dialog dataset for immersive multimodal conversations
Satwik Kottur, Seungwhan Moon, Alborz Geramifard, and Babak Damavandi. 2021 · 2021
Cited alongside, same era.
Chain-of-thought prompting elicits reasoning in large language models
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H. Chi, Quoc V. Le, and Denny Zhou. 2022 · 2022
Cited alongside, same era.
Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Amy Yang, Angela Fan, et al. 2024 · 2024
Later among the works it cites.
Mmcode: Benchmarking multimodal large language models for code generation with visually rich programming problems
Kaixin Li, Yuchen Tian, Qisheng Hu, Ziyang Luo, Zhiyong Huang, and Jing Ma. 2024b · 2024
Later among the works it cites.
Event-radar: Event-driven multi-view learning for multimodal fake news detection
Zihan Ma, Minnan Luo, Hao Guo, Zhi Zeng, Yiran Hao, and Xiang Zhao. 2024 · 2024
Later among the works it cites.
A dual-way enhanced framework from text matching point of view for multimodal entity linking
Shezheng Song, Shan Zhao, Chengyu Wang, Tianwei Yan, Shasha Li, Xiaoguang Mao, and Meng Wang. 2024 · 2024
Later among the works it cites.
A multimodal fusion framework for urban scene understanding and functional identification using geospatial data
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Jing Jing, Hongchen Wu, Jie Sun, Xiaochang Fang, and Huaxiang Zhang. 2023 · 2023
Cited alongside, same era.
Understanding the limits of vision language models through the lens of the binding problem
Declan Iain Campbell, Sunayana Rane, Tyler Giallanza, C. Nicolò De Sabbata, Kia Ghods, Amogh Joshi, Alexander Ku, Steven M Frankland, Thomas L. Griffiths, Jonathan D. Cohen, and Taylor Whittington Webb. 2024 · 2024
Cited alongside, same era.
Measuring and improving chain-of-thought reasoning in vision-language models
Yangyi Chen, Karan Sikka, Michael Cogswell, Heng Ji, and Ajay Divakaran. 2024 · 2024
Cited alongside, same era.
Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models
Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, et al. 2024 · 2024
Cited alongside, same era.
Overview of indoor scene recognition and representation methods based on multimodal knowledge graphs
Jianxin Li, Guannan Si, Pengxin Tian, Zhaoliang An, and Fengyu Zhou. 2024a
Cited in the paper.
Llava-next: Improved reasoning, ocr, and world knowledge
Haotian Liu, Chunyuan Li, Yuheng Li, Bo Li, Yuanhan Zhang, Sheng Shen, and Yong Jae Lee. 2024a
Cited in the paper.
Visual instruction tuning
Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. 2024b
Cited in the paper.
Chen Su, Xinli Hu, Qingyan Meng, Linlin Zhang, Wenxu Shi, and Maofan Zhao. 2024 · 2024
Later among the works it cites.
V?: Guided visual search as a core mechanism in multimodal llms
Penghao Wu and Saining Xie. 2024 · 2024
Later among the works it cites.
Ameli: Enhancing multimodal entity linking with fine-grained attributes
Barry Yao, Sijia Wang, Yu Chen, Qifan Wang, Minqian Liu, Zhiyang Xu, Licheng Yu, and Lifu Huang. 2024 · 2024
Later among the works it cites.
Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, and Junyang Lin. 2025 · 2025
Closest in time.
Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning
Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, and Wenhu Chen. 2025 · 2025
Closest in time.