Fetching the paper…
Reading the bibliography…
Zero-shot navigation is a critical challenge in Vision-Language Navigation (VLN) tasks, where the ability to adapt to unfamiliar instructions and to act in unknown environments is essential.
“Vqa: Visual question answering,”
Stanislaw Antol, Aishwarya Agrawal, Jiasen Lu, Margaret Mitchell, Dhruv Batra, C Lawrence Zitnick, and Devi Parikh, · 2015
Earlier work this paper cites.
“An embarrassingly simple approach to zero-shot learning,”
Bernardino Romera-Paredes and Philip Torr, · 2015
Earlier work this paper cites.
“Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,”
Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko Sünderhauf, Ian Reid, Stephen Gould, and Anton Van Den Hengel, · 2018
Earlier work this paper cites.
“Speaker-follower models for vision-and-language navigation,”
Daniel Fried, Ronghang Hu, Volkan Cirik, Anna Rohrbach, Jacob Andreas, Louis-Philippe Morency, Taylor Berg-Kirkpatrick, Kate Saenko, Dan Klein, and Trevor Darrell, · 2018
Earlier work this paper cites.
“Learning to navigate unseen environments: Back translation with environmental dropout,”
Hao Tan, Licheng Yu, and Mohit Bansal, · 2019
Earlier work this paper cites.
“Chasing ghosts: Instruction following as bayesian state tracking,”
Peter Anderson, Ayush Shrivastava, Devi Parikh, Dhruv Batra, and Stefan Lee, · 2019
Earlier work this paper cites.
“End-to-end object detection with transformers,”
Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, and Sergey Zagoruyko, · 2020
Earlier work this paper cites.
“Vln bert: A recurrent vision-and-language bert for navigation,”
Yicong Hong, Qi Wu, Yuankai Qi, Cristian Rodriguez-Opazo, and Stephen Gould, · 2021
Earlier work this paper cites.
“History aware multimodal transformer for vision-and-language navigation,”
Shizhe Chen, Pierre-Louis Guhur, Cordelia Schmid, and Ivan Laptev, · 2021
Earlier work this paper cites.
“Adapt: Vision-language navigation with modality-aligned action prompts,”
Bingqian Lin, Yi Zhu, Zicong Chen, Xiwen Liang, Jianzhuang Liu, and Xiaodan Liang, · 2022
Earlier work this paper cites.
“Chain-of-thought prompting elicits reasoning in large language models,”
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou, et al., · 2022
Cited alongside, same era.
“Emergent abilities of large language models,”
Jason Wei, Yi Tay, Rishi Bommasani, Colin Raffel, Barret Zoph, Sebastian Borgeaud, Dani Yogatama, Maarten Bosma, Denny Zhou, Donald Metzler, et al., · 2022
Cited alongside, same era.
“Large language models are zero-shot reasoners,”
Takeshi Kojima, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo, and Yusuke Iwasawa, · 2022
Cited alongside, same era.
“Masked-attention mask transformer for universal image segmentation,”
Bowen Cheng, Ishan Misra, Alexander G Schwing, Alexander Kirillov, and Rohit Girdhar, · 2022
Cited alongside, same era.
“React: Synergizing reasoning and acting in language models,”
Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, and Yuan Cao, · 2022
“Towards language models that can see: Computer vision through the lens of natural language,”
William Berrios, Gautam Mittal, Tristan Thrush, Douwe Kiela, and Amanpreet Singh, · 2023
Later among the works it cites.
“Internchat: Solving vision-centric tasks by interacting with chatbots beyond language,”
Zhaoyang Liu, Yinan He, Wenhai Wang, Weiyun Wang, Yi Wang, Shoufa Chen, Qinglong Zhang, Yang Yang, Qingyun Li, Jiashuo Yu, et al., · 2023
Later among the works it cites.
“Minigpt-4: Enhancing vision-language understanding with advanced large language models,”
Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, and Mohamed Elhoseiny, · 2023
Later among the works it cites.
“Navgpt: Explicit reasoning in vision-and-language navigation with large language models,”
Gengze Zhou, Yicong Hong, and Qi Wu, · 2023
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
“Llama: open and efficient foundation language models, 2023,”
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al., · 2023
Cited alongside, same era.
“Vln-trans: Translator for the vision and language navigation agent,”
Yue Zhang and Parisa Kordjamshidi, · 2023
Cited alongside, same era.
Peihao Chen, Xinyu Sun, Hongyan Zhi, Runhao Zeng, Thomas H Li, Gaowen Liu, Mingkui Tan, and Chuang Gan, · 2023
Cited alongside, same era.
“Mo-vln: A multi-task benchmark for open-set zero-shot vision-and-language navigation,”
Xiwen Liang, Liang Ma, Shanshan Guo, Jianhua Han, Hang Xu, Shikui Ma, and Xiaodan Liang, · 2023
Cited alongside, same era.
Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi, · 2023
Later among the works it cites.
“Instruct2act: Mapping multi-modality instructions to robotic actions with large language model,”
Siyuan Huang, Zhengkai Jiang, Hao Dong, Yu Qiao, Peng Gao, and Hongsheng Li, · 2023
Later among the works it cites.
“Gpt-4 technical report,” 2023
OpenAI, · 2023
Later among the works it cites.
“Langnav: Language as a perceptual representation for navigation,”
Bowen Pan, Rameswar Panda, SouYoung Jin, Rogerio Feris, Aude Oliva, Phillip Isola, and Yoon Kim, · 2023
Later among the works it cites.
“Show, attend and tell: Neural image caption generation with visual attention,”
Kelvin Xu, Jimmy Ba, Ryan Kiros, Kyunghyun Cho, Aaron Courville, Ruslan Salakhudinov, Rich Zemel, and Yoshua Bengio, · 2057
Closest in time.