Fetching the paper…
Reading the bibliography…
Large Language Models (LLMs) have demonstrated potential in Vision-and-Language Navigation (VLN) tasks, yet current applications face challenges.
Generating Long Sequences with Sparse Transformers
Child, R.; Gray, S.; Radford, A.; and Sutskever, I. 2019 · 1904
Earlier work this paper cites.
Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments
Anderson, P.; Wu, Q.; Teney, D.; Bruce, J.; Johnson, M.; Sünderhauf, N.; Reid, I.; Gould, S.; and Van Den Hengel, A. 2018 · 2018
Earlier work this paper cites.
Speaker-follower models for vision-and-language navigation
Fried, D.; Hu, R.; Cirik, V.; Rohrbach, A.; Andreas, J.; Morency, L. P.; Berg Kirkpatrick, T.; Saenko, K.; Klein, D.; and Darrell, T. 2018 · 2018
Earlier work this paper cites.
Learning to navigate in cities without a map
Mirowski, P.; Grimes, M.; Malinowski, M.; Hermann, K. M.; Anderson, K.; Teplyashin, D.; Simonyan, K.; Zisserman, A.; Hadsell, R.; et al. 2018 · 2018
Earlier work this paper cites.
Touchdown: Natural language navigation and spatial reasoning in visual street environments
Chen, H.; Suhr, A.; Misra, D.; Snavely, N.; and Artzi, Y. 2019 · 2019
Earlier work this paper cites.
Transferable representation learning in vision-and-language navigation
Huang, H.; Jain, V.; Mehta, H.; Ku, A.; Magalhaes, G.; Baldridge, J.; and Ie, E. 2019 · 2019
Earlier work this paper cites.
Counterfactual vision-and-language navigation via adversarial path sampler
Fu, T. J.; Wang, X. E.; Peterson, M. F.; Grafton, S. T.; Eckstein, M. P.; and Wang, W. Y. 2020 · 2020
Earlier work this paper cites.
Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding
Ku, A.; Anderson, P.; Patel, R.; Ie, E.; and Baldridge, J. 2020 · 2020
Earlier work this paper cites.
Counterfactual vision-and-language navigation: Unravelling the unseen
Parvaneh, A.; Abbasnejad, E.; Teney, D.; Shi, J. Q.; and Van den Hengel, A. 2020 · 2020
Earlier work this paper cites.
Reverie: Remote embodied visual referring expression in real indoor environments
Qi, Y.; Wu, Q.; Anderson, P.; Wang, X.; Wang, W. Y.; Shen, C.; and Hengel, A. v. d. 2020 · 2020
Earlier work this paper cites.
Learning to stop: A simple yet effective approach to urban vision-language navigation
Xiang, J.; Wang, X.; and Wang, W. Y. 2020 · 2020
Earlier work this paper cites.
Vision-language navigation with random environmental mixup
Liu, C.; Zhu, F.; Chang, X.; Liang, X.; Ge, Z.; and Shen, Y. D. 2021 · 2021
Earlier work this paper cites.
Learning transferable visual models from natural language supervision
Radford, A.; Kim, J. W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al. 2021 · 2021
Earlier work this paper cites.
Generating landmark navigation instructions from maps as a graph-to-text problem
Schumann, R.; and Riezler, S. 2021 · 2021
Earlier work this paper cites.
On the evaluation of vision-and-language navigation instructions
Zhao, M.; Anderson, P.; Jain, V.; Wang, S.; Ku, A.; Baldridge, J.; and Ie, E. 2021 · 2021
Earlier work this paper cites.
Multimodal text style transfer for outdoor vision-and-language navigation
Zhu, W.; Wang, X.; Fu, T. J.; Yan, A.; Narayana, P.; Sone, K.; Basu, S.; and Wang, W. Y. 2021 · 2021
Cited alongside, same era.
Flamingo: a visual language model for few-shot learning
Alayrac, J. B.; Donahue, J.; Luc, P.; Miech, A.; Barr, I.; Hasson, Y.; Lenc, K.; Mensch, A.; Millican, K.; Reynolds, M.; et al. 2022 · 2022
Cited alongside, same era.
Foam: A follower-aware speaker model For vision-and-language navigation
Dou, Z. Y.; and Peng, N. 2022 · 2022
Cited alongside, same era.
Learn to explain: Multimodal reasoning via thought chains for science question answering
Lu, P.; Mishra, S.; Xia, T.; Qiu, L.; Chang, K. W.; Zhu, S. C.; Tafjord, O.; Clark, P.; and Kalyan, A. 2022 · 2022
Cited alongside, same era.
Analyzing generalization of vision and language navigation to unseen outdoor areas
Schumann, R.; and Riezler, S. 2022 · 2022
Cited alongside, same era.
Mapgpt: map-guided prompting with adaptive path planning for vision-and-language navigation
Chen, J.; Lin, B.; Xu, R.; Chai, Z.; Liang, X.; and Wong, K. Y. K. 2024 · 2024
Closest in time.
Obelics: An open web-scale filtered dataset of interleaved image-text documents
Laurençon, H.; Saulnier, L.; Tronchon, L.; Bekman, S.; Singh, A.; Lozhkov, A.; Wang, T.; Karamcheti, S.; Rush, A.; Kiela, D.; et al. 2024 · 2024
Closest in time.
Vln-video: Utilizing driving videos for outdoor vision-and-language navigation
Li, J.; Padmakumar, A.; Sukhatme, G.; and Bansal, M. 2024 · 2024
Closest in time.
Correctable landmark discovery via large models for vision-language navigation
Lin, B.; Nie, Y.; Wei, Z.; Zhu, Y.; Xu, H.; Ma, S.; Liu, J.; and Liang, X. 2024 · 2024
Closest in time.
Visual instruction tuning
Liu, H.; Li, C.; Wu, Q.; and Lee, Y. J. 2024 · 2024
Closest in time.
Discuss before moving: Visual language navigation via multi-expert discussions
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Wei, J.; Wang, X.; Schuurmans, D.; Bosma, M.; Xia, F.; Chi, E.; Le, Q. V.; Zhou, D.; et al. 2022 · 2022
Cited alongside, same era.
Achiam, J.; Adler, S.; Agarwal, S.; Ahmad, L.; Akkaya, I.; Aleman, F. L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al. 2023 · 2023
Cited alongside, same era.
A priority map for vision-and-language navigation with trajectory plans and feature-location cues
Armitage, J.; Impett, L.; and Sennrich, R. 2023 · 2023
Cited alongside, same era.
OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models
Awadalla, A.; Gao, I.; Gardner, J.; Hessel, J.; Hanafy, Y.; Zhu, W.; Marathe, K.; Bitton, Y.; Gadre, S.; Sagawa, S.; et al. 2023 · 2023
Cited alongside, same era.
Instructblip: Towards general-purpose vision-language models with instruction tuning
Dai, W.; Li, J.; Li, D.; Tiong, A.; Zhao, J.; Wang, W.; Li, B.; Fung, P.; and Hoi, S. 2023 · 2023
Cited alongside, same era.
March in chat: Interactive prompting for remote embodied referring expression
Qiao, Y.; Qi, Y.; Yu, Z.; Liu, J.; and Wu, Q. 2023 · 2023
Cited alongside, same era.
LLaMA: Open and Efficient Foundation Language Models
Touvron, H.; Lavril, T.; Izacard, G.; Martinet, X.; Lachaux, M. A.; Lacroix, T.; Rozière, B.; Goyal, N.; Hambro, E.; Azhar, F.; et al. 2023 · 2023
Cited alongside, same era.
Long, Y.; Li, X.; Cai, W.; and Dong, H. 2024 · 2024
Closest in time.
Velma: Verbalization embodiment of llm agents for vision and language navigation in street view
Schumann, R.; Zhu, W.; Feng, W.; Fu, T.-J.; Riezler, S.; and Wang, W. Y. 2024 · 2024
Closest in time.
Generative multimodal models are in-context learners
Sun, Q.; Cui, Y.; Zhang, X.; Zhang, F.; Yu, Q.; Wang, Y.; Rao, Y.; Liu, J.; Huang, T.; and Wang, X. 2024 · 2024
Closest in time.
Loc4plan: Locating before planning for outdoor vision and language navigation
Tian, H.; Meng, J.; Zheng, W. S.; Li, Y. M.; Yan, J.; and Zhang, Y. 2024 · 2024
Closest in time.
NExT-GPT: Any-to-Any Multimodal LLM
Wu, S.; Fei, H.; Qu, L.; Ji, W.; and Chua, T.-S. 2024 · 2024
Closest in time.
Navid: Video-based vlm plans the next step for vision-and-language navigation
Zhang, J.; Wang, K.; Xu, R.; Zhou, G.; Hong, Y.; Fang, X.; Wu, Q.; Zhang, Z.; and He, W. 2024 · 2024
Closest in time.
Towards learning a generalist model for embodied navigation
Zheng, D.; Huang, S.; Zhao, L.; Zhong, Y.; and Wang, L. 2024 · 2024
Closest in time.
Navgpt-2: Unleashing navigational reasoning capability for large vision-language models
Zhou, G.; Hong, Y.; Wang, Z.; Wang, X. E.; and Wu, Q. 2024 · 2024
Closest in time.
Navgpt: Explicit reasoning in vision-and-language navigation with large language models
Zhou, G.; Hong, Y.; and Wu, Q. 2024 · 2024
Closest in time.