Fetching the paper…
Reading the bibliography…
Vision-and-Language Navigation (VLN) in continuous environments requires agents to interpret natural language instructions while navigating unconstrained 3D spaces.
J. Deng et al. , “Imagenet: A large-scale hierarchical image database,” in CVPR , 2009, pp. 248–255
2009
Earlier work this paper cites.
O. Ronneberger et al. , “U-net: Convolutional networks for biomedical image segmentation,” in MICCAI , N. Navab, J. Hornegger, W. M. W. III, and A. F. Frangi, Eds., vol. 9351, 2015, pp. 234–241
2015
Earlier work this paper cites.
K. He et al. , “Deep residual learning for image recognition,” in CVPR . IEEE Computer Society, 2016, pp. 770–778
2016
Earlier work this paper cites.
A. Chang et al. , “Matterport3d: Learning from rgb-d data in indoor environments,” in 3DV . IEEE, 2017, pp. 667–676
2017
Earlier work this paper cites.
P. Anderson et al. , “Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,” in CVPR , 2018, pp. 3674–3683
2018
Earlier work this paper cites.
H. Tan et al. , “Lxmert: Learning cross-modality encoder representations from transformers,” in EMNLP-IJCNLP , 2019, pp. 5100–5111
2019
Earlier work this paper cites.
M. Savva et al. , “Habitat: A platform for embodied ai research,” in ICCV , 2019, pp. 9339–9347
2019
Earlier work this paper cites.
I. Loshchilov and F. Hutter, “Decoupled weight decay regularization,” in ICLR , 2019
2019
Earlier work this paper cites.
Y. Qi et al. , “Reverie: Remote embodied visual referring expression in real indoor environments,” in CVPR , 2020, pp. 9982–9991
2020
Earlier work this paper cites.
A. Ku et al. , “Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,” in EMNLP , 2020, pp. 4392–4412
2020
Earlier work this paper cites.
A. Ku et al. , “Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,” in EMNLP , 2020, pp. 4392–4412
2020
Earlier work this paper cites.
J. Thomason et al. , “Vision-and-dialog navigation,” in CoRL , 2020, pp. 394–406
2020
Earlier work this paper cites.
J. Krantz et al. , “Beyond the nav-graph: Vision-and-language navigation in continuous environments,” in ECCV . Springer, 2020, pp. 104–120
2020
Earlier work this paper cites.
E. Wijmans et al. , “DD-PPO: Learning near-perfect pointgoal navigators from 2.5 billion frames,” in ICLR , 2020
2020
Cited alongside, same era.
S. Chen et al. , “History aware multimodal transformer for vision-and-language navigation,” NeurIPS , vol. 34, pp. 5834–5847, 2021
2021
Cited alongside, same era.
Y. Hong et al. , “Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation,” in CVPR , 2022, pp. 15 439–15 449
2022
Cited alongside, same era.
S. Chen et al. , “Think global, act local: Dual-scale graph transformer for vision-and-language navigation,” in CVPR , 2022, pp. 16 537–16 547
2022
Cited alongside, same era.
Z. Wang et al. , “Scaling data generation in vision-and-language navigation,” in ICCV , 2023, pp. 12 009–12 020
2023
Cited alongside, same era.
2023
Later among the works it cites.
D. An et al. , “Bevbert: Multimodal map pre-training for language-guided navigation,” in ICCV , 2023, pp. 2737–2748
2023
Later among the works it cites.
M. Oquab et al. , “Dinov2: Learning robust visual features without supervision,” TMLR , vol. 2024, 2024
2024
Later among the works it cites.
G. Zhou et al. , “Navgpt: Explicit reasoning in vision-and-language navigation with large language models,” in AAAI , vol. 38, no. 7, 2024, pp. 7641–7649
2024
Later among the works it cites.
Y. Long et al. , “Discuss before moving: Visual language navigation via multi-expert discussions,” ICRA , 2024
2024
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
D. An et al. , “Bevbert: Topo-metric map pre-training for language-guided navigation,” ICCV , 2023
2023
Cited alongside, same era.
Z. Wang et al. , “Gridmm: Grid memory map for vision-and-language navigation,” in ICCV , 2023, pp. 15 625–15 636
2023
Cited alongside, same era.
D. An et al. , “Etpnav: Evolving topological planning for vision-language navigation in continuous environments,” CoRR , 2023
2023
Cited alongside, same era.
W. Dai et al. , “Instructblip: Towards general-purpose vision-language models with instruction tuning,” CoRR , 2023
2023
Cited alongside, same era.
D. An et al. , “Etpnav: Evolving topological planning for vision-language navigation in continuous environments,” TPAMI , vol. PP, 2023
2023
Cited alongside, same era.
X. Liang et al. , “Mo-vln: A multi-task benchmark for open-set zero-shot vision-and-language navigation,” CoRR , 2023
2023
Cited alongside, same era.
Y. Qiao et al. , “March in chat: Interactive prompting for remote embodied referring expression,” in ICCV , 2023, pp. 15 758–15 767
2023
Cited alongside, same era.
2024
Later among the works it cites.
Y. Zhang et al. , “Vision-and-language navigation today and tomorrow: A survey in the era of foundation models,” TMLR , 2024
2024
Later among the works it cites.
R. Schumann et al. , “Velma: Verbalization embodiment of llm agents for vision and language navigation in street view,” in AAAI , vol. 38, no. 17, 2024, pp. 18 924–18 933
2024
Later among the works it cites.
2024
Later among the works it cites.
D. Zheng et al. , “Towards learning a generalist model for embodied navigation,” in CVPR , 2024, pp. 13 624–13 634
2024
Later among the works it cites.
J. Chen et al. , “Mapgpt: Map-guided prompting for unified vision-and-language navigation,” in ACL , 2024
2024
Later among the works it cites.
Y. Qiao et al. , “Open-nav: Exploring zero-shot vision-and-language navigation in continuous environment with open-source llms,” in ICRA , 2025
2025
Closest in time.
Z. Li et al. , “Ground-level viewpoint vision-and-language navigation in continuous environments,” in ICRA , 2025
2025
Closest in time.