Fetching the paper…
Reading the bibliography…
Multimodal large language models (MLLMs) have recently gained attention for their generalization and reasoning capabilities in Vision-and-Language Navigation (VLN) tasks, leading to the rise of MLLM-driven navigators.
I, ROBOT
I. ASIMOV · 1950
Earlier work this paper cites.
Can machine learning be secure?
M. Barreno et al · 2006
Earlier work this paper cites.
Intriguing properties of neural networks
C. Szegedy et al · 2014
Earlier work this paper cites.
Targeted backdoor attacks on deep learning systems using data poisoning
X. Chen et al · 2017
Earlier work this paper cites.
Universal adversarial perturbations
S.-M. Moosavi-Dezfooli et al · 2017
Earlier work this paper cites.
Matterport3d: Learning from RGB-D data in indoor environments
A. X. Chang et al · 2017
Earlier work this paper cites.
Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments
P. Anderson et al · 2018
Earlier work this paper cites.
Speaker-follower models for vision-and-language navigation
D. Fried et al · 2018
Earlier work this paper cites.
Badnets: Evaluating backdooring attacks on deep neural networks
T. Gu et al · 2019
Earlier work this paper cites.
Textattack: A framework for adversarial attacks, data augmentation, and adversarial training in nlp
J. X. Morris et al · 2020
Earlier work this paper cites.
Adversarial attacks and defences: A survey
A. Chakraborty et al · 2021
Earlier work this paper cites.
Towards improving adversarial training of nlp models
J. Y. Yoo et al · 2021
Earlier work this paper cites.
Learning transferable visual models from natural language supervision
A. Radford et al · 2021
Earlier work this paper cites.
High-resolution image synthesis with latent diffusion models
R. Rombach et al · 2022
Earlier work this paper cites.
Training language models to follow instructions with human feedback
L. Ouyang et al · 2022
Earlier work this paper cites.
Open sesame! universal black box jailbreaking of large language models
R. Lapid et al · 2023
Earlier work this paper cites.
Autodan: Interpretable gradient-based adversarial attacks on large language models
S. Zhu et al · 2023
Cited alongside, same era.
Bevbert: Multimodal map pre-training for language-guided navigation
D. An et al · 2023
Cited alongside, same era.
Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023
J. Bai et al · 2023
Cited alongside, same era.
Visual instruction tuning
H. Liu et al · 2023
Cited alongside, same era.
Gemini: A family of highly capable multimodal models
G. Team et al · 2023
Cited alongside, same era.
Vision-and-language navigation today and tomorrow: A survey in the era of foundation models
Constraint-aware zero-shot vision-language navigation in continuous environments
K. Chen et al · 2024
Later among the works it cites.
Navgpt-2: Unleashing navigational reasoning capability for large vision-language models
G. Zhou et al · 2024
Later among the works it cites.
Llm as copilot for coarse-grained vision-and-language navigation
Y. Qiao et al · 2024
Later among the works it cites.
Navgpt: Explicit reasoning in vision-and-language navigation with large language models
G. Zhou et al · 2024
Later among the works it cites.
Discuss before moving: Visual language navigation via multi-expert discussions
Y. Long et al · 2024
Later among the works it cites.
Navigating beyond instructions: Vision-and-language navigation in obstructed environments
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Y. Zhang et al · 2024
Cited alongside, same era.
Sim-to-real transfer via 3d feature fields for vision-and-language navigation
Z. Wwang et al · 2024
Cited alongside, same era.
Mapgpt: Map-guided prompting with adaptive path planning for vision-and-language navigation
J. Chen et al · 2024
Cited alongside, same era.
Instructnav: Zero-shot system for generic instruction navigation in unexplored environment
Y. Long et al · 2024
Cited alongside, same era.
Cold-attack: Jailbreaking llms with stealthiness and controllability
X. Guo et al · 2024
Cited alongside, same era.
Universal and transferable adversarial attacks on aligned language models
A. Zou et al · 2024
Cited alongside, same era.
Poex: Understanding and mitigating policy executable jailbreak attacks against embodied ai
X. Lu et al · 2024
Cited alongside, same era.
H. Hong et al · 2024
Later among the works it cites.
Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks
Z. Chen et al · 2024
Later among the works it cites.
Fine-tuning aligned language models compromises safety, even when users do not intend to!
X. Qi et al · 2024
Later among the works it cites.
Adversarial training for multimodal large language models against jailbreak attacks
L. Lu et al · 2025
Closest in time.
Hijacking vision-and-language navigation agents with adversarial environmental attacks
Z. Yang et al · 2025
Closest in time.
Bootstrapping language-guided navigation learning with self-refining data flywheel
Z. Wang et al · 2025
Closest in time.
Open-nav: Exploring zero-shot vision-and-language navigation in continuous environment with open-source llms
Y. Qiao et al · 2025
Closest in time.
Affordances-oriented planning using foundation models for continuous vision-language navigation
J. Chen et al · 2025
Closest in time.
Flexvln: Flexible adaptation for diverse vision-and-language navigation tasks
S. Zhang et al · 2025
Closest in time.
Smartway: Enhanced waypoint prediction and backtracking for zero-shot vision-and-language navigation
X. Shi et al · 2025
Closest in time.