Scaling local control to large-scale topological navigation
Original
Xiangyun Meng, Nathan Ratliff, Yu Xiang, and Dieter Fox · 2019
Later among the works it cites.
Circular convolutional neural networks for panoramic images and laser data
S. Schubert, P. Neubert, J. Pöschmann, and P. Protzel · 2019
Later among the works it cites.
LXMERT: Learning cross-modality encoder representations from transformers
Hao Tan and Mohit Bansal · 2019
Later among the works it cites.
Learning to navigate unseen environments: Back translation with environmental dropout
Hao Tan, Licheng Yu, and Mohit Bansal · 2019
Later among the works it cites.
Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation
Xin Wang, Qiuyuan Huang, Asli Celikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, and Lei Zhang · 2019
Later among the works it cites.
Dd-ppo: Learning near-perfect pointgoal navigators from 2.5 billion frames
Original
Erik Wijmans, Abhishek Kadian, Ari Morcos, Stefan Lee, Irfan Essa, Devi Parikh, Manolis Savva, and Dhruv Batra · 2019
Later among the works it cites.
Gibson env v2: Embodied simulation environments for interactive navigation
Fei Xia, Chengshu Li, Kevin Chen, William B Shen, Roberto Martın-Martın, Noriaki Hirose, Amir R Zamir, and Li Fei-Fei1 Silvio Savarese · 2019
Later among the works it cites.
Sim-to-real transfer for vision-and-language navigation
Original
Peter Anderson, Ayush Shrivastava, Joanne Truong, Arjun Majumdar, Devi Parikh, Dhruv Batra, and Stefan Lee · 2020
Closest in time.
Language models are few-shot learners, 2020
Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, and Dario Amodei · 2020
Closest in time.
Neural topological slam for visual navigation
Devendra Singh Chaplot, Ruslan Salakhutdinov, Abhinav Gupta, and Saurabh Gupta · 2020
Closest in time.
Evolving graphical planner: Contextual global planning for vision-and-language navigation
Original
Zhiwei Deng, Karthik Narasimhan, and Olga Russakovsky · 2020
Closest in time.
An image is worth 16x16 words: Transformers for image recognition at scale
Original
Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, et al · 2020
Closest in time.
Towards learning a generic agent for vision-and-language navigation via pre-training
Weituo Hao, Chunyuan Li, Xiujun Li, Lawrence Carin, and Jianfeng Gao · 2020
Closest in time.
Beyond the nav-graph: Vision-and-language navigation in continuous environments
Jacob Krantz, Erik Wijmans, Arjun Majumdar, Dhruv Batra, and Stefan Lee · 2020
Closest in time.
Improving vision-and-language navigation with image-text pairs from the web, 2020
Arjun Majumdar, Ayush Shrivastava, Stefan Lee, Peter Anderson, Devi Parikh, and Dhruv Batra · 2020
Closest in time.
Vl-bert: Pre-training of generic visual-linguistic representations
Weijie Su, Xizhou Zhu, Yue Cao, Bin Li, Lewei Lu, Furu Wei, and Jifeng Dai · 2020
Closest in time.
Learning object-conditioned exploration using distributed soft actor critic
Original
Ayzaan Wahid, Austin Stone, Kevin Chen, Brian Ichter, and Alexander Toshev · 2020
Closest in time.
Interactive gibson benchmark: A benchmark for interactive navigation in cluttered environments
Fei Xia, William B Shen, Chengshu Li, Priya Kasimbeg, Micael Edmond Tchapmi, Alexander Toshev, Roberto Martín-Martín, and Silvio Savarese · 2020
Closest in time.
Vision-language navigation with self-supervised auxiliary reasoning tasks
Fengda Zhu, Yi Zhu, Xiaojun Chang, and Xiaodan Liang · 2020
Closest in time.