Fetching the paper…
Reading the bibliography…
Humans can collaborate and complete tasks based on visual signals and instruction from the environment.
“Bridge correlational neural networks for multilingual multimodal representation learning,”
Janarthanan Rajendran, Mitesh M Khapra, Sarath Chandar, and Balaraman Ravindran, · 2015
Earlier work this paper cites.
“Incorporating global visual features into attention-based neural machine translation,”
Iacer Calixto, Qun Liu, and Nick Campbell, · 2017
Earlier work this paper cites.
“Doubly-attentive decoder for multi-modal neural machine translation,”
Iacer Calixto, Qun Liu, and Nick Campbell, · 2017
Earlier work this paper cites.
“Sentence-level multilingual multi-modal embedding for natural language processing.,”
Iacer Calixto and Qun Liu, · 2017
Earlier work this paper cites.
“Image pivoting for learning multilingual multimodal representations,”
Spandana Gella, Rico Sennrich, Frank Keller, and Mirella Lapata, · 2017
Earlier work this paper cites.
“Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,”
Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko Sünderhauf, Ian D Reid, Stephen Gould, and Anton van den Hengel, · 2018
Earlier work this paper cites.
“Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,”
Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko Sünderhauf, Ian D. Reid, Stephen Gould, and Anton van den Hengel, · 2018
Earlier work this paper cites.
“On evaluation of embodied navigation agents,”
Peter Anderson, Angel Chang, Devendra Singh Chaplot, Alexey Dosovitskiy, Saurabh Gupta, Vladlen Koltun, Jana Kosecka, Jitendra Malik, Roozbeh Mottaghi, Manolis Savva, et al., · 2018
Earlier work this paper cites.
“Cross-lingual vision-language navigation,”
An Yan, Xin Eric Wang, Jiangtao Feng, Lei Li, and William Yang Wang, · 2019
Earlier work this paper cites.
“Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation,” 2019
Xin Wang, Qiuyuan Huang, Asli Celikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, and Lei Zhang, · 2019
Earlier work this paper cites.
“Robust navigation with language pretraining and stochastic sampling,”
Xiujun Li, Chunyuan Li, Qiaolin Xia, Yonatan Bisk, Asli Celikyilmaz, Jianfeng Gao, Noah A. Smith, and Yejin Choi, · 2019
Earlier work this paper cites.
“Are you looking? grounding to multiple modalities in vision-and-language navigation,” 2019
Ronghang Hu, Daniel Fried, Anna Rohrbach, Dan Klein, Trevor Darrell, and Kate Saenko, · 2019
Earlier work this paper cites.
“General evaluation for instruction conditioned navigation using dynamic time warping,”
Gabriel Ilharco, Vihan Jain, Alexander Ku, Eugene Ie, and Jason Baldridge, · 2019
Earlier work this paper cites.
“Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,”
Alexander Ku, Peter Anderson, Roma Patel, Eugene Ie, and Jason Baldridge, · 2020
Earlier work this paper cites.
“Towards learning a generic agent for vision-and-language navigation via pre-training,” 2020
Weituo Hao, Chunyuan Li, Xiujun Li, Lawrence Carin, and Jianfeng Gao, · 2020
Cited alongside, same era.
“Look, listen, and act: Towards audio-visual embodied navigation,” 2020
Chuang Gan, Yiwei Zhang, Jiajun Wu, Boqing Gong, and Joshua B. Tenenbaum, · 2020
Cited alongside, same era.
“Counterfactual vision-and-language navigation via adversarial path sampler,”
Tsu-Jui Fu, Xin Eric Wang, Matthew F Peterson, Scott T Grafton, Miguel P Eckstein, and William Yang Wang, · 2020
Cited alongside, same era.
“Counterfactual vision-and-language navigation: Unravelling the unseen,”
Amin Parvaneh, Ehsan Abbasnejad, Damien Teney, Qinfeng Shi, and Anton van den Hengel, · 2020
Cited alongside, same era.
“Improving vision-and-language navigation with image-text pairs from the web,”
Arjun Majumdar, Ayush Shrivastava, Stefan Lee, Peter Anderson, Devi Parikh, and Dhruv Batra, · 2020
Cited alongside, same era.
“Hierarchical cross-modal agent for robotics vision-and-language navigation,” 2021
Muhammad Zubair Irshad, Chih-Yao Ma, and Zsolt Kira, · 2021
Later among the works it cites.
“How much can clip benefit vision-and-language tasks?,”
Sheng Shen, Liunian Harold Li, Hao Tan, Mohit Bansal, Anna Rohrbach, Kai-Wei Chang, Zhewei Yao, and Kurt Keutzer, · 2021
Later among the works it cites.
“Vision-language navigation with random environmental mixup,”
Chong Liu, Fengda Zhu, Xiaojun Chang, Xiaodan Liang, and Yi-Dong Shen, · 2021
Later among the works it cites.
“Uc2: Universal cross-lingual cross-modal vision-and-language pre-training,” 2021
Mingyang Zhou, Luowei Zhou, Shuohang Wang, Yu Cheng, Linjie Li, Zhou Yu, and Jingjing Liu, · 2021
Later among the works it cites.
“Propagate yourself: Exploring pixel-level consistency for unsupervised visual representation learning,”
Zhenda Xie, Yutong Lin, Zheng Zhang, Yue Cao, Stephen Lin, and Han Hu, · 2021
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Vision-language navigation with self-supervised auxiliary reasoning tasks,”
Fengda Zhu, Yi Zhu, Xiaojun Chang, and Xiaodan Liang, · 2020
Cited alongside, same era.
“Forward and backward multimodal nmt for improved monolingual and multilingual cross-modal retrieval,”
Po-Yao Huang, Xiaojun Chang, Alexander Hauptmann, and Eduard Hovy, · 2020
Cited alongside, same era.
“Learning to scale multilingual representations for vision-language tasks,”
Andrea Burns, Donghyun Kim, Derry Wijaya, Kate Saenko, and Bryan A Plummer, · 2020
Cited alongside, same era.
“Mule: Multimodal universal language embedding,”
Donghyun Kim, Kuniaki Saito, Kate Saenko, Stan Sclaroff, and Bryan Plummer, · 2020
Cited alongside, same era.
“Multimodal transformer for multimodal machine translation,”
Shaowei Yao and Xiaojun Wan, · 2020
Cited alongside, same era.
“Semi-supervised semantic segmentation with cross-consistency training,”
Yassine Ouali, Céline Hudelot, and Myriam Tami, · 2020
Cited alongside, same era.
“Curl: Contrastive unsupervised representations for reinforcement learning,”
A. Srinivas, Michael Laskin, and P. Abbeel, · 2020
Cited alongside, same era.
“Pixmatch: Unsupervised domain adaptation via pixelwise consistency training,”
Luke Melas-Kyriazi and Arjun Manrai, · 2021
Later among the works it cites.
“Adaptive consistency regularization for semi-supervised transfer learning,”
Abulikemu Abuduweili, Xingjian Li, Humphrey Shi, Chengzhong Xu, and Dejing Dou, · 2021
Later among the works it cites.
“Few-shot open-set recognition by transformation consistency,”
Minki Jeong, Seokeon Choi, and Changick Kim, · 2021
Later among the works it cites.
“Adaptive consistency prior based deep network for image denoising,”
Chao Ren, Xiaohai He, Chuncheng Wang, and Zhibo Zhao, · 2021
Later among the works it cites.
“Learning temporal consistency for low light video enhancement from single images,”
Fan Zhang, Yu Li, Shaodi You, and Ying Fu, · 2021
Later among the works it cites.
“3d human action representation learning via cross-view consistency pursuit,”
Linguo Li, Minsi Wang, Bingbing Ni, Hang Wang, Jiancheng Yang, and Wenjun Zhang, · 2021
Later among the works it cites.
“Self-supervised video gans: Learning for appearance consistency and motion coherency,”
Sangeek Hyun, Jihwan Kim, and Jae-Pil Heo, · 2021
Later among the works it cites.
“Self-aligned video deraining with transmission-depth consistency,”
Wending Yan, Robby T. Tan, Wenhan Yang, and Dengxin Dai, · 2021
Later among the works it cites.
“Beyond english-centric multilingual machine translation,”
Angela Fan, Shruti Bhosale, Holger Schwenk, Zhiyi Ma, Ahmed El-Kishky, Siddharth Goyal, Mandeep Baines, Onur Celebi, Guillaume Wenzek, Vishrav Chaudhary, et al., · 2021
Later among the works it cites.