Gated graph sequence neural networks
Original
Y. Li, D. Tarlow, M. Brockschmidt, and R. S. Zemel · 2015
Cited alongside, same era.
Image Question Answering: A Visual Semantic Embedding Model and a New Dataset
M. Ren, R. Kiros, and R. Zemel · 2015
Cited alongside, same era.
Order matters: Sequence to sequence for sets
Original
O. Vinyals, S. Bengio, and M. Kudlur · 2015
Cited alongside, same era.
Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering
Original
H. Xu and K. Saenko · 2015
Cited alongside, same era.
Learning to compose neural networks for question answering
J. Andreas, M. Rohrbach, T. Darrell, and D. Klein · 2016
Cited alongside, same era.
Neural Module Networks
J. Andreas, M. Rohrbach, T. Darrell, and D. Klein · 2016
Cited alongside, same era.
Convolutional neural networks on graphs with fast localized spectral filtering
M. Defferrard, X. Bresson, and P. Vandergheynst · 2016
Cited alongside, same era.
Multimodal compact bilinear pooling for visual question answering and visual grounding
Original
A. Fukui, D. H. Park, D. Yang, A. Rohrbach, T. Darrell, and M. Rohrbach · 2016
Cited alongside, same era.
Structural-rnn: Deep learning on spatio-temporal graphs
A. Jain, A. R. Zamir, S. Savarese, and A. Saxena · 2016
Cited alongside, same era.
Multimodal residual learning for visual qa
Original
J.-H. Kim, S.-W. Lee, D.-H. Kwak, M.-O. Heo, J. Kim, J.-W. Ha, and B.-T. Zhang · 2016
Cited alongside, same era.
http://visualqa.org/challenge.html
VQA Challenge leaderboard
Cited in the paper.
Glove: Global vectors for word representation
J. Pennington, R. Socher, and C. Manning
Cited in the paper.