Fetching the paper…
Reading the bibliography…
Visual QA is a pivotal challenge for higher-level reasoning, requiring understanding language, vision, and relationships between many objects in a scene.
Clevr: A diagnostic dataset for compositional language and elementary visual reasoning
Johnson, J., Hariharan, B., van der Maaten, L., Fei-Fei, L., Zitnick, C.L., Girshick, R.: · 1997
Earlier work this paper cites.
Towards a visual turing challenge
Malinowski, M., Fritz, M.: · 2014
Earlier work this paper cites.
A multi-world approach to question answering about real-world scenes based on uncertain input
Malinowski, M., Fritz, M.: · 2014
Earlier work this paper cites.
Visual turing test for computer vision systems
Geman, D., Geman, S., Hallonquist, N., Younes, L.: · 2015
Earlier work this paper cites.
Image question answering: A visual semantic embedding model and a new dataset
Ren, M., Kiros, R., Zemel, R.: · 2015
Earlier work this paper cites.
Vqa: Visual question answering
Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C.L., Parikh, D.: · 2015
Earlier work this paper cites.
Stacked attention networks for image question answering
Yang, Z., He, X., Gao, J., Deng, L., Smola, A.: · 2016
Cited alongside, same era.
Ask, attend and answer: Exploring question-guided spatial attention for visual question answering
Xu, H., Saenko, K.: · 2016
Cited alongside, same era.
Deep residual learning for image recognition
He, K., Zhang, X., Ren, S., Sun, J.: · 2016
Cited alongside, same era.
Towards holistic machines: From visual recognition to question answering about real-world images
Malinowski, M.: · 2017
Cited alongside, same era.
A simple neural network module for relational reasoning
Santoro, A., Raposo, D., Barrett, D.G., Malinowski, M., Pascanu, R., Battaglia, P., Lillicrap, T.: · 2017
Cited alongside, same era.
Ask your neurons: A deep learning approach to visual question answering
Malinowski, M., Rohrbach, M., Fritz, M.: · 2017
Later among the works it cites.
Don’t just assume; look and answer: Overcoming priors for visual question answering
Agrawal, A., Batra, D., Parikh, D., Kembhavi, A.: · 2018
Closest in time.
Film: Visual reasoning with a general conditioning layer
Perez, E., Strub, F., De Vries, H., Dumoulin, V., Courville, A.: · 2018
Closest in time.
Learning visual question answering by bootstrapping hard attention
Malinowski, M., Doersch, C., Santoro, A., Battaglia, P.: · 2018
Closest in time.
Dumoulin, V., Perez, E., Schucher, N., Strub, F., Vries, H.d., Courville, A., Bengio, Y.: · 2018
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…