Fetching the paper…
Reading the bibliography…
Compositional reasoning is a hallmark of human visual intelligence.
GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering, May 2019
Drew A. Hudson and Christopher D. Manning · 1902
Earlier work this paper cites.
LXMERT: Learning Cross-Modality Encoder Representations from Transformers, Dec. 2019
Hao Tan and Mohit Bansal · 1908
Earlier work this paper cites.
Arijit Ray, Karan Sikka, Ajay Divakaran, Stefan Lee, and Giedrius Burachas · 1909
Earlier work this paper cites.
Momentum Contrast for Unsupervised Visual Representation Learning, Mar. 2020
Kaiming He, Haoqi Fan, Yuxin Wu, Saining Xie, and Ross Girshick · 1911
Earlier work this paper cites.
PyTorch: An Imperative Style, High-Performance Deep Learning Library, Dec. 2019
Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, Alban Desmaison, Andreas Köpf, Edward Yang, Zach DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala · 1912
Earlier work this paper cites.
Aspects of the Theory of Syntax
Noam Chomsky · 1965
Earlier work this paper cites.
Logics and languages
MJ Cresswell · 1973
Earlier work this paper cites.
Logics and Languages
M. J. Cresswell · 1973
Earlier work this paper cites.
Learning multiple layers of features from tiny images
Alex Krizhevsky, Geoffrey Hinton, et al · 2009
Earlier work this paper cites.
The Caltech-UCSD Birds-200-2011 Dataset, July 2011
Catherine Wah, Steve Branson, Peter Welinder, Pietro Perona, and Serge Belongie · 2010
Earlier work this paper cites.
Fine-Grained Visual Comparisons with Local Learning
Aron Yu and Kristen Grauman · 2014
Earlier work this paper cites.
Discovering states and transformations in image collections
Phillip Isola, Joseph J. Lim, and Edward H. Adelson · 2015
Earlier work this paper cites.
Gordon Christie, Ankit Laddha, Aishwarya Agrawal, Stanislaw Antol, Yash Goyal, Kevin Kochersberger, and Dhruv Batra · 2016
Earlier work this paper cites.
CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning, Dec. 2016
Justin Johnson, Bharath Hariharan, Laurens van der Maaten, Li Fei-Fei, C. Lawrence Zitnick, and Ross Girshick · 2016
Earlier work this paper cites.
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations, Feb. 2016
Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A. Shamma, Michael S. Bernstein, and Fei-Fei Li · 2016
Earlier work this paper cites.
Question Relevance in VQA: Identifying Non-Visual And False-Premise Questions, Sept. 2016
Arijit Ray, Gordon Christie, Mohit Bansal, Dhruv Batra, and Devi Parikh · 2016
Earlier work this paper cites.
C-VQA: A Compositional Split of the Visual Question Answering (VQA) v1.0 Dataset, Apr. 2017
Aishwarya Agrawal, Aniruddha Kembhavi, Dhruv Batra, and Devi Parikh · 2017
Earlier work this paper cites.
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A. Shamma, Michael S. Bernstein, and Li Fei-Fei · 2017
Earlier work this paper cites.
Attention Is All You Need, Dec. 2017
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin · 2017
Earlier work this paper cites.
Understanding intermediate layers using linear classifier probes, Nov. 2018
Guillaume Alain and Yoshua Bengio · 2018
Earlier work this paper cites.
Gender shades: Intersectional accuracy disparities in commercial gender classification
Joy Buolamwini and Timnit Gebru · 2018
Earlier work this paper cites.
VirtualHome: Simulating Household Activities Via Programs
Xavier Puig, Kevin Ra, Marko Boben, Jiaman Li, Tingwu Wang, Sanja Fidler, and Antonio Torralba · 2018
Earlier work this paper cites.
The iMaterialist Fashion Attribute Dataset
Sheng Guo, Weilin Huang, Xiao Zhang, Prasanna Srikhanta, Yin Cui, Yuan Li, Hartwig Adam, Matthew R. Scott, and Serge Belongie · 2019
Cited alongside, same era.
Cycle-Consistency for Robust Visual Question Answering
Meet Shah, Xinlei Chen, Marcus Rohrbach, and Devi Parikh · 2019
Cited alongside, same era.
Action genome: Actions as compositions of spatio-temporal scene graphs
Jingwei Ji, Ranjay Krishna, Li Fei-Fei, and Juan Carlos Niebles · 2020
Cited alongside, same era.
Transformers: State-of-the-Art Natural Language Processing
Thomas Wolf, Lysandre Debut, Victor Sanh, Julien Chaumond, Clement Delangue, Anthony Moi, Pierric Cistac, Tim Rault, Remi Louf, Morgan Funtowicz, Joe Davison, Sam Shleifer, Patrick von Platen, Clara Ma, Yacine Jernite, Julien Plu, Canwen Xu, Teven Le Scao, Sylvain Gugger, Mariama Drame, Quentin Lhoest, and Alexander Rush · 2020
Cited alongside, same era.
Zero-Shot Learning – A Comprehensive Evaluation of the Good, the Bad and the Ugly, Sept. 2020
Yongqin Xian, Christoph H. Lampert, Bernt Schiele, and Zeynep Akata · 2020
Measuring compositional consistency for video question answering
Mona Gandhi, Mustafa Omer Gul, Eva Prakash, Madeleine Grunde-McLaughlin, Ranjay Krishna, and Maneesh Agrawala · 2022
Later among the works it cites.
Visual Prompt Tuning, July 2022
Menglin Jia, Luming Tang, Bor-Chun Chen, Claire Cardie, Serge Belongie, Bharath Hariharan, and Ser-Nam Lim · 2022
Later among the works it cites.
DiffusionCLIP: Text-Guided Diffusion Models for Robust Image Manipulation, Aug. 2022
Gwanghyun Kim, Taesung Kwon, and Jong Chul Ye · 2022
Later among the works it cites.
Grounded Language-Image Pre-training, June 2022
Liunian Harold Li, Pengchuan Zhang, Haotian Zhang, Jianwei Yang, Chunyuan Li, Yiwu Zhong, Lijuan Wang, Lu Yuan, Lei Zhang, Jenq-Neng Hwang, Kai-Wei Chang, and Jianfeng Gao · 2022
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
CLIP-Adapter: Better Vision-Language Models with Feature Adapters, Oct. 2021
Peng Gao, Shijie Geng, Renrui Zhang, Teli Ma, Rongyao Fang, Yongfeng Zhang, Hongsheng Li, and Yu Qiao · 2021
Cited alongside, same era.
Datasheets for datasets, 2021
Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III au2, and Kate Crawford · 2021
Cited alongside, same era.
Agqa: A benchmark for compositional spatio-temporal reasoning
Madeleine Grunde-McLaughlin, Ranjay Krishna, and Maneesh Agrawala · 2021
Cited alongside, same era.
Scaling up visual and vision-language representation learning with noisy text supervision
Chao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen, Zarana Parekh, Hieu Pham, Quoc Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig · 2021
Cited alongside, same era.
Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision, June 2021
Chao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen, Zarana Parekh, Hieu Pham, Quoc V. Le, Yunhsuan Sung, Zhen Li, and Tom Duerig · 2021
Cited alongside, same era.
MDETR – Modulated Detection for End-to-End Multi-Modal Understanding, Oct. 2021
Aishwarya Kamath, Mannat Singh, Yann LeCun, Gabriel Synnaeve, Ishan Misra, and Nicolas Carion · 2021
Cited alongside, same era.
The Power of Scale for Parameter-Efficient Prompt Tuning, Sept. 2021
Brian Lester, Rami Al-Rfou, and Noah Constant · 2021
Cited alongside, same era.
Oscar Mañas, Pau Rodriguez, Saba Ahmadi, Aida Nematzadeh, Yash Goyal, and Aishwarya Agrawal · 2022
Later among the works it cites.
Learning to Compose Soft Prompts for Compositional Zero-Shot Learning, Sept. 2022
Nihal V. Nayak, Peilin Yu, and Stephen H. Bach · 2022
Later among the works it cites.
High-Resolution Image Synthesis with Latent Diffusion Models, Apr. 2022
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer · 2022
Later among the works it cites.
Prefix Conditioning Unifies Language and Label Supervision, June 2022
Kuniaki Saito, Kihyuk Sohn, Xiang Zhang, Chun-Liang Li, Chen-Yu Lee, Kate Saenko, and Tomas Pfister · 2022
Later among the works it cites.
FLAVA: A Foundational Language And Vision Alignment Model, Mar. 2022
Amanpreet Singh, Ronghang Hu, Vedanuj Goswami, Guillaume Couairon, Wojciech Galuba, Marcus Rohrbach, and Douwe Kiela · 2022
Later among the works it cites.
Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality, Apr. 2022
Tristan Thrush, Ryan Jiang, Max Bartolo, Amanpreet Singh, Adina Williams, Douwe Kiela, and Candace Ross · 2022
Later among the works it cites.
When and why vision-language models behave like bags-of-words, and what to do about it?, Oct. 2022
Mert Yuksekgonul, Federico Bianchi, Pratyusha Kalluri, Dan Jurafsky, and James Zou · 2022
Later among the works it cites.
GLIPv2: Unifying Localization and Vision-Language Understanding, Oct. 2022
Haotian Zhang, Pengchuan Zhang, Xiaowei Hu, Yen-Chun Chen, Liunian Harold Li, Xiyang Dai, Lijuan Wang, Lu Yuan, Jenq-Neng Hwang, and Jianfeng Gao · 2022
Later among the works it cites.
Learning to Prompt for Vision-Language Models
Kaiyang Zhou, Jingkang Yang, Chen Change Loy, and Ziwei Liu · 2022
Later among the works it cites.
TRICD: Testing Robust Image Understanding Through Contextual Phrase Detection
Aishwarya Kamath, Sara Price, Jonas Pfeiffer, Yann LeCun, and Nicolas Carion · 2023
Closest in time.
Break it down: Evidence for structural compositionality in neural networks
Michael A Lepori, Thomas Serre, and Ellie Pavlick · 2023
Closest in time.
CREPE: Can Vision-Language Foundation Models Reason Compositionally?, Jan. 2023
Zixian Ma, Jerry Hong, Mustafa Omer Gul, Mona Gandhi, Irena Gao, and Ranjay Krishna · 2023
Closest in time.
Filtering, Distillation, and Hard Negatives for Vision-Language Pre-Training, Jan. 2023
Filip Radenovic, Abhimanyu Dubey, Abhishek Kadian, Todor Mihaylov, Simon Vandenhende, Yash Patel, Yi Wen, Vignesh Ramanathan, and Dhruv Mahajan · 2023
Closest in time.
PACO: Parts and Attributes of Common Objects, Jan. 2023
Vignesh Ramanathan, Anmol Kalia, Vladan Petrovic, Yi Wen, Baixue Zheng, Baishan Guo, Rui Wang, Aaron Marquez, Rama Kovvuri, Abhishek Kadian, Amir Mousavi, Yiwen Song, Abhimanyu Dubey, and Dhruv Mahajan · 2023
Closest in time.
Pic2Word: Mapping Pictures to Words for Zero-shot Composed Image Retrieval, Feb. 2023
Kuniaki Saito, Kihyuk Sohn, Xiang Zhang, Chun-Liang Li, Chen-Yu Lee, Kate Saenko, and Tomas Pfister · 2023
Closest in time.
Probing conceptual understanding of large visual-language models, 2023
Madeline Chantry Schiappa, Michael Cogswell, Ajay Divakaran, and Yogesh Singh Rawat · 2023
Closest in time.
Language-guided audio-visual source separation via trimodal consistency, 2023
Reuben Tan, Arijit Ray, Andrea Burns, Bryan A. Plummer, Justin Salamon, Oriol Nieto, Bryan Russell, and Kate Saenko · 2023
Closest in time.