Fetching the paper…
Reading the bibliography…
Recently, large-scale pre-trained Vision and Language (VL) models have set a new state-of-the-art (SOTA) in zero-shot visual classification enabling open-vocabulary recognition of potentially unlimited set of categories defined as simple language prompts.
“Learning Generative Visual Models from Few Training Examples: An Incremental Bayesian Approach Tested on 101 Object Categories”
Li Fei-Fei, Rob Fergus and Pietro Perona · 2004
Earlier work this paper cites.
“Automated Flower Classification Over a Large Number of Classes”
Maria-Elena Nilsback and Andrew Zisserman · 2008
Earlier work this paper cites.
“Imagenet: A Large-scale Hierarchical Image Database”
Jia Deng, Wei Dong, Richard Socher, Li-Jia Li, Kai Li and Li Fei-Fei · 2009
Earlier work this paper cites.
“Learning Multiple Layers of Features from Tiny Images”, 2009
Alex Krizhevsky and Geoffrey Hinton · 2009
Earlier work this paper cites.
“SUN Database: Large-scale Scene Recognition from Abbey to Zoo”
J. Xiao, J. Hays, K.. Ehinger, A. Oliva and A. Torralba · 2010
Earlier work this paper cites.
“UCF101: A Dataset of 101 Human Actions Classes from Videos in the Wild”
Khurram Soomro, Amir Zamir and Mubarak Shah · 2012
Earlier work this paper cites.
“Pseudo-Label : The Simple and Efficient Semi-Supervised Learning Method for Deep Neural Networks”
Dong-Hyun Lee · 2013
Earlier work this paper cites.
“Semi-supervised Learning with Ladder Networks”
Antti Rasmus, Mathias Berglund, Mikko Honkala, Harri Valpola and Tapani Raiko · 2015
Earlier work this paper cites.
“Rethinking the Inception Architecture for Computer Vision”
Christian Szegedy, Vincent Vanhoucke, Sergey Ioffe, Jon Shlens and Zbigniew Wojna · 2016
Earlier work this paper cites.
“Mean Teachers are Better Role Models: Weight-averaged Consistency Targets Improve Semi-supervised Deep Learning Results”
Antti Tarvainen and Harri Valpola · 2017
Earlier work this paper cites.
“Introducing EuroSAT: A Novel Dataset and Deep Learning Benchmark for Land Use and Land Cover Classification”
Patrick Helber, Benjamin Bischke, Andreas Dengel and Damian Borth · 2018
Earlier work this paper cites.
“Lxmert: Learning Cross-modality Encoder Representations from Transformers”
Hao Tan and Mohit Bansal · 2019
Earlier work this paper cites.
“Learning Robust Global Representations by Penalizing Local Predictive Power”
Haohan Wang, Songwei Ge, Zachary Lipton and Eric Xing · 2019
Earlier work this paper cites.
“Language Models are Few-Shot Learners”
Tom. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever and Dario Amodei · 2020
Earlier work this paper cites.
“Fixmatch: Simplifying Semi-supervised Learning with Consistency and Confidence”
Kihyuk Sohn, David Berthelot, Nicholas Carlini, Zizhao Zhang, Han Zhang, Colin Raffel, Ekin Cubuk, Alexey Kurakin and Chun-Liang Li · 2020
Earlier work this paper cites.
“Uniter: Universal Image-text Representation Learning”
Yen-Chun Chen, Linjie Li, Licheng Yu, Ahmed El, Faisal Ahmed, Zhe Gan, Yu Cheng and Jingjing Liu · 2020
Earlier work this paper cites.
“Oscar: Object-semantics Aligned Pre-training for Vision-language Tasks”
Xiujun Li, Xi Yin, Chunyuan Li, Pengchuan Zhang, Xiaowei Hu, Lei Zhang, Lijuan Wang, Houdong Hu, Li Dong and Furu Wei · 2020
Earlier work this paper cites.
“Tent: Fully Test-time Adaptation by Entropy Minimization”
Dequan Wang, Evan Shelhamer, Shaoteng Liu, Bruno Olshausen and Trevor Darrell · 2020
Earlier work this paper cites.
“Unsupervised Data Augmentation for Consistency Training”
Qizhe Xie, Zihang Dai, Eduard Hovy, Thang Luong and Quoc Le · 2020
Earlier work this paper cites.
“Learning Transferable Visual Models from Natural Language Supervision”
Alec Radford, Jong Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin and Jack Clark · 2021
Earlier work this paper cites.
“Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm”
Yangguang Li, Feng Liang, Lichen Zhao, Yufeng Cui, Wanli Ouyang, Jing Shao, Fengwei Yu and Junjie Yan · 2021
Earlier work this paper cites.
“Slip: Self-supervision Meets Language-image Pre-training”
Norman Mu, Alexander Kirillov, David Wagner and Saining Xie · 2021
Earlier work this paper cites.
“FILIP: Fine-grained Interactive Language-Image Pre-Training”
Lewei Yao, Runhui Huang, Lu Hou, Guansong Lu, Minzhe Niu, Hang Xu, Xiaodan Liang, Zhenguo Li, Xin Jiang and Chunjing Xu · 2021
Cited alongside, same era.
“FLAVA: A Foundational Language And Vision Alignment Model”
Amanpreet Singh, Ronghang Hu, Vedanuj Goswami, Guillaume Couairon, Wojciech Galuba, Marcus Rohrbach and Douwe Kiela · 2021
Cited alongside, same era.
“Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision”
Chao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen, Zarana Parekh, Hieu Pham, Quoc. Le, Yunhsuan Sung, Zhen Li and Tom Duerig · 2021
Cited alongside, same era.
“Vilt: Vision-and-language Transformer without Convolution or Region Supervision”
Wonjae Kim, Bokyung Son and Ildoo Kim · 2021
Cited alongside, same era.
“Align before Fuse: Vision and Language Representation Learning with Momentum Distillation”
Scott Reed, Konrad Zolna, Emilio Parisotto, Sergio Colmenarejo, Alexander Novikov, Gabriel Barth-Maron, Mai Gimenez, Yury Sulsky, Jackie Kay, Jost Springenberg, Tom Eccles, Jake Bruce, Ali Razavi, Ashley Edwards, Nicolas Heess, Yutian Chen, Raia Hadsell, Oriol Vinyals, Mahyar Bordbar and Nando de Freitas · 2022
Later among the works it cites.
“Visual Prompt Tuning”
Menglin Jia, Luming Tang, Bor-Chun Chen, Claire Cardie, Serge Belongie, Bharath Hariharan and Ser-Nam Lim · 2022
Later among the works it cites.
“Unsupervised Prompt Learning for Vision-Language Models”
Tony Huang, Jack Chu and Fangyun Wei · 2022
Later among the works it cites.
“Vision-Language Pre-Training with Triple Contrastive Learning”
Jinyu Yang, Jiali Duan, Son Tran, Yi Xu, Sampath Chanda, Liqun Chen, Belinda Zeng, Trishul Chilimbi and Junzhou Huang · 2022
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Junnan Li, Ramprasaath. Selvaraju, Akhilesh Gotmare, Shafiq Joty, Caiming Xiong and Steven Hoi · 2021
Cited alongside, same era.
“Filip: Fine-grained Interactive Language-image Pre-training”
Lewei Yao, Runhui Huang, Lu Hou, Guansong Lu, Minzhe Niu, Hang Xu, Xiaodan Liang, Zhenguo Li, Xin Jiang and Chunjing Xu · 2021
Cited alongside, same era.
“Cloob: Modern Hopfield Networks with Infoloob Outperform Clip”
Andreas Fürst, Elisabeth Rumetshofer, Viet Tran, Hubert Ramsauer, Fei Tang, Johannes Lehner, David Kreil, Michael Kopp, Günter Klambauer and Angela Bitto-Nemling · 2021
Cited alongside, same era.
“Supervision Exists Everywhere: A data Efficient Contrastive Language-Image Pre-training Paradigm”
Yangguang Li, Feng Liang, Lichen Zhao, Yufeng Cui, Wanli Ouyang, Jing Shao, Fengwei Yu and Junjie Yan · 2021
Cited alongside, same era.
“Filip: Fine-grained Interactive Language-image Pre-training”
Lewei Yao, Runhui Huang, Lu Hou, Guansong Lu, Minzhe Niu, Hang Xu, Xiaodan Liang, Zhenguo Li, Xin Jiang and Chunjing Xu · 2021
Cited alongside, same era.
“Cloob: Modern Hopfield Networks with InfoLOOB Outperform Clip”
Andreas Fürst, Elisabeth Rumetshofer, Viet Tran, Hubert Ramsauer, Fei Tang, Johannes Lehner, David Kreil, Michael Kopp, Günter Klambauer and Angela Bitto-Nemling · 2021
Cited alongside, same era.
“Data Efficient Language-supervised Zero-shot Recognition with Optimal Transport Distillation”
Bichen Wu, Ruizhe Cheng, Peizhao Zhang, Peter Vajda and Joseph Gonzalez · 2021
Cited alongside, same era.
“Factual Probing is [MASK]: Learning vs. Learning to Recall”
Zexuan Zhong, Dan Friedman and Danqi Chen · 2021
Cited alongside, same era.
Shashank Goel, Hritik Bansal, Sumit Bhatia, Ryan Rossi, Vishwa Vinay and Aditya Grover · 2022
Later among the works it cites.
“PyramidCLIP: Hierarchical Feature Alignment for Vision-language Model Pretraining”
Yuting Gao, Jinfeng Liu, Zihan Xu, Jun Zhang, Ke Li and Chunhua Shen · 2022
Later among the works it cites.
“CyCLIP: Cyclic Contrastive Language-Image Pretraining”
Shashank Goel, Hritik Bansal, Sumit Bhatia, Ryan Rossi, Vishwa Vinay and Aditya Grover · 2022
Later among the works it cites.
“PyramidCLIP: Hierarchical Feature Alignment for Vision-language Model Pretraining”
Yuting Gao, Jinfeng Liu, Zihan Xu, Jun Zhang, Ke Li and Chunhua Shen · 2022
Later among the works it cites.
“Learning to Prompt for Vision-Language Models”
Kaiyang Zhou, Jingkang Yang, Chen Loy and Ziwei Liu · 2022
Later among the works it cites.
“Conditional Prompt Learning for Vision-Language Models”
Kaiyang Zhou, Jingkang Yang, Chen Loy and Ziwei Liu · 2022
Later among the works it cites.
“Improving Zero-Shot Models with Label Distribution Priors”
Jonathan Kahana, Niv Cohen and Yedid Hoshen · 2022
Later among the works it cites.
“Learning to Prompt for Vision-language Models”
Kaiyang Zhou, Jingkang Yang, Chen Loy and Ziwei Liu · 2022
Later among the works it cites.
“Unsupervised Prompt Learning for Vision-Language Models”
Tony Huang, Jack Chu and Fangyun Wei · 2022
Later among the works it cites.
“Prompt Distribution Learning”
Yuning Lu, Jianzhuang Liu, Yonggang Zhang, Yajing Liu and Xinmei Tian · 2022
Later among the works it cites.
“Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language Models”
Manli Shu, Weili Nie, De-An Huang, Zhiding Yu, Tom Goldstein, Anima Anandkumar and Chaowei Xiao · 2022
Later among the works it cites.
“Conditional Prompt Learning for Vision-language Models”
Kaiyang Zhou, Jingkang Yang, Chen Loy and Ziwei Liu · 2022
Later among the works it cites.
“Efficient Test-Time Model Adaptation without Forgetting”
Shuaicheng Niu, Jiaxiang Wu, Yifan Zhang, Yaofo Chen, Shijian Zheng, Peilin Zhao and Mingkui Tan · 2022
Later among the works it cites.
“What does a Platypus Look Like? Generating Customized Prompts for Zero-shot Image Classification”
Sarah Pratt, Rosanne Liu and Ali Farhadi · 2022
Later among the works it cites.
“ActMAD: Activation Matching to Align Distributions for Test-Time Training”
M. Mirza, Pol Soneira, Wei Lin, Mateusz Kozinski, Horst Possegger and Horst Bischof · 2023
Closest in time.
“DrML: Diagnosing and Rectifying Vision Models using Language”
Yuhui Zhang, Jeff. HaoChen, Shih-Cheng Huang, Kuan-Chieh Wang, James Zou and Serena Yeung · 2023
Closest in time.
“Stanford Alpaca: An Instruction-following LLaMA model”, 2023
Rohan Taori, Ishaan Gulrajani, Tianyi Zhang, Yann Dubois, Xuechen Li, Carlos Guestrin, Percy Liang and Tatsunori. Hashimoto · 2023
Closest in time.