Fetching the paper…
Reading the bibliography…
Recent studies on AI security have highlighted the vulnerability of Vision-Language Pre-training (VLP) models to subtle yet intentionally designed perturbations in images and texts.
“Visualizing data using t-SNE”
Laurens Van and Geoffrey Hinton · 2008
Earlier work this paper cites.
“Nus-wide: a real-world web image database from national university of singapore”
Tat-Seng Chua et al · 2009
Earlier work this paper cites.
“ImageNet: A large-scale hierarchical image database”
Jia Deng et al · 2009
Earlier work this paper cites.
“Learning multiple layers of features from tiny images”
A. Krizhevsky and G. Hinton · 2009
Earlier work this paper cites.
“Collecting image annotations using amazon’s mechanical turk”
Cyrus Rashtchian, Peter Young, Micah Hodosh and Julia Hockenmaier · 2010
Earlier work this paper cites.
“A new approach to cross-modal multimedia retrieval”
Nikhil Rasiwasia et al · 2010
Earlier work this paper cites.
“Microsoft COCO: Common Objects in Context”
Tsung-Yi Lin et al · 2014
Earlier work this paper cites.
“Explaining and Harnessing Adversarial Examples”
Ian Goodfellow, Jonathon Shlens and Christian Szegedy · 2015
Earlier work this paper cites.
“Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models”
Bryan. Plummer et al · 2015
Earlier work this paper cites.
“DeepFool: A Simple and Accurate Method to Fool Deep Neural Networks”
Seyed-Mohsen Moosavi-Dezfooli, Alhussein Fawzi and Pascal Frossard · 2016
Earlier work this paper cites.
“Universal adversarial perturbations”
Seyed-Mohsen Moosavi-Dezfooli, Alhussein Fawzi, Omar Fawzi and Pascal Frossard · 2017
Earlier work this paper cites.
“Fast feature fool: A data independent approach to universal adversarial perturbations”
Konda Mopuri, Utsav Garg and R Babu · 2017
Earlier work this paper cites.
“Bert: Pre-training of deep bidirectional transformers for language understanding”
Jacob Devlin, Ming-Wei Chang, Kenton Lee and Kristina Toutanova · 2018
Earlier work this paper cites.
“LaVAN: Localized and Visible Adversarial Noise”
Danny Karmon, Daniel Zoran and Yoav Goldberg · 2018
Earlier work this paper cites.
“Towards Deep Learning Models Resistant to Adversarial Attacks”
Aleksander Madry et al · 2018
Earlier work this paper cites.
“Ask, acquire, and attack: Data-free uap generation using class impressions”
Konda Mopuri, Phani Uppala and R Babu · 2018
Earlier work this paper cites.
“Generative adversarial perturbations”
Omid Poursaeed, Isay Katsman, Bicheng Gao and Serge Belongie · 2018
Cited alongside, same era.
“Adaptive semi-supervised feature selection for cross-modal retrieval”
En Yu et al · 2018
Cited alongside, same era.
“Uniter: Universal image-text representation learning”
Yen-Chun Chen et al · 2020
Cited alongside, same era.
“Oscar: Object-semantics aligned pre-training for vision-language tasks”
Xiujun Li et al · 2020
Cited alongside, same era.
“Upgrading the newsroom: An automated image selection system for news articles”
Fangyu Liu et al · 2020
Cited alongside, same era.
“Mra-net: Improving vqa via multi-modal relation attention network”
Liang Peng et al · 2020
Cited alongside, same era.
“BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers”
Zhiliang Peng et al · 2022
Later among the works it cites.
“Vlmixer: Unpaired vision-language pre-training via cross-modal cutmix”
Teng Wang et al · 2022
Later among the works it cites.
“Vision-Language Pre-Training With Triple Contrastive Learning”
Jinyu Yang et al · 2022
Later among the works it cites.
“Towards Adversarial Attack on Vision-Language Pre-training Models”
Jiaming Zhang, Qi Yi and Jitao Sang · 2022
Later among the works it cites.
“Conditional Prompt Learning for Vision-Language Models”
Kaiyang Zhou, Jingkang Yang, Chen Loy and Ziwei Liu · 2022
Later among the works it cites.
“Learning to Prompt for Vision-Language Models”
Kaiyang Zhou, Jingkang Yang, Chen Loy and Ziwei Liu · 2022
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Universal adversarial training”
Ali Shafahi et al · 2020
Cited alongside, same era.
“ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision”
Wonjae Kim, Bokyung Son and Ildoo Kim · 2021
Cited alongside, same era.
“Align before Fuse: Vision and Language Representation Learning with Momentum Distillation”
Junnan Li et al · 2021
Cited alongside, same era.
“Learning Transferable Visual Models From Natural Language Supervision”
Alec Radford et al · 2021
Cited alongside, same era.
“Multimodal Contrastive Training for Visual Representation Learning”
Xin Yuan et al · 2021
Cited alongside, same era.
“Vinvl: Revisiting visual representations in vision-language models”
Pengchuan Zhang et al · 2021
Cited alongside, same era.
Later among the works it cites.
“An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale”
Alexey Dosovitskiy et al · 2023
Later among the works it cites.
“Reservoir Computing Transformer for Image-Text Retrieval”
Wenrui Li et al · 2023
Later among the works it cites.
“Set-level Guidance Attack: Boosting Adversarial Transferability of Vision-Language Pre-training Models”
Dong Lu et al · 2023
Later among the works it cites.
“Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language Tasks”
Wenhui Wang et al · 2023
Later among the works it cites.
“Less is better: Exponential loss for cross-modal matching”
Jiwei Wei et al · 2023
Later among the works it cites.
“AdvCLIP: Downstream-agnostic Adversarial Examples in Multimodal Contrastive Learning”
Ziqi Zhou et al · 2023
Later among the works it cites.
“VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language Models”
Liang Jiawei et al · 2024
Closest in time.
“Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning”
Wenrui Li, Penghong Wang, Ruiqin Xiong and Xiaopeng Fan · 2024
Closest in time.
Haonan Zheng, Xinyang Deng, Wen Jiang and Wenrui Li · 2024
Closest in time.