Fetching the paper…
Reading the bibliography…
Large Vision-Language Models (LVLMs) offer remarkable benefits for a variety of vision-language tasks.
Statistical comparisons of classifiers over multiple data sets
Demšar, J. 2006 · 2006
Earlier work this paper cites.
From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions
Young, P.; Lai, A.; Hodosh, M.; and Hockenmaier, J. 2014 · 2014
Earlier work this paper cites.
OpenImages: A public dataset for large-scale multi-label and multi-class image classification
Krasin, I.; Duerig, T.; Alldrin, N.; Ferrari, V.; Abu-El-Haija, S.; Kuznetsova, A.; Rom, H.; Uijlings, J.; Popov, S.; Kamali, S.; Malloci, M.; Pont-Tuset, J.; Veit, A.; Belongie, S.; Gomes, V.; Gupta, A.; Sun, C.; Chechik, G.; Cai, D.; Feng, Z.; Narayanan, D.; and Murphy, K. 2017 · 2017
Earlier work this paper cites.
Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
Reimers, N.; and Gurevych, I. 2019 · 2019
Earlier work this paper cites.
SpatialSense: An Adversarially Crowdsourced Benchmark for Spatial Relation Recognition
Yang, K.; Russakovsky, O.; and Deng, J. 2019 · 2019
Earlier work this paper cites.
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Dosovitskiy, A.; Beyer, L.; Kolesnikov, A.; Weissenborn, D.; Zhai, X.; Unterthiner, T.; Dehghani, M.; Minderer, M.; Heigold, G.; Gelly, S.; et al. 2020 · 2020
Earlier work this paper cites.
Human-in-the-Loop Machine Learning: Active learning and annotation for human-centered AI
Monarch, R.; and Munro, R. 2021 · 2021
Earlier work this paper cites.
Confident learning: Estimating uncertainty in dataset labels
Northcutt, C.; Jiang, L.; and Chuang, I. 2021 · 2021
Earlier work this paper cites.
Does Vision-and-Language Pretraining Improve Lexical Grounding?
Yun, T.; Sun, C.; and Pavlick, E. 2021 · 2021
Earlier work this paper cites.
A Prompt Array Keeps the Bias Away: Debiasing Vision-Language Models with Adversarial Learning
Berg, H.; Hall, S.; Bhalgat, Y.; Kirk, H.; Shtedritski, A.; and Bain, M. 2022 · 2022
Earlier work this paper cites.
MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text
Chen, W.; Hu, H.; Chen, X.; Verga, P.; and Cohen, W. 2022 · 2022
Earlier work this paper cites.
Grounded language-image pre-training
Li, L. H.; Zhang, P.; Zhang, H.; Yang, J.; Li, C.; Zhong, Y.; Wang, L.; Yuan, L.; Zhang, L.; Hwang, J.-N.; et al. 2022 · 2022
Earlier work this paper cites.
Good, better, best: Textual distractors generation for multiple-choice visual question answering via reinforcement learning
Lu, J.; Ye, X.; Ren, Y.; and Yang, Y. 2022a · 2022
Earlier work this paper cites.
Training language models to follow instructions with human feedback
Ouyang, L.; Wu, J.; Jiang, X.; Almeida, D.; Wainwright, C.; Mishkin, P.; Zhang, C.; Agarwal, S.; Slama, K.; Ray, A.; et al. 2022 · 2022
Earlier work this paper cites.
Self-Consistency Improves Chain of Thought Reasoning in Language Models
Wang, X.; Wei, J.; Schuurmans, D.; Le, Q. V.; Chi, E. H.; Narang, S.; Chowdhery, A.; and Zhou, D. 2022 · 2022
Cited alongside, same era.
OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models
Awadalla, A.; Gao, I.; Gardner, J.; Hessel, J.; Hanafy, Y.; Zhu, W.; Marathe, K.; Bitton, Y.; Gadre, S.; Sagawa, S.; Jitsev, J.; Kornblith, S.; Koh, P. W.; Ilharco, G.; Wortsman, M.; and Schmidt, L. 2023 · 2023
Cited alongside, same era.
A Survey on Knowledge Graphs for Healthcare: Resources, Application Progress, and Promise
Cui, H.; Lu, J.; Wang, S.; Xu, R.; Ma, W.; Yu, S.; Yu, Y.; Kan, X.; Fu, T.; Ling, C.; et al. 2023 · 2023
Cited alongside, same era.
Instructblip: Towards general-purpose vision-language models with instruction tuning
Dai, W.; Li, J.; Li, D.; Tiong, A. M. H.; Zhao, J.; Wang, W.; Li, B.; Fung, P.; and Hoi, S. 2023 · 2023
Cited alongside, same era.
PACO: Parts and Attributes of Common Objects
Ramanathan, V.; Kalia, A.; Petrovic, V.; Wen, Y.; Zheng, B.; Guo, B.; Wang, R.; Marquez, A.; Kovvuri, R.; Kadian, A.; et al. 2023 · 2023
Closest in time.
Any-to-Any Generation via Composable Diffusion
Tang, Z.; Yang, Z.; Zhu, C.; Zeng, M.; and Bansal, M. 2023 · 2023
Closest in time.
Llama 2: Open foundation and fine-tuned chat models
Touvron, H.; Martin, L.; Stone, K.; Albert, P.; Almahairi, A.; Babaei, Y.; Bashlykov, N.; Batra, S.; Bhargava, P.; Bhosale, S.; et al. 2023 · 2023
Closest in time.
Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models
Xu, P.; Shao, W.; Zhang, K.; Gao, P.; Liu, S.; Lei, M.; Meng, F.; Huang, S.; Qiao, Y.; and Luo, P. 2023 · 2023
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Dong, X.; Zhu, Z.; Wang, Z.; Teleki, M.; and Caverlee, J. 2023 · 2023
Cited alongside, same era.
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
Fu, C.; Chen, P.; Shen, Y.; Qin, Y.; Zhang, M.; Lin, X.; Qiu, Z.; Lin, W.; Yang, J.; Zheng, X.; et al. 2023 · 2023
Cited alongside, same era.
Llama-adapter v2: Parameter-efficient visual instruction model
Gao, P.; Han, J.; Zhang, R.; Lin, Z.; Geng, S.; Zhou, A.; Zhang, W.; Lu, P.; He, C.; Yue, X.; et al. 2023 · 2023
Cited alongside, same era.
Detecting and Preventing Hallucinations in Large Vision Language Models
Gunjal, A.; Yin, J.; and Bas, E. 2023 · 2023
Cited alongside, same era.
Survey of hallucination in natural language generation
Ji, Z.; Lee, N.; Frieske, R.; Yu, T.; Su, D.; Xu, Y.; Ishii, E.; Bang, Y. J.; Madotto, A.; and Fung, P. 2023 · 2023
Cited alongside, same era.
Beyond One-Model-Fits-All: A Survey of Domain Specialization for Large Language Models
Ling, C.; Zhao, X.; Lu, J.; Deng, C.; Zheng, C.; Wang, J.; Chowdhury, T.; Li, Y.; Cui, H.; Zhao, T.; et al. 2023 · 2023
Cited alongside, same era.
MuG: A Multimodal Classification Benchmark on Game Data with Tabular, Textual, and Visual Fields
Lu, J.; Qian, Y.; Zhao, S.; Xi, Y.; and Yang, C. 2023 · 2023
Cited alongside, same era.
Cheap and quick: Efficient vision-language instruction tuning for large language models
Luo, G.; Zhou, Y.; Ren, T.; Chen, S.; Sun, X.; and Ji, R. 2023 · 2023
Cited alongside, same era.
Yang, D.; Chen, K.; Rao, J.; Guo, X.; Zhang, Y.; Yang, J.; and Zhang, Y. 2023 · 2023
Closest in time.
What You See is What You Read? Improving Text-Image Alignment Evaluation
Yarom, M.; Bitton, Y.; Changpinyo, S.; Aharoni, R.; Herzig, J.; Lang, O.; Ofek, E.; and Szpektor, I. 2023 · 2023
Closest in time.
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
Ye, Q.; Xu, H.; Xu, G.; Ye, J.; Yan, M.; Zhou, Y.; Wang, J.; Hu, A.; Shi, P.; Shi, Y.; Jiang, C.; Li, C.; Xu, Y.; Chen, H.; Tian, J.; Qi, Q.; Zhang, J.; and Huang, F. 2023 · 2023
Closest in time.
LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark
Yin, Z.; Wang, J.; Cao, J.; Shi, Z.; Liu, D.; Li, M.; Sheng, L.; Bai, L.; Huang, X.; Wang, Z.; et al. 2023 · 2023
Closest in time.
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
Yu, W.; Yang, Z.; Li, L.; Wang, J.; Lin, K.; Liu, Z.; Wang, X.; and Wang, L. 2023 · 2023
Closest in time.
Data-centric ai: Perspectives and challenges
Zha, D.; Bhat, Z. P.; Lai, K.-H.; Yang, F.; and Hu, X. 2023 · 2023
Closest in time.
Multimodal chain-of-thought reasoning in language models
Zhang, Z.; Zhang, A.; Li, M.; Zhao, H.; Karypis, G.; and Smola, A. 2023 · 2023
Closest in time.
MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models
Zhu, D.; Chen, J.; Shen, X.; Li, X.; and Elhoseiny, M. 2023 · 2023
Closest in time.
Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models
Bai, G.; Chai, Z.; Ling, C.; Wang, S.; Lu, J.; Zhang, N.; Shi, T.; Yu, Z.; Zhu, M.; Zhang, Y.; Yang, C.; Cheng, Y.; and Zhao, L. 2024 · 2024
Closest in time.