Neural baby talk
Jiasen Lu, Jianwei Yang, Dhruv Batra, et al · 2018
Earlier work this paper cites.
Object hallucination in image captioning
Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns, et al · 2018
Earlier work this paper cites.
The curious case of neural text degeneration
Ari Holtzman, Jan Buys, Li Du, et al · 2020
Earlier work this paper cites.
Learning to summarize with human feedback
Nisan Stiennon, Long Ouyang, Jeffrey Wu, et al · 2020
Earlier work this paper cites.
Neural path hunter: Reducing hallucination in dialogue systems via path grounding
Nouha Dziri, Andrea Madotto, Osmar R Zaiane, et al · 2021
Earlier work this paper cites.
Learning transferable visual models from natural language supervision
Alec Radford, Jong Wook Kim, Chris Hallacy, et al · 2021
Earlier work this paper cites.
Flamingo: a visual language model for few-shot learning
Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, et al · 2022
Earlier work this paper cites.
Fine-grained image captioning with clip reward
Jaemin Cho, Seunghyun Yoon, Ajinkya Kale, et al · 2022
Earlier work this paper cites.
Lora: Low-rank adaptation of large language models
Edward J. Hu, Yelong Shen, Phillip Wallis, et al · 2022
Earlier work this paper cites.
Vision-and-language pretrained models: A survey
Siqu Long, Feiqi Cao, Soyeon Caren Han, et al · 2022
Earlier work this paper cites.
Qwen-vl: A frontier large vision-language model with versatile abilities
Original
Jinze Bai, Shuai Bai, Shusheng Yang, et al · 2023
Earlier work this paper cites.
Position-enhanced visual instruction tuning for multimodal large language models
Original
Chi Chen, Ruoyu Qin, Fuwen Luo, et al · 2023
Earlier work this paper cites.
Minigpt-v2: large language model as a unified interface for vision-language multi-task learning
Original
Jun Chen, Deyao Zhu, Xiaoqian Shen, et al · 2023
Earlier work this paper cites.
Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks
Original
Zhe Chen, Jiannan Wu, Wenhai Wang, et al · 2023
Earlier work this paper cites.
Can we edit multimodal large language models?
Siyuan Cheng, Bozhong Tian, Qingbin Liu, et al · 2023
Earlier work this paper cites.
Dola: Decoding by contrasting layers improves factuality in large language models
Original
Yung-Sung Chuang, Yujia Xie, Hongyin Luo, et al · 2023
Earlier work this paper cites.
Instructblip: Towards general-purpose vision-language models with instruction tuning
Original
Wenliang Dai, Junnan Li, Dongxu Li, et al · 2023
Earlier work this paper cites.
Plausible may not be faithful: Probing object hallucination in vision-language pre-training
Wenliang Dai, Zihan Liu, Ziwei Ji, et al · 2023
Earlier work this paper cites.
Llama-adapter v2: Parameter-efficient visual instruction model
Original
Peng Gao, Jiaming Han, Renrui Zhang, et al · 2023
Earlier work this paper cites.
Imagebind one embedding space to bind them all
Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu, et al · 2023
Earlier work this paper cites.