Fetching the paper…
Reading the bibliography…
When exploring the development of Artificial General Intelligence (AGI), a critical task for these models involves interpreting and processing information from multiple image inputs.
“Raven: A dataset for relational and analogical visual reasoning,”
Chi Zhang, Feng Gao, Baoxiong Jia, Yixin Zhu, and Song-Chun Zhu, · 2019
Earlier work this paper cites.
“Training language models to follow instructions with human feedback,”
Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al., · 2022
Earlier work this paper cites.
“Promptcap: Prompt-guided task-aware image captioning,”
Yushi Hu, Hang Hua, Zhengyuan Yang, Weijia Shi, Noah A Smith, and Jiebo Luo, · 2022
Earlier work this paper cites.
“Fine-tuning pre-trained language models with noise stability regularization,”
Hang Hua, Xingjian Li, Dejing Dou, Cheng-Zhong Xu, and Jiebo Luo, · 2022
Earlier work this paper cites.
“Unbiased multi-modality guidance for image inpainting,”
Yongsheng Yu, Dawei Du, Libo Zhang, and Tiejian Luo, · 2022
Earlier work this paper cites.
“Winoground: Probing vision and language models for visio-linguistic compositionality,”
Tristan Thrush, Ryan Jiang, Max Bartolo, Amanpreet Singh, Adina Williams, Douwe Kiela, and Candace Ross, · 2022
Earlier work this paper cites.
“Large language models are zero-shot reasoners,”
Takeshi Kojima, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo, and Yusuke Iwasawa, · 2022
Earlier work this paper cites.
“Llama: Open and efficient foundation language models,”
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al., · 2023
Earlier work this paper cites.
“Dnagpt: A generalized pretrained tool for multiple dna sequence analysis tasks,”
Daoan Zhang, Weitong Zhang, Bing He, Jianguo Zhang, Chenchen Qin, and Jianhua Yao, · 2023
Cited alongside, same era.
Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee, · 2023
Cited alongside, same era.
“Llmva-gebc: Large language model with video adapter for generic event boundary captioning,”
Yunlong Tang, Jinrui Zhang, Xiangchen Wang, Teng Wang, and Feng Zheng, · 2023
Cited alongside, same era.
“Gpt-4v (ision) as a social media analysis engine,”
Hanjia Lyu, Jinfa Huang, Daoan Zhang, Yongsheng Yu, Xinyi Mou, Jinsheng Pan, Zhengyuan Yang, Zhongyu Wei, and Jiebo Luo, · 2023
Cited alongside, same era.
“Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language models,”
“Mmicl: Empowering vision-language model with multi-modal in-context learning,”
Haozhe Zhao, Zefan Cai, Shuzheng Si, Xiaojian Ma, Kaikai An, Liang Chen, Zixuan Liu, Sheng Wang, Wenjuan Han, and Baobao Chang, · 2023
Later among the works it cites.
OpenAI, · 2023
Later among the works it cites.
“Gemini: A family of highly capable multimodal models,”
Gemini Team, Rohan Anil, Sebastian Borgeaud, Yonghui Wu, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, et al., · 2023
Later among the works it cites.
“Mmbench: Is your multi-modal model an all-around player?,”
Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, et al., · 2023
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Ge Zheng, Bin Yang, Jiajin Tang, Hong-Yu Zhou, and Sibei Yang, · 2023
Cited alongside, same era.
“Compositional chain-of-thought prompting for large multimodal models,”
Chancharik Mitra, Brandon Huang, Trevor Darrell, and Roei Herzig, · 2023
Cited alongside, same era.
“Openflamingo: An open-source framework for training large autoregressive vision-language models,”
Anas Awadalla, Irena Gao, Josh Gardner, Jack Hessel, Yusuf Hanafy, Wanrong Zhu, Kalyani Marathe, Yonatan Bitton, Samir Gadre, Shiori Sagawa, et al., · 2023
Cited alongside, same era.
“Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners,”
Renrui Zhang, Xiangfei Hu, Bohao Li, Siyuan Huang, Hanqiu Deng, Yu Qiao, Peng Gao, and Hongsheng Li, · 2023
Later among the works it cites.
“Language is not all you need: Aligning perception with language models,”
Shaohan Huang, Li Dong, Wenhui Wang, Yaru Hao, Saksham Singhal, Shuming Ma, Tengchao Lv, Lei Cui, Owais Khan Mohammed, Qiang Liu, et al., · 2023
Later among the works it cites.
“Factify 2: A multimodal fake news and satire news dataset,”
S Suryavardan, Shreyash Mishra, Parth Patwa, Megha Chakraborty, Anku Rani, Aishwarya Reganti, Aman Chadha, Amitava Das, Amit Sheth, Manoj Chinnakotla, et al., · 2023
Later among the works it cites.