Fetching the paper…
Reading the bibliography…
Multi-modal learning has significantly advanced generative AI, especially in vision-language modeling.
Pathvqa: 30000+ questions for medical visual question answering
X. He, Y. Zhang, L. Mou, E. Xing, and P. Xie · 2003
Earlier work this paper cites.
Pathvqa: 30000+ questions for medical visual question answering
X. He, Y. Zhang, L. Mou, E. P. Xing, and P. Xie · 2003
Earlier work this paper cites.
Language models are unsupervised multitask learners
A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, I. Sutskever, et al · 2019
Earlier work this paper cites.
Vaping-induced lung injury: An uncharted territory
A. Bharat, N. Jain, B. Sheikh, H. Jeelani, and M. Shayuk · 2020
Earlier work this paper cites.
Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering
B. Liu, L.-M. Zhan, L. Xu, L. Ma, Y. F. Yang, and X.-M. Wu · 2021
Earlier work this paper cites.
Learning transferable visual models from natural language supervision
A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark, et al · 2021
Earlier work this paper cites.
Multimodal few-shot learning with frozen language models
M. Tsimpoukelli, J. L. Menick, S. Cabi, S. Eslami, O. Vinyals, and F. Hill · 2021
Earlier work this paper cites.
Self-supervised vision-language pretraining for medical visual question answering
P. Li, G. Liu, L. Tan, J. Liao, and S. Zhong · 2022
Earlier work this paper cites.
Biogpt: generative pre-trained transformer for biomedical text generation and mining
R. Luo, L. Sun, Y. Xia, T. Qin, S. Zhang, H. Poon, and T.-Y. Liu · 2022
Earlier work this paper cites.
BiomedLM: a domain-specific large language model for biomedical text
A. Venigalla, J. Frankle, and M. Carbin · 2022
Earlier work this paper cites.
https://wanglab.ml/clinical_camel.html , 2023
Clinical Camel · 2023
Earlier work this paper cites.
J. Bai, S. Bai, Y. Chu, Z. Cui, K. Dang, X. Deng, Y. Fan, W. Ge, Y. Han, F. Huang, B. Hui, L. Ji, M. Li, J. Lin, R. Lin, D. Liu, G. Liu, C. Lu, K. Lu, J. Ma, R. Men, X. Ren, X. Ren, C. Tan, S. Tan, J. Tu, P. Wang, S. Wang, W. Wang, S. Wu, B. Xu, J. Xu, A. Yang, H. Yang, J. Yang, J. Yang, S. Yang, Y. Yao, B. Yu, Y. Bowen, H. Yuan, Z. Yuan, J. Zhang, X. Zhang, Y. Zhang, Z. Zhang, C. Zhou, J. Zhou, X. Zhou, and T. Zhu · 2023
Earlier work this paper cites.
Vision–language model for visual question answering in medical imagery
Y. Bazi, M. M. A. Rahhal, L. Bashmal, and M. Zuair · 2023
Earlier work this paper cites.
Masked image modeling advances 3d medical image analysis
Z. Chen, D. Agarwal, K. Aggarwal, W. Safta, M. M. Balan, and K. Brown · 2023
Cited alongside, same era.
PaLM-E: An embodied multimodal language model
D. Driess, F. Xia, M. S. Sajjadi, C. Lynch, A. Chowdhery, B. Ichter, A. Wahid, J. Tompson, Q. Vuong, T. Yu, et al · 2023
Cited alongside, same era.
Pubmedclip: How much does clip benefit visual question answering in the medical domain?
S. Eslami, C. Meinel, and G. De Melo · 2023
Cited alongside, same era.
A. Fang, A. M. Jose, A. Jain, L. Schmidt, A. Toshev, and V. Shankar · 2023
Cited alongside, same era.
Medalpaca–an open-source collection of medical conversational ai models and training data
T. Han, L. C. Adams, J.-M. Papaioannou, P. Grundmann, T. Oberhauser, A. Löser, D. Truhn, and K. K. Bressem · 2023
Pmc-llama: Further finetuning llama on medical papers
C. Wu, X. Zhang, Y. Zhang, Y. Wang, and W. Xie · 2023
Later among the works it cites.
Doctorglm: Fine-tuning your chinese doctor is not a herculean task
H. Xiong, S. Wang, Y. Zhu, Z. Zhao, Y. Liu, Q. Wang, and D. Shen · 2023
Later among the works it cites.
Chatdoctor: A medical chat model fine-tuned on llama model using medical domain knowledge
L. Yunxiang, L. Zihan, Z. Kai, D. Ruilong, and Z. You · 2023
Later among the works it cites.
Sigmoid loss for language image pre-training
X. Zhai, B. Mustafa, A. Kolesnikov, and L. Beyer · 2023
Later among the works it cites.
Judging llm-as-a-judge with mt-bench and chatbot arena, 2023
L. Zheng, W.-L. Chiang, Y. Sheng, S. Zhuang, Z. Wu, Y. Zhuang, Z. Lin, Z. Li, D. Li, E. P. Xing, H. Zhang, J. E. Gonzalez, and I. Stoica · 2023
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
A. Q. Jiang, A. Sablayrolles, A. Mensch, C. Bamford, D. S. Chaplot, D. de Las Casas, F. Bressand, G. Lengyel, G. Lample, L. Saulnier, L. R. Lavaud, M.-A. Lachaux, P. Stock, T. L. Scao, T. Lavril, T. Wang, T. Lacroix, and W. E. Sayed · 2023
Cited alongside, same era.
Llava-med: Training a large language-and-vision assistant for biomedicine in one day
C. Li, C. Wong, S. Zhang, N. Usuyama, H. Liu, J. Yang, T. Naumann, H. Poon, and J. Gao · 2023
Cited alongside, same era.
OpenAI · 2023
Cited alongside, same era.
Visual med-alpaca: A parameter-efficient biomedical llm with visual capabilities
C. Shu, B. Chen, F. Liu, Z. Fu, E. Shareghi, and N. Collier · 2023
Cited alongside, same era.
Llama: Open and efficient foundation language models
H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, T. Lacroix, B. Rozière, N. Goyal, E. Hambro, F. Azhar, et al · 2023
Cited alongside, same era.
Open-ended medical visual question answering through prefix tuning of language models
T. van Sonsbeek, M. M. Derakhshani, I. Najdenkoska, C. G. Snoek, and M. Worring · 2023
Cited alongside, same era.
Vicuna: An open-source chatbot impressing GPT-4 with 90%* chatgpt quality
Vicuna · 2023
Cited alongside, same era.
Later among the works it cites.
The claude 3 model family: Opus, sonnet, haiku
Anthropic · 2024
Closest in time.
Mini-gemini: Mining the potential of multi-modality vision language models
Y. Li, Y. Zhang, C. Wang, Z. Zhong, Y. Chen, R. Chu, S. Liu, and J. Jia · 2024
Closest in time.
Llava-next: Improved reasoning, ocr, and world knowledge, January 2024
H. Liu, C. Li, Y. Li, B. Li, Y. Zhang, S. Shen, and Y. J. Lee · 2024
Closest in time.
Mm1: Methods, analysis & insights from multimodal llm pre-training
B. McKinzie, Z. Gan, J.-P. Fauconnier, S. Dodge, B. Zhang, P. Dufter, D. Shah, X. Du, F. Peng, F. Weers, A. Belyi, H. Zhang, K. Singh, D. Kang, A. Jain, H. He, M. Schwarzer, T. Gunter, X. Kong, A. Zhang, J. Wang, C. Wang, N. Du, T. Lei, S. Wiseman, G. Yin, M. Lee, Z. Wang, R. Pang, P. Grasch, A. Toshev, and Y. Yang · 2024
Closest in time.
Introducing meta llama 3: The most capable openly available llm to date, 2024
Meta · 2024
Closest in time.
When do we not need larger vision models?
B. Shi, Z. Wu, M. Mao, X. Wang, and T. Darrell · 2024
Closest in time.
Assessing the potential of gpt-4 to perpetuate racial and gender biases in health care: a model evaluation study
T. Zack, E. Lehman, M. Suzgun, J. A. Rodriguez, L. A. Celi, J. W. Gichoya, D. Jurafsky, P. Szolovits, D. W. Bates, R.-E. E. Abdulnour, A. J. Butte, and E. Alsentzer · 2024
Closest in time.