A Dataset and Reranking Method for Multimodal MT of User-Generated Image Captions
Schamoni, S.; Hitschler, J.; and Riezler, S. 2018 · 2018
Cited alongside, same era.
Denoising diffusion probabilistic models
Ho, J.; Jain, A.; and Abbeel, P. 2020 · 2020
Cited alongside, same era.
CogView: Mastering Text-to-Image Generation via Transformers
Original
Ding, M.; Yang, Z.; Hong, W.; Zheng, W.; Zhou, C.; Yin, D.; Lin, J.; Zou, X.; Shao, Z.; Yang, H.; and Tang, J. 2021 · 2021
Cited alongside, same era.
Clipscore: A reference-free evaluation metric for image captioning
Original
Hessel, J.; Holtzman, A.; Forbes, M.; Bras, R. L.; and Choi, Y. 2021 · 2021
Cited alongside, same era.
Lora: Low-rank adaptation of large language models
Original
Hu, E. J.; Shen, Y.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; and Chen, W. 2021 · 2021
Cited alongside, same era.
Wit: Wikipedia-based image text dataset for multimodal multilingual machine learning
Srinivasan, K.; Raman, K.; Chen, J.; Bendersky, M.; and Najork, M. 2021 · 2021
Cited alongside, same era.
ERNIE-ViLG: Unified generative pre-training for bidirectional vision-language generation
Original
Zhang, H.; Yin, W.; Fang, Y.; Li, L.; Duan, B.; Wu, Z.; Sun, Y.; Tian, H.; Wu, H.; and Wang, H. 2021 · 2021
Cited alongside, same era.
Cross-lingual and multilingual clip
Carlsson, F.; Eisen, P.; Rekathati, F.; and Sahlgren, M. 2022 · 2022
Cited alongside, same era.
AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities
Original
Chen, Z.; Liu, G.; Zhang, B.-W.; Ye, F.; Yang, Q.; and Wu, L. 2022 · 2022
Cited alongside, same era.
Reproducible scaling laws for contrastive language-image learning
Original
Cherti, M.; Beaumont, R.; Wightman, R.; Wortsman, M.; Ilharco, G.; Gordon, C.; Schuhmann, C.; Schmidt, L.; and Jitsev, J. 2022 · 2022
Cited alongside, same era.
CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers
Original
Ding, M.; Zheng, W.; Hong, W.; and Tang, J. 2022 · 2022
Cited alongside, same era.
Japanese Stable Diffusion
Shing, M.; and Sawada, K. 2022a
Cited in the paper.