Fetching the paper…
Reading the bibliography…
The emergence of multimodal large models has advanced artificial intelligence, introducing unprecedented levels of performance and functionality.
Hierarchical grouping to optimize an objective function
Ward Jr, J. H · 1963
Earlier work this paper cites.
The OpenCV Library
Bradski, G · 2000
Earlier work this paper cites.
Msr-vtt: A large video description dataset for bridging video and language
Xu, J., Mei, T., Yao, T., and Rui, Y · 2016
Earlier work this paper cites.
Towards vqa models that can read
Singh, A., Natarajan, V., Shah, M., Jiang, Y., Chen, X., Batra, D., Parikh, D., and Rohrbach, M · 2019
Earlier work this paper cites.
FVD: A new metric for video generation
Unterthiner, T., van Steenkiste, S., Kurach, K., Marinier, R., Michalski, M., and Gelly, S · 2019
Earlier work this paper cites.
Transformers: State-of-the-art natural language processing
Wolf, T., Debut, L., Sanh, V., Chaumond, J., Delangue, C., Moi, A., Cistac, P., Rault, T., Louf, R., Funtowicz, M., et al · 2020
Earlier work this paper cites.
Frozen in time: A joint video and image encoder for end-to-end retrieval
Bain, M., Nagrani, A., Varol, G., and Zisserman, A · 2021
Earlier work this paper cites.
Datasets: A community library for natural language processing
Lhoest, Q., Villanova del Moral, A., Jernite, Y., Thakur, A., von Platen, P., Patil, S., Chaumond, J., Drame, M., Plu, J., Tunstall, L., Davison, J., Šaško, M., Chhablani, G., Malik, B., Brandeis, S., Le Scao, T., Sanh, V., Xu, C., Patry, N., McMillan-Major, A., Schmid, P., Gugger, S., Delangue, C., Matussière, T., Debut, L., Bekman, S., Cistac, P., Goehringer, T., Mustar, V., Lagunas, F., Rush, A., and Wolf, T · 2021
Earlier work this paper cites.
Learning transferable visual models from natural language supervision
Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al · 2021
Earlier work this paper cites.
Lora: Low-rank adaptation of large language models
Hu, E. J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W., et al · 2022
Earlier work this paper cites.
Diffusers: State-of-the-art diffusion models
von Platen, P., Patil, S., Lozhkov, A., Cuenca, P., Lambert, N., Rasul, K., Davaadorj, M., Nair, D., Paul, S., Berman, W., Xu, Y., Liu, S., and Wolf, T · 2022
Earlier work this paper cites.
Reproducible scaling laws for contrastive language-image learning
Cherti, M., Beaumont, R., Wightman, R., Wortsman, M., Ilharco, G., Gordon, C., Schuhmann, C., Schmidt, L., and Jitsev, J · 2023
Earlier work this paper cites.
Rapsai: Accelerating machine learning prototyping of multimedia applications through visual programming
Du, R., Li, N., Jin, J., Carney, M., Miles, S., Kleiner, M., Yuan, X., Zhang, Y., Kulkarni, A., Liu, X., et al · 2023
Earlier work this paper cites.
MME: A comprehensive evaluation benchmark for multimodal large language models
Fu, C., Chen, P., Shen, Y., Qin, Y., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., et al · 2023
Earlier work this paper cites.
DataComp: In search of the next generation of multimodal datasets
Gadre, S. Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., Orgad, E., Entezari, R., Daras, G., Pratt, S. M., Ramanujan, V., Bitton, Y., Marathe, K., Mussmann, S., Vencu, R., Cherti, M., Krishna, R., Koh, P. W., Saukh, O., Ratner, A., Song, S., Hajishirzi, H., Farhadi, A., Beaumont, R., Oh, S., Dimakis, A., Jitsev, J., Carmon, Y., Shankar, V., and Schmidt, L · 2023
Cited alongside, same era.
Torchaudio 2.1: Advancing speech recognition, self-supervised learning, and audio processing components for pytorch
Hwang, J., Hira, M., Chen, C., Zhang, X., Ni, Z., Sun, G., Ma, P., Huang, R., Pratap, V., Zhang, Y., et al · 2023
Cited alongside, same era.
MMagic: OpenMMLab multimodal advanced, generative, and intelligent creation toolbox
MMagic Contributors · 2023
Cited alongside, same era.
Reproducing whisper-style training using an open-source toolkit and publicly available data
Peng, Y., Tian, J., Yan, B., Berrebbi, D., Chang, X., Li, X., Shi, J., Arora, S., Chen, W., Sharma, R., et al · 2023
Cited alongside, same era.
Consistency models
Song, Y., Dhariwal, P., Chen, M., and Sutskever, I · 2023
Enhancing multimodal large language models with vision detection models: An empirical study
Jiao, Q., Chen, D., Huang, Y., Li, Y., and Shen, Y · 2024
Closest in time.
Kling ai: Next-generation ai creative studio
Kuaishou · 2024
Closest in time.
On LLMs-driven synthetic data generation, curation, and evaluation: A survey
Long, L., Wang, R., Xiao, R., Zhao, J., Ding, X., Chen, G., and Wang, H · 2024
Closest in time.
On the challenges and opportunities in generative ai, 2024
Manduchi, L., Pandey, K., Bamler, R., Cotterell, R., Däubener, S., Fellenz, S., Fischer, A., Gärtner, T., Kirchler, M., Kloft, M., Li, Y., Lippert, C., de Melo, G., Nalisnick, E., Ommer, B., Ranganath, R., Rudolph, M., Ullrich, K., den Broeck, G. V., Vogt, J. E., Wang, Y., Wenzel, F., Wood, F., Mandt, S., and Fortuin, V · 2024
Closest in time.
Introducing gen-3 alpha: A new frontier for video generation, October 2024
RunwayML · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Internvid: A large-scale video-text dataset for multimodal understanding and generation
Wang, Y., He, Y., Li, Y., Li, K., Yu, J., Ma, X., Li, X., Chen, G., Chen, X., Wang, Y., et al · 2023
Cited alongside, same era.
Wu, X., Hao, Y., Sun, K., Chen, Y., Zhu, F., Zhao, R., and Li, H · 2023
Cited alongside, same era.
Multimodal learning with transformers: A survey
Xu, P., Zhu, X., and Clifton, D. A · 2023
Cited alongside, same era.
A survey of multimodal large language model from a data-centric perspective
Bai, T., Liang, H., Wan, B., Yang, L., Li, B., Wang, Y., Cui, B., He, C., Yuan, B., and Zhang, W · 2024
Cited alongside, same era.
The revolution of multimodal large language models: A survey
Caffagni, D., Cocchi, F., Barsellotti, L., Moratelli, N., Sarto, S., Baraldi, L., Cornia, M., Cucchiara, R., et al · 2024
Cited alongside, same era.
Language modeling is compression
Delétang, G., Ruoss, A., Duquenne, P., Catt, E., Genewein, T., Mattern, C., Grau-Moya, J., Wenliang, L. K., Aitchison, M., Orseau, L., Hutter, M., and Veness, J · 2024
Cited alongside, same era.
Data mixing made efficient: A bivariate scaling law for language model pretraining, 2024
Ge, C., Ma, Z., Chen, D., Li, Y., and Ding, B · 2024
Cited alongside, same era.
Redpajama: an open dataset for training large language models
Weber, M., Fu, D., Anthony, Q., Oren, Y., Adams, S., Alexandrov, A., Lyu, X., Nguyen, H., Yao, X., Adams, V., et al · 2024
Closest in time.
Cogvideox: Text-to-video diffusion models with an expert transformer
Yang, Z., Teng, J., Zheng, W., Ding, M., Huang, S., Xu, J., Yang, Y., Hong, W., Zhang, X., Feng, G., et al · 2024
Closest in time.
A survey on multimodal large language models
Yin, S., Fu, C., Zhao, S., Li, K., Sun, X., Xu, T., and Chen, E · 2024
Closest in time.
MM-LLMs: Recent advances in multimodal large language models
Zhang, D., Yu, Y., Dong, J., Li, C., Su, D., Chu, C., and Yu, D · 2024
Closest in time.
Vchitect-2.0: Parallel transformer for scaling up video diffusion models
Fan, W., Si, C., Song, J., Yang, Z., He, Y., Zhuo, L., Huang, Z., Dong, Z., He, J., Pan, D., et al · 2025
Closest in time.
Img-diff: Contrastive data synthesis for multimodal large language models
Jiao, Q., Chen, D., Huang, Y., Ding, B., Li, Y., and Shen, Y · 2025
Closest in time.
Pan, X., Chen, Y., Chen, Y., Sun, Y., Chen, D., Zhang, W., Xie, Y., Huang, Y., Zhang, Y., Gao, D., Li, Y., Ding, B., and Zhou, J · 2025
Closest in time.
The synergy between data and multi-modal large language models: A survey from co-development perspective
Qin, Z., Chen, D., Zhang, W., Yao, L., Huang, Y., Ding, B., Li, Y., and Deng, S · 2025
Closest in time.
Lavie: High-quality video generation with cascaded latent diffusion models
Wang, Y., Chen, X., Ma, X., Zhou, S., Huang, Z., Wang, Y., Yang, C., He, Y., Yu, J., Yang, P., et al · 2025
Closest in time.