Phenaki: Variable length video generation from open domain textual description
Original
Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, and Dumitru Erhan · 2022
Later among the works it cites.
Mcvd: Masked conditional video diffusion for prediction, generation, and interpolation
Vikram Voleti, Alexia Jolicoeur-Martineau, and Christopher Pal · 2022
Later among the works it cites.
Novel view synthesis with diffusion models, 2022
Daniel Watson, William Chan, Ricardo Martin-Brualla, Jonathan Ho, Andrea Tagliasacchi, and Mohammad Norouzi · 2022
Later among the works it cites.
Nüwa: Visual synthesis pre-training for neural visual world creation
Chenfei Wu, Jian Liang, Lei Ji, Fan Yang, Yuejian Fang, Daxin Jiang, and Nan Duan · 2022
Later among the works it cites.
Magicvideo: Efficient video generation with latent diffusion models
Original
Daquan Zhou, Weimin Wang, Hanshu Yan, Weiwei Lv, Yizhe Zhu, and Jiashi Feng · 2022
Later among the works it cites.
Latent-shift: Latent diffusion with temporal shift for efficient text-to-video generation
Original
Jie An, Songyang Zhang, Harry Yang, Sonal Gupta, Jia-Bin Huang, Jiebo Luo, and Xi Yin · 2023
Closest in time.
Renderdiffusion: Image diffusion for 3d reconstruction, inpainting and generation
Titas Anciukevičius, Zexiang Xu, Matthew Fisher, Paul Henderson, Hakan Bilen, Niloy J Mitra, and Paul Guerrero · 2023
Closest in time.
Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models
Original
Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, and Karsten Kreis · 2023
Closest in time.
Emu: Enhancing image generation models using photogenic needles in a haystack, 2023
Xiaoliang Dai, Ji Hou, Chih-Yao Ma, Sam Tsai, Jialiang Wang, Rui Wang, Peizhao Zhang, Simon Vandenhende, Xiaofang Wang, Abhimanyu Dubey, Matthew Yu, Abhishek Kadian, Filip Radenovic, Dhruv Mahajan, Kunpeng Li, Yue Zhao, Vladan Petrovic, Mitesh Kumar Singh, Simran Motwani, Yi Wen, Yiwen Song, Roshan Sumbaly, Vignesh Ramanathan, Zijian He, Peter Vajda, and Devi Parikh · 2023
Closest in time.
Nerdi: Single-view nerf synthesis with language-guided diffusion as general image priors
Congyue Deng, Chiyu Jiang, Charles R Qi, Xinchen Yan, Yin Zhou, Leonidas Guibas, Dragomir Anguelov, et al · 2023
Closest in time.
Structure and content-guided video synthesis with diffusion models, 2023
Patrick Esser, Johnathan Chiu, Parmida Atighehchian, Jonathan Granskog, and Anastasis Germanidis · 2023
Closest in time.
Preserve your own correlation: A noise prior for video diffusion models
Songwei Ge, Seungjun Nah, Guilin Liu, Tyler Poon, Andrew Tao, Bryan Catanzaro, David Jacobs, Jia-Bin Huang, Ming-Yu Liu, and Yogesh Balaji · 2023
Closest in time.
Reuse and diffuse: Iterative denoising for text-to-video generation
Original
Jiaxi Gu, Shicong Wang, Haoyu Zhao, Tianyi Lu, Xing Zhang, Zuxuan Wu, Songcen Xu, Wei Zhang, Yu-Gang Jiang, and Hang Xu · 2023
Closest in time.
Animatediff: Animate your personalized text-to-image diffusion models without specific tuning
Original
Yuwei Guo, Ceyuan Yang, Anyi Rao, Yaohui Wang, Yu Qiao, Dahua Lin, and Bo Dai · 2023
Closest in time.
Diffusion with offset noise, 2023
Nicholas Guttenberg and CrossLabs · 2023
Closest in time.
Latent video diffusion models for high-fidelity long video generation, 2023
Yingqing He, Tianyu Yang, Yong Zhang, Ying Shan, and Qifeng Chen · 2023
Closest in time.
simple diffusion: End-to-end diffusion for high resolution images
Original
Emiel Hoogeboom, Jonathan Heek, and Tim Salimans · 2023
Closest in time.
Shap-e: Generating conditional 3d implicit functions, 2023
Heewoo Jun and Alex Nichol · 2023
Closest in time.
Text2video-zero: Text-to-image diffusion models are zero-shot video generators, 2023
Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan, Roberto Henschel, Zhangyang Wang, Shant Navasardyan, and Humphrey Shi · 2023
Closest in time.
Pika labs,
Pika Labs · 2023
Closest in time.
Common Diffusion Noise Schedules and Sample Steps are Flawed
Original
Shanchuan Lin, Bingchen Liu, Jiashi Li, and Xiao Yang · 2023
Closest in time.
On distillation of guided diffusion models, 2023
Chenlin Meng, Robin Rombach, Ruiqi Gao, Diederik P. Kingma, Stefano Ermon, Jonathan Ho, and Tim Salimans · 2023
Closest in time.
The RefinedWeb dataset for Falcon LLM: outperforming curated corpora with web data, and web data only
Original
Guilherme Penedo, Quentin Malartic, Daniel Hesslow, Ruxandra Cojocaru, Alessandro Cappelli, Hamza Alobeidli, Baptiste Pannier, Ebtesam Almazrouei, and Julien Launay · 2023
Closest in time.
SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
Original
Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann, Tim Dockhorn, Jonas Müller, Joe Penna, and Robin Rombach · 2023
Closest in time.
Training contrastive captioners
Giovanni Puccetti, Maciej Kilian, and Romain Beaumont · 2023
Closest in time.
Gen-2 by runway,
RunwayML · 2023
Closest in time.
Mvdream: Multi-view diffusion for 3d generation
Original
Yichun Shi, Peng Wang, Jianglong Ye, Mai Long, Kejie Li, and Xiao Yang · 2023
Closest in time.
Understanding and mitigating copying in diffusion models, 2023
Gowthami Somepalli, Vasu Singla, Micah Goldblum, Jonas Geiping, and Tom Goldstein · 2023
Closest in time.
Demystifying clip data, 2023
Hu Xu, Saining Xie, Xiaoqing Ellen Tan, Po-Yao Huang, Russell Howes, Vasu Sharma, Shang-Wen Li, Gargi Ghosh, Luke Zettlemoyer, and Christoph Feichtenhofer · 2023
Closest in time.
Videoblip
Keunwoo Peter Yu · 2023
Closest in time.
Mvimgnet: A large-scale dataset of multi-view images
Xianggang Yu, Mutian Xu, Yidan Zhang, Haolin Liu, Chongjie Ye, Yushuang Wu, Zizheng Yan, Chenming Zhu, Zhangyang Xiong, Tianyou Liang, et al · 2023
Closest in time.
Sparsefusion: Distilling view-conditioned diffusion for 3d reconstruction
Zhizhuo Zhou and Shubham Tulsiani · 2023
Closest in time.