Fetching the paper…
Reading the bibliography…
In recent years, the field of image generation has been revolutionized by the application of autoregressive transformers and DDPMs.
VQVAE (rosinality)
Seonghyeon, K. (2019) · 2019
Earlier work this paper cites.
Libritts: A corpus derived from librispeech for text-to-speech
Zen, H., Dang, V., Clark, R., Zhang, Y., Weiss, R. J., Jia, Y., Chen, Z., and Wu, Y. (2019) · 2019
Earlier work this paper cites.
Denoising diffusion probabilistic models
Ho, J., Jain, A., and Abbeel, P. (2020) · 2020
Earlier work this paper cites.
Vector Quantize (Lucidrains)
Wang, P. (2020) · 2020
Earlier work this paper cites.
Hi-fi multi-speaker english tts dataset
Bakhturina, E., Lavrukhin, V., Ginsburg, B., and Zhang, Y. (2021) · 2021
Cited alongside, same era.
Mindslab UnivNet implementation
Kim, J. (2021) · 2021
Cited alongside, same era.
Improved denoising diffusion probabilistic models
Nichol, A. and Dhariwal, P. (2021) · 2021
Cited alongside, same era.
Learning transferable visual models from natural language supervision
Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I. (2021) · 2021
Cited alongside, same era.
Zero-shot text-to-image generation
Ramesh, A., Pavlov, M., Goh, G., Gray, S., Voss, C., Radford, A., Chen, M., and Sutskever, I. (2021) · 2021
Later among the works it cites.
x-transformers (Lucidrains)
Wang, P. (2021) · 2021
Later among the works it cites.
Denoising diffusion implicit models
Song, J., Meng, C., and Ermon, S. (2022) · 2022
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…