Fetching the paper…
Reading the bibliography…
While most music generation models generate a mixture of stems (in mono or stereo), we propose to train a multi-stem generative model with 3 stems (bass, drums and other) that learn the musical dependencies between them.
Twentieth-Century Harmony
Vincent Persichetti, · 1961
Earlier work this paper cites.
“mir_eval: A transparent implementation of common mir metrics,”
Colin Raffel, Brian Mcfee, Eric Humphrey, Justin Salamon, Oriol Nieto, Dawen Liang, and Daniel Ellis, · 2014
Earlier work this paper cites.
“Wavenet: A generative model for raw audio,” 2016
Aaron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew Senior, and Koray Kavukcuoglu, · 2016
Earlier work this paper cites.
“madmom: a new Python Audio and Music Signal Processing Library,”
Sebastian Böck, Filip Korzeniowski, Jan Schlüter, Florian Krebs, and Gerhard Widmer, · 2016
Earlier work this paper cites.
“Fréchet audio distance: A metric for evaluating music enhancement algorithms,” 2019
Kevin Kilgour, Mauricio Zuluaga, Dominik Roblek, and Matthew Sharifi, · 2019
Earlier work this paper cites.
“Cutting music source separation some slakh: A dataset to study the impact of training data quality and quantity,”
Ethan Manilow, Gordon Wichern, Prem Seetharaman, and Jonathan Le Roux, · 2019
Earlier work this paper cites.
“Soundstream: An end-to-end neural audio codec,”
Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi, · 2022
Earlier work this paper cites.
“High fidelity neural audio compression,”
Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi, · 2022
Earlier work this paper cites.
“Photorealistic text-to-image diffusion models with deep language understanding,” 2022
Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J Fleet, and Mohammad Norouzi, · 2022
Earlier work this paper cites.
“High-resolution image synthesis with latent diffusion models,” 2022
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer, · 2022
Earlier work this paper cites.
“Clap: Learning audio concepts from natural language supervision,” 2022
Benjamin Elizalde, Soham Deshmukh, Mahmoud Al Ismail, and Huaming Wang, · 2022
Earlier work this paper cites.
“Simple and controllable music generation,”
Jade Copet, Felix Kreuk, Itai Gat, Tal Remez, David Kant, Gabriel Synnaeve, Yossi Adi, and Alexandre Défossez, · 2023
Earlier work this paper cites.
“Musiclm: Generating music from text,” 2023
Andrea Agostinelli, Timo I. Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank, · 2023
Cited alongside, same era.
“Singsong: Generating musical accompaniments from singing,”
Chris Donahue, Antoine Caillon, Adam Roberts, Ethan Manilow, Philippe Esling, Andrea Agostinelli, Mauro Verzetti, Ian Simon, Olivier Pietquin, Neil Zeghidour, and Jesse Engel, · 2023
Cited alongside, same era.
“Jen-1 composer: A unified framework for high-fidelity multi-track music generation,”
Yao Yao, Peike Li, Boyu Chen, and Alex Wang, · 2023
Cited alongside, same era.
“Hybrid transformers for music source separation,”
Simon Rouard, Francisco Massa, and Alexandre Défossez, · 2023
Cited alongside, same era.
“High-fidelity audio compression with improved rvqgan,”
Rithesh Kumar, Prem Seetharaman, Alejandro Luebs, Ishaan Kumar, and Kundan Kumar, · 2023
Cited alongside, same era.
“Stemgen: A music generation model that listens,”
Julian D. Parker, Janne Spijkervet, Katerina Kosta, Furkan Yesiler, Boris Kuznetsov, Ju-Chiang Wang, Matt Avent, Jitong Chen, and Duc Le, · 2024
Later among the works it cites.
“Multi-source diffusion models for simultaneous music generation and separation,”
Giorgio Mariani, Irene Tallini, Emilian Postolache, Michele Mancusi, Luca Cosmo, and Emanuele Rodolà, · 2024
Later among the works it cites.
“An independence-promoting loss for music generation with language models,”
Jean-Marie Lemercier, Simon Rouard, Jade Copet, Yossi Adi, and Alexandre Défossez, · 2024
Later among the works it cites.
“Masked audio generation using a single non-autoregressive transformer,”
Alon Ziv, Itai Gat, Gael Le Lan, Tal Remez, Felix Kreuk, Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi, · 2024
Later among the works it cites.
“Zero-shot unsupervised and text-based audio editing using ddpm inversion,”
Hila Manor and Tomer Michaeli, · 2024
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Vampnet: Music generation via masked acoustic token modeling,”
Hugo Flores Garcia, Prem Seetharaman, Rithesh Kumar, and Bryan Pardo, · 2023
Cited alongside, same era.
“Musicldm: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies,” 2023
Ke Chen, Yusong Wu, Haohe Liu, Marianna Nezhurina, Taylor Berg-Kirkpatrick, and Shlomo Dubnov, · 2023
Cited alongside, same era.
“Audioldm 2: Learning holistic audio generation with self-supervised pretraining,” 2023
Haohe Liu, Qiao Tian, Yiitan Yuan, Xubo Liu, Xinhao Mei, Qiuqiang Kong, Yuping Wang, Wenwu Wang, Yuxuan Wang, and MarkD . Plumbley, · 2023
Cited alongside, same era.
“Pesto: Pitch estimation with self-supervised transposition-equivariant objective,”
Alain Riou, Stefan Lattner, Gaëtan Hadjeres, and Geoffroy Peeters, · 2023
Cited alongside, same era.
“Fast timing-conditioned latent audio diffusion,” 2024
Zach Evans, CJ Carr, Josiah Taylor, Scott H. Hawley, and Jordi Pons, · 2024
Cited alongside, same era.
“Joint audio and symbolic conditioning for temporally controlled text-to-music generation,”
Or Tal, Alon Ziv, Itai Gat, Felix Kreuk, and Yossi Adi, · 2024
Cited alongside, same era.
“Music controlnet: Multiple time-varying controls for music generation,”
Shih-Lun Wu, Chris Donahue, Shinji Watanabe, and Nicholas J Bryan, · 2024
Cited alongside, same era.
“Ditto: Diffusion inference-time t-optimization for music generation,”
Zachary Novack, Julian McAuley, Taylor Berg-Kirkpatrick, and Nicholas J. Bryan, · 2024
Later among the works it cites.
“Musicmagus: Zero-shot text-to-music editing via diffusion models,” 2024
Yixiao Zhang, Yukara Ikemiya, Gus Xia, Naoki Murata, Marco A. Martínez-Ramírez, Wei-Hsiang Liao, Yuki Mitsufuji, and Simon Dixon, · 2024
Later among the works it cites.
“Investigating personalization methods in text to music generation,”
Manos Plitsis, Theodoros Kouzelis, Georgios Paraskevopoulos, Vassilis Katsouros, and Yannis Panagakis, · 2024
Later among the works it cites.
“Audio conditioning for music generation via discrete bottleneck features,”
Simon Rouard, Yossi Adi, Jade Copet, Axel Roebel, and Alexandre Défossez, · 2024
Later among the works it cites.
“Instruct-musicgen: Unlocking text-to-music editing for music language models via instruction tuning,” 2024
Yixiao Zhang, Yukara Ikemiya, Woosung Choi, Naoki Murata, Marco A. Martínez-Ramírez, Liwei Lin, Gus Xia, Wei-Hsiang Liao, Yuki Mitsufuji, and Simon Dixon, · 2024
Later among the works it cites.
“Diff-a-riff: Musical accompaniment co-creation via latent diffusion models,” 2024
Javier Nistal, Marco Pasini, Cyran Aouameur, Maarten Grachten, and Stefan Lattner, · 2024
Later among the works it cites.