Fetching the paper…
Reading the bibliography…
Speech language models have significantly advanced in generating realistic speech, with neural codec language models standing out.
Hubert: Self-supervised speech representation learning by masked prediction of hidden units
Hsu, W.-N., Bolte, B., Tsai, Y.-H. H., Lakhotia, K., Salakhutdinov, R., and Mohamed, A · 2021
Earlier work this paper cites.
Reinforcement learning for emotional text-to-speech synthesis with improved emotion discriminability, 2021
Liu, R., Sisman, B., and Li, H · 2021
Earlier work this paper cites.
Soundstream: An end-to-end neural audio codec, 2021
Zeghidour, N., Luebs, A., Omran, A., Skoglund, J., and Tagliasacchi, M · 2021
Earlier work this paper cites.
Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022
Bai, Y., Jones, A., Ndousse, K., Askell, A., Chen, A., DasSarma, N., Drain, D., Fort, S., Ganguli, D., Henighan, T., Joseph, N., Kadavath, S., Kernion, J., Conerly, T., El-Showk, S., Elhage, N., Hatfield-Dodds, Z., Hernandez, D., Hume, T., Johnston, S., Kravec, S., Lovitt, L., Nanda, N., Olsson, C., Amodei, D., Brown, T., Clark, J., McCandlish, S., Olah, C., Mann, B., and Kaplan, J · 2022
Earlier work this paper cites.
Audiolm: a language modeling approach to audio generation, 2022
Borsos, Z., Marinier, R., Vincent, D., Kharitonov, E., Pietquin, O., Sharifi, M., Teboul, O., Grangier, D., Tagliasacchi, M., and Zeghidour, N · 2022
Earlier work this paper cites.
High fidelity neural audio compression, 2022
Défossez, A., Copet, J., Synnaeve, G., and Adi, Y · 2022
Earlier work this paper cites.
Training language models to follow instructions with human feedback, 2022
Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P., Leike, J., and Lowe, R · 2022
Earlier work this paper cites.
Robust speech recognition via large-scale weak supervision, 2022
Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I · 2022
Earlier work this paper cites.
Learning to summarize from human feedback, 2022
Stiennon, N., Ouyang, L., Wu, J., Ziegler, D. M., Lowe, R., Voss, C., Radford, A., Amodei, D., and Christiano, P · 2022
Earlier work this paper cites.
Soundstorm: Efficient parallel audio generation, 2023
Borsos, Z., Sharifi, M., Vincent, D., Kharitonov, E., Zeghidour, N., and Tagliasacchi, M · 2023
Earlier work this paper cites.
Aligning text-to-image models using human feedback, 2023
Lee, K., Liu, H., Ryu, M., Watkins, O., Du, Y., Boutilier, C., Abbeel, P., Ghavamzadeh, M., and Gu, S. S · 2023
Cited alongside, same era.
Gpt-4 technical report, 2023
OpenAI · 2023
Cited alongside, same era.
Direct preference optimization: Your language model is secretly a reward model, 2023
Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C. D., and Finn, C · 2023
Cited alongside, same era.
Audiopalm: A large language model that can speak and listen, 2023
Rubenstein, P. K., Asawaroengchai, C., Nguyen, D. D., Bapna, A., Borsos, Z., de Chaumont Quitry, F., Chen, P., Badawy, D. E., Han, W., Kharitonov, E., Muckenhirn, H., Padfield, D., Qin, J., Rozenberg, D., Sainath, T., Schalkwyk, J., Sharifi, M., Ramanovich, M. T., Tagliasacchi, M., Tudor, A., Velimirović, M., Vincent, D., Yu, J., Wang, Y., Zayats, V., Zeghidour, N., Zhang, Y., Zhang, Z., Zilka, L., and Frank, C · 2023
Cited alongside, same era.
Llama: Open and efficient foundation language models
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., Rozière, B., Goyal, N., Hambro, E., Azhar, F., et al · 2023
Self-play fine-tuning converts weak language models to strong language models, 2024
Chen, Z., Deng, Y., Yuan, H., Ji, K., and Gu, Q · 2024
Closest in time.
Musicrl: Aligning music generation to human preferences, 2024
Cideron, G., Girgin, S., Verzetti, M., Vincent, D., Kastelic, M., Borsos, Z., McWilliams, B., Ungureanu, V., Bachem, O., Pietquin, O., Geist, M., Hussenot, L., Zeghidour, N., and Agostinelli, A · 2024
Closest in time.
Groundinggpt:language enhanced multi-modal grounding model, 2024
Li, Z., Xu, Q., Zhang, D., Song, H., Cai, Y., Qi, Q., Zhou, R., Pan, J., Li, Z., Vu, V. T., Huang, Z., and Wang, T · 2024
Closest in time.
Baton: Aligning text-to-audio model with human preference feedback, 2024
Liao, H., Han, H., Yang, K., Du, T., Yang, R., Xu, Z., Xu, Q., Liu, J., Lu, J., and Li, X · 2024
Closest in time.
Inferaligner: Inference-time alignment for harmlessness through cross-model guidance, 2024
Wang, P., Zhang, D., Li, L., Tan, C., Wang, X., Ren, K., Jiang, B., and Qiu, X · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Uniaudio: An audio foundation model toward universal audio generation, 2023
Yang, D., Tian, J., Tan, X., Huang, R., Liu, S., Chang, X., Shi, J., Zhao, S., Bian, J., Wu, X., Zhao, Z., Watanabe, S., and Meng, H · 2023
Cited alongside, same era.
SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities
Zhang, D., Li, S., Zhang, X., Zhan, J., Wang, P., Zhou, Y., and Qiu, X · 2023
Cited alongside, same era.
DUB: Discrete unit back-translation for speech translation
Zhang, D., Ye, R., Ko, T., Wang, M., and Zhou, Y · 2023
Cited alongside, same era.
Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023
Zhu, D., Chen, J., Shen, X., Li, X., and Elhoseiny, M · 2023
Cited alongside, same era.
Pheme: Efficient and conversational speech generation, 2024
Budzianowski, P., Sereda, T., Cichy, T., and Vulić, I · 2024
Cited alongside, same era.
Visual instruction tuning, 2023a
Liu, H., Li, C., Wu, Q., and Lee, Y. J
Cited in the paper.
Chain of hindsight aligns language models with feedback, 2023b
Liu, H., Sferrazza, C., and Abbeel, P
Cited in the paper.
Advancing translation preference modeling with rlhf: A step towards cost-effective solution, 2024
Xu, N., Zhao, J., Zu, C., Li, S., Chen, L., Zhang, Z., Zheng, R., Dou, S., Qin, W., Gui, T., Zhang, Q., and Huang, X · 2024
Closest in time.
Self-play fine-tuning of diffusion models for text-to-image generation, 2024
Yuan, H., Chen, Z., Ji, K., and Gu, Q · 2024
Closest in time.
Anygpt: Unified multimodal llm with discrete sequence modeling, 2024
Zhan, J., Dai, J., Ye, J., Zhou, Y., Zhang, D., Liu, Z., Zhang, X., Yuan, R., Zhang, G., Li, L., Yan, H., Fu, J., Gui, T., Sun, T., Jiang, Y., and Qiu, X · 2024
Closest in time.
Speechgpt-gen: Scaling chain-of-information speech generation, 2024
Zhang, D., Zhang, X., Zhan, J., Li, S., Zhou, Y., and Qiu, X · 2024
Closest in time.