Fetching the paper…
Reading the bibliography…
Large language models (LLMs) have achieved remarkable success in the field of natural language processing, enabling better human-computer interaction using natural language.
“Listen and translate: A proof of concept for end-to-end speech-to-text translation,”
A. Berard, O. Pietquin, C. Servan, and L. Besacier, · 2016
Earlier work this paper cites.
“Attention is all you need,”
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Lukasz Kaiser, and Illia Polosukhin, · 2017
Earlier work this paper cites.
“Sequence-to-sequence models can directly translate foreign speech,”
Ron J Weiss, Jan Chorowski, Navdeep Jaitly, Yonghui Wu, and Zhifeng Chen, · 2017
Earlier work this paper cites.
“Joint CTC/attention decoding for end-to-end speech recognition,”
Takaaki Hori, Shinji Watanabe, and John Hershey, · 2017
Earlier work this paper cites.
“Decoupled weight decay regularization,”
Ilya Loshchilov and Frank Hutter, · 2017
Earlier work this paper cites.
“End-to-end speech translation with the transformer.,”
Laura Cross Vila, Carlos Escolano, José AR Fonollosa, and Marta R Costa-Jussa, · 2018
Earlier work this paper cites.
“A call for clarity in reporting BLEU scores,”
Matt Post, · 2018
Earlier work this paper cites.
Taku Kudo and John Richardson, · 2018
Earlier work this paper cites.
“Language models are few-shot learners,”
Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al., · 2020
Earlier work this paper cites.
“Speech translation and the end-to-end promise: Taking stock of where we are,”
Matthias Sperber and Matthias Paulik, · 2020
Earlier work this paper cites.
“Covost 2: A massively multilingual speech-to-text translation corpus,” 2020
Changhan Wang, Anne Wu, and Juan Pino, · 2020
Earlier work this paper cites.
“Exploring the limits of transfer learning with a unified text-to-text transformer,”
Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J Liu, · 2020
Earlier work this paper cites.
“Glu variants improve transformer,”
Noam Shazeer, · 2020
Earlier work this paper cites.
“Ctc-based compression for direct speech translation,”
Marco Gaido, Mauro Cettolo, Matteo Negri, and Marco Turchi, · 2021
Earlier work this paper cites.
“Lora: Low-rank adaptation of large language models,”
Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen, · 2021
Cited alongside, same era.
“Roformer: Enhanced transformer with rotary position embedding,”
Jianlin Su, Yu Lu, Shengfeng Pan, Ahmed Murtadha, Bo Wen, and Yunfeng Liu, · 2021
Cited alongside, same era.
“Introducing chatgpt,”
OpenAI, · 2022
Cited alongside, same era.
“Palm: Scaling language modeling with pathways,”
Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts, Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, et al., · 2022
Cited alongside, same era.
“Recent advances in end-to-end automatic speech recognition,”
Jinyu Li, · 2022
Cited alongside, same era.
“Minigpt-4: Enhancing vision-language understanding with advanced large language models,”
Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, and Mohamed Elhoseiny, · 2023
Closest in time.
Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee, · 2023
Closest in time.
“Llama-adapter v2: Parameter-efficient visual instruction model,”
Peng Gao, Jiaming Han, Renrui Zhang, Ziyi Lin, Shijie Geng, Aojun Zhou, Wei Zhang, Pan Lu, Conghui He, Xiangyu Yue, et al., · 2023
Closest in time.
“Viola: Unified codec language models for speech recognition, synthesis, and translation,”
Tianrui Wang, Long Zhou, Ziqiang Zhang, Yu Wu, Shujie Liu, Yashesh Gaur, Zhuo Chen, Jinyu Li, and Furu Wei, · 2023
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Flamingo: a visual language model for few-shot learning,”
Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katherine Millican, Malcolm Reynolds, et al., · 2022
Cited alongside, same era.
“A weakly-supervised streaming multilingual speech model with truly zero-shot capability,”
Jian Xue, Peidong Wang, Jinyu Li, and Eric Sun, · 2022
Cited alongside, same era.
“Large-scale streaming end-to-end speech translation with neural transducers,”
Jian Xue, Peidong Wang, Jinyu Li, Matt Post, and Yashesh Gaur, · 2022
Cited alongside, same era.
OpenAI, · 2023
Cited alongside, same era.
“Llama: Open and efficient foundation language models,”
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al., · 2023
Cited alongside, same era.
“Audiogpt: Understanding and generating speech, music, sound, and talking head,”
Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, et al., · 2023
Cited alongside, same era.
“Hugginggpt: Solving ai tasks with chatgpt and its friends in huggingface,”
Yongliang Shen, Kaitao Song, Xu Tan, Dongsheng Li, Weiming Lu, and Yueting Zhuang, · 2023
Cited alongside, same era.
Dong Zhang, Shimin Li, Xin Zhang, Jun Zhan, Pengyu Wang, Yaqian Zhou, and Xipeng Qiu, · 2023
Closest in time.
“Lms with a voice: Spoken language modeling beyond speech tokens,”
Eliya Nachmani, Alon Levkovitch, Julian Salazar, Chulayutsh Asawaroengchai, Soroosh Mariooryad, RJ Skerry-Ryan, and Michelle Tadmor Ramanovich, · 2023
Closest in time.
“Audiopalm: A large language model that can speak and listen,”
Paul K Rubenstein, Chulayuth Asawaroengchai, Duc Dung Nguyen, Ankur Bapna, Zalán Borsos, Félix de Chaumont Quitry, Peter Chen, Dalia El Badawy, Wei Han, Eugene Kharitonov, et al., · 2023
Closest in time.
“Neural codec language models are zero-shot text to speech synthesizers,”
Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, et al., · 2023
Closest in time.
“Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,”
Ziqiang Zhang, Long Zhou, Chengyi Wang, Sanyuan Chen, Yu Wu, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, Lei He, Sheng Zhao, and Furu Wei, · 2023
Closest in time.
“Decoder-only or encoder-decoder? interpreting language model as a regularized encoder-decoder,”
Zihao Fu, Wai Lam, Qian Yu, Anthony Man-Cho So, Shengding Hu, Zhiyuan Liu, and Nigel Collier, · 2023
Closest in time.
“Lamassu: Streaming language-agnostic multilingual speech recognition and translation using neural transducers,”
Peidong Wang, Eric Sun, Jian Xue, Yu Wu, Long Zhou, Yashesh Gaur, Shujie Liu, and Jinyu Li, · 2023
Closest in time.
“Robust speech recognition via large-scale weak supervision,”
Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever, · 2023
Closest in time.
“Prompting large language models for zero-shot domain adaptation in speech recognition,”
Yuang Li, Yu Wu, Jinyu Li, and Shujie Liu, · 2023
Closest in time.