Fetching the paper…
Reading the bibliography…
The audio-video based multimodal emotion recognition has attracted a lot of attention due to its robust performance.
“Adam: A method for stochastic optimization,”
Diederik P Kingma and Jimmy Ba, · 2014
Earlier work this paper cites.
“Moddrop: adaptive multi-modal gesture recognition,”
Natalia Neverova, Christian Wolf, Graham Taylor, and Florian Nebout, · 2015
Earlier work this paper cites.
“Speech emotion recognition with acoustic and lexical features,”
Qin Jin, Chengxin Li, Shizhe Chen, and Huimin Wu, · 2015
Earlier work this paper cites.
“Multimodal compact bilinear pooling for visual question answering and visual grounding,”
Akira Fukui, Dong Huk Park, Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach, · 2016
Earlier work this paper cites.
“Learning affective features with a hybrid deep model for audio–visual emotion recognition,”
Shiqing Zhang, Shiliang Zhang, Tiejun Huang, Wen Gao, and Qi Tian, · 2017
Earlier work this paper cites.
“Attention is all you need,”
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin, · 2017
Earlier work this paper cites.
“Aggregated residual transformations for deep neural networks,”
Saining Xie, Ross Girshick, Piotr Dollár, Zhuowen Tu, and Kaiming He, · 2017
Earlier work this paper cites.
“Multi-modal emotion recognition on iemocap dataset using deep learning,”
Samarth Tripathi, Sarthak Tripathi, and Homayoon Beigi, · 2018
Earlier work this paper cites.
“The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,”
Steven R Livingstone and Frank A Russo, · 2018
Earlier work this paper cites.
“Learn to combine modalities in multimodal deep learning,”
Kuan Liu, Yanen Li, Ning Xu, and Prem Natarajan, · 2018
Cited alongside, same era.
“Deep fusion: An attention guided factorized bilinear pooling for audio-video emotion recognition,”
Yuanyuan Zhang, Zi-Rui Wang, and Jun Du, · 2019
Cited alongside, same era.
“Exploring emotion features and fusion strategies for audio-video emotion recognition,”
Hengshun Zhou, Debin Meng, Yuanyuan Zhang, Xiaojiang Peng, Jun Du, Kai Wang, and Yu Qiao, · 2019
Cited alongside, same era.
“Multimodal fusion with deep neural networks for audio-video emotion recognition,”
Juan DS Ortega, Mohammed Senoussaoui, Eric Granger, Marco Pedersoli, Patrick Cardinal, and Alessandro L Koerich, · 2019
Cited alongside, same era.
“A generalized zero-shot framework for emotion recognition from body gestures,”
“Mmtm: Multimodal transfer module for cnn fusion,”
Hamid Reza Vaezi Joze, Amirreza Shaban, Michael L Iuzzolino, and Kazuhito Koishida, · 2020
Later among the works it cites.
“Msaf: Multimodal split attention fusion,”
Lang Su, Chuqing Hu, Guofa Li, and Dongpu Cao, · 2020
Later among the works it cites.
“Multimodal end-to-end sparse model for emotion recognition,”
Wenliang Dai, Samuel Cahyawijaya, Zihan Liu, and Pascale Fung, · 2021
Closest in time.
“Hierarchical network based on the fusion of static and dynamic features for speech emotion recognition,”
Qi Cao, Mixiao Hou, Bingzhi Chen, Zheng Zhang, and Guangming Lu, · 2021
Closest in time.
“Multi-branch deep radial basis function networks for facial emotion recognition,”
Fernanda Hernández-Luquin and Hugo Jair Escalante, · 2021
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Jinting Wu, Yujia Zhang, Xiaoguang Zhao, and Wenbin Gao, · 2020
Cited alongside, same era.
“Transformer based deep intelligent contextual embedding for twitter sentiment analysis,”
Usman Naseem, Imran Razzak, Katarzyna Musial, and Muhammad Imran, · 2020
Cited alongside, same era.
“Multitask learning and multistage fusion for dimensional audiovisual emotion recognition,”
Bagus Tris Atmaja and Masato Akagi, · 2020
Cited alongside, same era.
“Multimodal transformer fusion for continuous emotion recognition,”
Jian Huang, Jianhua Tao, Bin Liu, Zheng Lian, and Mingyue Niu, · 2020
Cited alongside, same era.
“Speech emotion recognition with dual-sequence lstm architecture,”
Jianyou Wang, Michael Xue, Ryan Culhane, Enmao Diao, Jie Ding, and Vahid Tarokh, · 2020
Cited alongside, same era.
“Multimodal emotion recognition with capsule graph convolutional based representation fusion,”
Jiaxing Liu, Sen Chen, Longbiao Wang, Zhilei Liu, Yahui Fu, Lili Guo, and Jianwu Dang, · 2021
Closest in time.
“Multimodal cross-and self-attention network for speech emotion recognition,”
Licai Sun, Bin Liu, Jianhua Tao, and Zheng Lian, · 2021
Closest in time.
“Eranns: Efficient residual audio neural networks for audio pattern recognition,”
Sergey Verbitskiy and Viacheslav Vyshegorodtsev, · 2021
Closest in time.