Multi-path feedback recurrent neural networks for scene parsing
Xiaojie Jin, Yunpeng Chen, Zequn Jie, Jiashi Feng, and Shuicheng Yan · 2017
Cited alongside, same era.
Simple recurrent units for highly parallelizable recurrence
Original
Tao Lei, Yu Zhang, Sida I Wang, Hui Dai, and Yoav Artzi · 2017
Cited alongside, same era.
Regularizing and optimizing lstm language models
Original
Stephen Merity, Nitish Shirish Keskar, and Richard Socher · 2017
Cited alongside, same era.
Get to the point: Summarization with pointer-generator networks
Original
Abigail See, Peter J Liu, and Christopher D Manning · 2017
Cited alongside, same era.
Attention is all you need
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin · 2017
Cited alongside, same era.
The best of both worlds: Combining recent advances in neural machine translation
Original
Mia Xu Chen, Orhan Firat, Ankur Bapna, Melvin Johnson, Wolfgang Macherey, George Foster, Llion Jones, Niki Parmar, Mike Schuster, Zhifeng Chen, et al · 2018
Cited alongside, same era.
Universal transformers
Original
Mostafa Dehghani, Stephan Gouws, Oriol Vinyals, Jakob Uszkoreit, and Łukasz Kaiser · 2018
Cited alongside, same era.
Scaling neural machine translation
Original
Myle Ott, Sergey Edunov, David Grangier, and Michael Auli · 2018
Cited alongside, same era.
Self-attention with relative position representations
Peter Shaw, Jakob Uszkoreit, and Ashish Vaswani · 2018
Cited alongside, same era.
Dense information flow for neural machine translation
Yanyao Shen, Xu Tan, Di He, Tao Qin, and Tie-Yan Liu · 2018
Cited alongside, same era.
The importance of being recurrent for modeling hierarchical structure
Original
Ke Tran, Arianna Bisazza, and Christof Monz · 2018
Cited alongside, same era.
Adaptive input representations for neural language modeling
Alexei Baevski and Michael Auli · 2019
Cited alongside, same era.