When and why are log-linear models self-normalizing?
Andreas, Jacob and Klein, Dan · 2015
Later among the works it cites.
Blackout: Speeding up recurrent neural network language models with very large vocabularies
Original
Ji, Shihao, Vishwanathan, S. V. N., Satish, Nadathur, Anderson, Michael J., and Dubey, Pradeep · 2015
Later among the works it cites.
Imagenet large scale visual recognition challenge
Russakovsky, Olga, Deng, Jia, Su, Hao, Krause, Jonathan, Satheesh, Sanjeev, Ma, Sean, Huang, Zhiheng, Karpathy, Andrej, Khosla, Aditya, Bernstein, Michael S., Berg, Alexander C., and Li, Fei-Fei · 2015
Later among the works it cites.
Tensorflow: A system for large-scale machine learning
Original
Abadi, Martín, Agarwal, Ashish, Barham, Paul, Brevdo, Eugene, Chen, Zhifeng, Citro, Craig, Corrado, Gregory S., Davis, Andy, Dean, Jeffrey, Devin, Matthieu, Ghemawat, Sanjay, Goodfellow, Ian J., Harp, Andrew, Irving, Geoffrey, Isard, Michael, Jia, Yangqing, Józefowicz, Rafal, Kaiser, Lukasz, Kudlur, Manjunath, Levenberg, Josh, Mané, Dan, Monga, Rajat, Moore, Sherry, Murray, Derek Gordon, Olah, Chris, Schuster, Mike, Shlens, Jonathon, Steiner, Benoit, Sutskever, Ilya, Talwar, Kunal, Tucker, Paul A., Vanhoucke, Vincent, Vasudevan, Vijay, Viégas, Fernanda B., Vinyals, Oriol, Warden, Pete, Wattenberg, Martin, Wicke, Martin, Yu, Yuan, and Zheng, Xiaoqiang · 2016
Later among the works it cites.
Strategies for training large vocabulary neural language models
Chen, Wenlin, Grangier, David, and Auli, Michael · 2016
Later among the works it cites.
Efficient softmax approximation for gpus
Original
Grave, Edouard, Joulin, Armand, Cissé, Moustapha, Grangier, David, and Jégou, Hervé · 2016
Later among the works it cites.
Exploring the limits of language modeling
Original
Józefowicz, Rafal, Vinyals, Oriol, Schuster, Mike, Shazeer, Noam, and Wu, Yonghui · 2016
Later among the works it cites.