Bert: Pre-training of deep bidirectional transformers for language understanding
Original
J. Devlin, M.-W. Chang, K. Lee, and K. Toutanova · 2019
Cited alongside, same era.
Cosmos qa: Machine reading comprehension with contextual commonsense reasoning, 2019
L. Huang, R. L. Bras, C. Bhagavatula, and Y. Choi · 2019
Cited alongside, same era.
Qasc: A dataset for question answering via sentence composition, 2019
T. Khot, P. Clark, M. Guerquin, P. Jansen, and A. Sabharwal · 2019
Cited alongside, same era.
Verified uncertainty calibration, 2019
A. Kumar, P. Liang, and T. Ma · 2019
Cited alongside, same era.
Roberta: A robustly optimized bert pretraining approach
Original
Y. Liu, M. Ott, N. Goyal, J. Du, M. Joshi, D. Chen, O. Levy, M. Lewis, L. Zettlemoyer, and V. Stoyanov · 2019
Cited alongside, same era.
Can you trust your model’s uncertainty? Evaluating predictive uncertainty under dataset shift
Y. Ovadia, E. Fertig, J. Ren, Z. Nado, D. Sculley, S. Nowozin, J. V. Dillon, B. Lakshminarayanan, and J. Snoek · 2019
Cited alongside, same era.
Language models as knowledge bases?, 2019
F. Petroni, T. Rocktäschel, P. Lewis, A. Bakhtin, Y. Wu, A. H. Miller, and S. Riedel · 2019
Cited alongside, same era.
Language models are unsupervised multitask learners
A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, and I. Sutskever · 2019
Cited alongside, same era.
Exploring the limits of transfer learning with a unified text-to-text transformer, 2019
C. Raffel, N. Shazeer, A. Roberts, K. Lee, S. Narang, M. Matena, Y. Zhou, W. Li, and P. J. Liu · 2019
Cited alongside, same era.
Superglue: A stickier benchmark for general-purpose language understanding systems, 2019
A. Wang, Y. Pruksachatkun, N. Nangia, A. Singh, J. Michael, F. Hill, O. Levy, and S. R. Bowman · 2019
Cited alongside, same era.
Deep anomaly detection with outlier exposure
D. Hendrycks, M. Mazeika, and T. Dietterich
Cited in the paper.