Fetching the paper…
Reading the bibliography…
Large pretrained masked language models have become state-of-the-art solutions for many NLP problems.
Introduction to the CoNLL-2003 shared task: Language-independent named entity recognition
Erik F. Tjong Kim Sang and Fien De Meulder · 2003
Earlier work this paper cites.
Building the essential resources for Finnish: the Turku dependency treebank
K. Haverinen, J. Nyblom, T. Viljanen, V. Laippala, S. Kohonen, A. Missilä, S. Ojala, T. Salakoski, and F. Ginter · 2013
Earlier work this paper cites.
Nimeüksuste korpus
Sven Laur · 2013
Earlier work this paper cites.
Exploiting similarities among languages for machine translation
Tomas Mikolov, Quoc V Le, and Ilya Sutskever · 2013
Earlier work this paper cites.
A gold standard dependency corpus for English
Natalia Silveira, Timothy Dozat, Marie-Catherine de Marneffe, Samuel Bowman, Miriam Connor, John Bauer, and Christopher D. Manning · 2014
Earlier work this paper cites.
Universal dependencies for Croatian (that work for Serbian, too)
Željko Agić and Nikola Ljubešić · 2015
Earlier work this paper cites.
Universal dependencies for Finnish
Sampo Pyysalo, Jenna Kanerva, Anna Missilä, Veronika Laippala, and Filip Ginter · 2015
Earlier work this paper cites.
New inflectional lexicons and training corpora for improved morphosyntactic annotation of Croatian and Serbian
Nikola Ljubešić, Filip Klubička, Željko Agić, and Ivo-Pavao Jazbec · 2016
Cited alongside, same era.
Estonian Dependency Treebank: from Constraint Grammar tagset to Universal Dependencies
Kadri Muischnek, Kaili Müürisep, and Tiina Puolakainen · 2016
Cited alongside, same era.
The universal dependencies treebank for Slovenian
Kaja Dobrovoljc, Tomaž Erjavec, and Simon Krek · 2017
Cited alongside, same era.
BERT: Pre-training of deep bidirectional transformers for language understanding
Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova · 2018
Cited alongside, same era.
Deep contextualized word representations
Matthew E Peters, Mark Neumann, Mohit Iyyer, Matt Gardner, Christopher Clark, Kenton Lee, and Luke Zettlemoyer · 2018
75 languages, 1 model: Parsing universal dependencies universally
Dan Kondratyuk and Milan Straka · 2019
Later among the works it cites.
Training corpus ssj500k 2.2, 2019
Simon Krek, Kaja Dobrovoljc, Tomaž Erjavec, Sara Može, Nina Ledinek, Nanika Holz, Katja Zupan, Polona Gantar, Taja Kuzman, Jaka Čibej, Špela Arhar Holdt, Teja Kavčič, Iza Škrjanec, Dafne Marko, Lucija Jezeršek, and Anja Zajc · 2019
Later among the works it cites.
CamemBERT: a tasty French language model
Louis Martin, Benjamin Muller, Pedro Javier Ortiz Suárez, Yoann Dupont, Laurent Romary, Éric Villemonte de la Clergerie, Djamé Seddah, and Benoît Sagot · 2019
Later among the works it cites.
Multilingual is not enough: BERT for Finnish
Antti Virtanen, Jenna Kanerva, Rami Ilo, Jouni Luoma, Juhani Luotolahti, Tapio Salakoski, Filip Ginter, and Sampo Pyysalo · 2019
Later among the works it cites.
A Finnish news corpus for named entity recognition
Teemu Ruokolainen, Pekka Kauppinen, Miikka Silfverberg, and Krister Lindén · 2020
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Tensor2tensor for neural machine translation
Ashish Vaswani, Samy Bengio, Eugene Brevdo, Francois Chollet, Aidan Gomez, Stephan Gouws, Llion Jones, Łukasz Kaiser, Nal Kalchbrenner, Niki Parmar, et al · 2018
Cited alongside, same era.
Unsupervised cross-lingual representation learning at scale
Alexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary, Guillaume Wenzek, Francisco Guzmán, Edouard Grave, Myle Ott, Luke Zettlemoyer, and Veselin Stoyanov · 2019
Cited alongside, same era.
Closest in time.
High quality elmo embeddings for seven less-resourced languages
Matej Ulčar and Marko Robnik-Šikonja · 2020
Closest in time.