“XLNet: Generalized Autoregressive Pretraining for Language Understanding” arXiv: 1906.08237
Original
Zhilin Yang et al · 1906
Earlier work this paper cites.
“RoBERTa: A Robustly Optimized BERT Pretraining Approach” arXiv: 1907.11692
Original
Yinhan Liu et al · 1907
Earlier work this paper cites.
“Evaluating Contextualized Embeddings on 54 Languages in POS Tagging, Lemmatization and Dependency Parsing” arXiv: 1908.07448
Original
Milan Straka, Jana Straková and Jan Hajič · 1908
Earlier work this paper cites.
“ALBERT: A Lite BERT for Self-supervised Learning of Language Representations”, 2020
Original
Zhenzhong Lan et al · 1909
Earlier work this paper cites.
“MLQA: Evaluating Cross-lingual Extractive Question Answering” arXiv: 1910.07475
Original
Patrick Lewis et al · 1910
Earlier work this paper cites.
“On the Cross-lingual Transferability of Monolingual Representations” arXiv: 1910.11856
Original
Mikel Artetxe, Sebastian Ruder and Dani Yogatama · 1910
Earlier work this paper cites.
“HuggingFace’s Transformers: State-of-the-art Natural Language Processing”
Thomas Wolf et al · 1910
Earlier work this paper cites.
“Long Short-Term Memory”
Sepp Hochreiter and Jürgen Schmidhuber · 1997
Earlier work this paper cites.
“A matter of typology: Alphasyllabaries and abugidas”
William Bright · 1999
Earlier work this paper cites.
“The Prague Dependency Treebank: Annotation Structure and Support.”, 2001, pp. 105–114
Jan Hajič, Barbora Hladka and Petr Pajas · 2001
Earlier work this paper cites.
“ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators”, 2020
Original
Kevin Clark, Minh-Thang Luong, Quoc. Le and Christopher. Manning · 2003
Earlier work this paper cites.
“The dravidian languages”
Bhadriraju Krishnamurti · 2003
Earlier work this paper cites.
“Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection”, 2020
Original
Joakim Nivre et al · 2004
Earlier work this paper cites.
“Byte Pair Encoding is Suboptimal for Language Model Pretraining”, 2020
Original
Kaj Bostrom and Greg Durrett · 2004
Earlier work this paper cites.
“Are All Languages Created Equal in Multilingual BERT?” arXiv: 2005.09093
Original
Shijie Wu and Mark Dredze · 2005
Earlier work this paper cites.
“Hindi POS Tagger Using Naive Stemming : Harnessing Morphological Information Without Extensive Linguistic Knowledge”, 2008
Manish Shrivastava and P. Bhattacharyya · 2008
Earlier work this paper cites.
“Modern Hindi Grammar”
Omkar Koul · 2008
Earlier work this paper cites.