Fetching the paper…
Reading the bibliography…
We present L3Cube-MahaCorpus a Marathi monolingual data set scraped from different internet sources.
How multilingual is multilingual bert?
Telmo Pires, Eva Schlinger, and Dan Garrette. 2019 · 1906
Earlier work this paper cites.
Roberta: A robustly optimized bert pretraining approach
Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, and Veselin Stoyanov. 2019 · 1907
Earlier work this paper cites.
Albert: A lite bert for self-supervised learning of language representations
Zhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel, Piyush Sharma, and Radu Soricut. 2019 · 1909
Earlier work this paper cites.
Huggingface’s transformers: State-of-the-art natural language processing
Thomas Wolf, Lysandre Debut, Victor Sanh, Julien Chaumond, Clement Delangue, Anthony Moi, Pierric Cistac, Tim Rault, Rémi Louf, Morgan Funtowicz, et al. 2019 · 1910
Earlier work this paper cites.
Unsupervised cross-lingual representation learning at scale
Alexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary, Guillaume Wenzek, Francisco Guzmán, Edouard Grave, Myle Ott, Luke Zettlemoyer, and Veselin Stoyanov. 2019 · 1911
Earlier work this paper cites.
Ccnet: Extracting high quality monolingual datasets from web crawl data
Guillaume Wenzek, Marie-Anne Lachaux, Alexis Conneau, Vishrav Chaudhary, Francisco Guzmán, Armand Joulin, and Edouard Grave. 2019 · 1911
Earlier work this paper cites.
Flaubert: Unsupervised language model pre-training for french
Hang Le, Loïc Vial, Jibril Frej, Vincent Segonne, Maximin Coavoux, Benjamin Lecouteux, Alexandre Allauzen, Benoît Crabbé, Laurent Besacier, and Didier Schwab. 2019 · 1912
Earlier work this paper cites.
Robbert: a dutch roberta-based language model
Pieter Delobelle, Thomas Winters, and Bettina Berendt. 2020 · 2001
Earlier work this paper cites.
Phobert: Pre-trained language models for vietnamese
Dat Quoc Nguyen and Anh Tuan Nguyen. 2020 · 2003
Earlier work this paper cites.
inltk: Natural language toolkit for indic languages
Gaurav Arora. 2020 · 2009
Earlier work this paper cites.
Indic-transformers: An analysis of transformer language models for indian languages
Kushal Jain, Adwait Deshpande, Kumar Shridhar, Felix Laumann, and Ayushman Dash. 2020 · 2011
Cited alongside, same era.
Gottbert: a pure german language model
Raphael Scheible, Fabian Thomczyk, Patric Tippmann, Victor Jaravine, and Martin Boeker. 2020 · 2012
Cited alongside, same era.
Enriching word vectors with subword information
Piotr Bojanowski, Edouard Grave, Armand Joulin, and Tomas Mikolov. 2017 · 2017
Cited alongside, same era.
Judicious selection of training data in assisting language for multilingual neural ner
Rudra Murthy, Anoop Kunchukuttan, and Pushpak Bhattacharyya. 2018 · 2018
Cited alongside, same era.
Bert: Pre-training of deep bidirectional transformers for language understanding
Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019 · 2019
Cited alongside, same era.
inlpsuite: Monolingual corpora, evaluation benchmarks and pre-trained multilingual language models for indian languages
Divyanshu Kakwani, Anoop Kunchukuttan, Satish Golla, NC Gokul, Avik Bhattacharyya, Mitesh M Khapra, and Pratyush Kumar. 2020 · 2020
Later among the works it cites.
A survey of the usages of deep learning for natural language processing
Daniel W Otter, Julian R Medina, and Jugal K Kalita. 2020 · 2020
Later among the works it cites.
Pre-trained models for natural language processing: A survey
Xipeng Qiu, Tianxiang Sun, Yige Xu, Yunfan Shao, Ning Dai, and Xuanjing Huang. 2020 · 2020
Later among the works it cites.
Cross-lingual offensive language identification for low resource languages: The case of marathi
Saurabh Sampatrao Gaikwad, Tharindu Ranasinghe, Marcos Zampieri, and Christopher Homan. 2021 · 2021
Later among the works it cites.
Evaluation of deep learning models for hostility detection in hindi text
Ramchandra Joshi, Rushabh Karnavat, Kaustubh Jirapure, and Ravirai Joshi. 2021 · 2021
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Deep learning for hindi text classification: A comparison
Ramchandra Joshi, Purvi Goel, and Raviraj Joshi. 2019 · 2019
Cited alongside, same era.
Multilingual cyberbullying detection system
Rohit Pawar and Rajeev R Raje. 2019 · 2019
Cited alongside, same era.
Language models are unsupervised multitask learners
Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever, et al. 2019 · 2019
Cited alongside, same era.
Asynchronous pipeline for processing huge corpora on medium to low resource infrastructures
Pedro Javier Ortiz Suárez, Benoît Sagot, and Laurent Romary. 2019 · 2019
Cited alongside, same era.
Arbert & marbert: deep bidirectional transformers for arabic
Muhammad Abdul-Mageed, AbdelRahim Elmadany, and El Moatez Billah Nagoudi. 2020 · 2020
Cited alongside, same era.
Experimental evaluation of deep learning models for marathi text classification
Atharva Kulkarni, Meet Mandhane, Manali Likhitkar, Gayatri Kshirsagar, Jayashree Jagdale, and Raviraj Joshi. 2021a
Cited in the paper.
L3cubemahasent: A marathi tweet-based sentiment analysis dataset
Atharva Kulkarni, Meet Mandhane, Manali Likhitkar, Gayatri Kshirsagar, and Raviraj Joshi. 2021b
Cited in the paper.
Thomas Mandl, Sandip Modha, Gautam Kishore Shahi, Hiren Madhu, Shrey Satapara, Prasenjit Majumder, Johannes Schaefer, Tharindu Ranasinghe, Marcos Zampieri, Durgesh Nandini, et al. 2021 · 2021
Later among the works it cites.
Contextual hate speech detection in code mixed text using transformer based approaches
Ravindra Nayak and Raviraj Joshi. 2021 · 2021
Later among the works it cites.
Robeczech: Czech roberta, a monolingual contextualized language representation model
Milan Straka, Jakub Náplava, Jana Straková, and David Samuel. 2021 · 2021
Later among the works it cites.
Hate and offensive speech detection in hindi and marathi
Abhishek Velankar, Hrushikesh Patil, Amol Gore, Shubham Salunke, and Raviraj Joshi. 2021 · 2021
Later among the works it cites.