Fetching the paper…
Reading the bibliography…
Large language models (LLMs) have convincing performance in a variety of downstream tasks.
Nuanced Metrics for Measuring Unintended Bias with Real Data for Text Classification
Borkan, D.; Dixon, L.; Sorensen, J.; Thain, N.; and Vasserman, L. 2019 · 1903
Earlier work this paper cites.
Twenty Newsgroups
Mitchell, T. 1999 · 1999
Earlier work this paper cites.
Machine-learning applications of algorithmic randomness
Vovk, V.; Gammerman, A.; and Saunders, C. 1999 · 1999
Earlier work this paper cites.
Supervised Contrastive Learning
Khosla, P.; Teterwak, P.; Wang, C.; Sarna, A.; Tian, Y.; Isola, P.; Maschinot, A.; Liu, C.; and Krishnan, D. 2021 · 2004
Earlier work this paper cites.
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Devlin, J.; Chang, M.-W.; Lee, K.; and Toutanova, K. 2019 · 2019
Earlier work this paper cites.
Understanding searches better than ever before
Nayak, P. 2019 · 2019
Earlier work this paper cites.
#MeToo, Time’s Up, and Theories of Justice
Wexler, L.; Robbennolt, J.; and Murphy, C. 2019 · 2019
Earlier work this paper cites.
Language (Technology) is Power: A Critical Survey of “Bias” in NLP
Blodgett, S. L.; Barocas, S.; Daumé III, H.; and Wallach, H. 2020 · 2020
Earlier work this paper cites.
The Curious Case of Neural Text Degeneration
Holtzman, A.; Buys, J.; Du, L.; Forbes, M.; and Choi, Y. 2020 · 2020
Earlier work this paper cites.
Classification with valid and adaptive coverage
Romano, Y.; Sesia, M.; and Candes, E. 2020 · 2020
Earlier work this paper cites.
Uncertainty Sets for Image Classifiers using Conformal Prediction
Angelopoulos, A. N.; Bates, S.; Jordan, M.; and Malik, J. 2021 · 2021
Earlier work this paper cites.
Stereotyping Norwegian Salmon: An Inventory of Pitfalls in Fairness Benchmark Datasets
Blodgett, S. L.; Lopez, G.; Olteanu, A.; Sim, R.; and Wallach, H. 2021 · 2021
Earlier work this paper cites.
Towards Knowledge-Grounded Counter Narrative Generation for Hate Speech
Chung, Y.-L.; Tekiroğlu, S. S.; and Guerini, M. 2021 · 2021
Earlier work this paper cites.
BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation
Dhamala, J.; Sun, T.; Kumar, V.; Krishna, S.; Pruksachatkun, Y.; Chang, K.; and Gupta, R. 2021 · 2021
Earlier work this paper cites.
Latent Hatred: A Benchmark for Understanding Implicit Hate Speech
ElSherief, M.; Ziems, C.; Muchlinski, D.; Anupindi, V.; Seybolt, J.; De Choudhury, M.; and Yang, D. 2021 · 2021
Cited alongside, same era.
Human-in-the-Loop for Data Collection: a Multi-Target Counter Narrative Dataset to Fight Online Hate Speech
Fanton, Margherita and Bonaldi, Helena and Tekiroğlu, Serra Sinem and Guerini, Marco. 2021 · 2021
Cited alongside, same era.
Using Machine Learning to Reduce Toxicity Online
Perspective API. 2021 · 2021
Cited alongside, same era.
Trustworthy Social Bias Measurement
Bommasani, R.; and Liang, P. 2022 · 2022
Cited alongside, same era.
ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection
Hartvigsen, T.; Gabriel, S.; Palangi, H.; Sap, M.; Ray, D.; and Kamar, E. 2022 · 2022
Cited alongside, same era.
Pile of Law: Learning Responsible Data Filtering from the Law and a 256GB Open-Source Legal Dataset
Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
Inan, H.; Upasani, K.; Chi, J.; Rungta, R.; Iyer, K.; Mao, Y.; Tontchev, M.; Hu, Q.; Fuller, B.; Testuggine, D.; and Khabsa, M. 2023 · 2023
Later among the works it cites.
Beyond Denouncing Hate: Strategies for Countering Implied Biases and Stereotypes in Language
Mun, J.; Allaway, E.; Yerukola, A.; Vianna, L.; Leslie, S.-J.; and Sap, M. 2023 · 2023
Later among the works it cites.
NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails
Rebedea, T.; Dinu, R.; Sreedhar, M. N.; Parisien, C.; and Cohen, J. 2023 · 2023
Later among the works it cites.
The Tail Wagging the Dog: Dataset Construction Biases of Social Bias Benchmarks
Selvam, N.; Dev, S.; Khashabi, D.; Khot, T.; and Chang, K.-W. 2023 · 2023
Later among the works it cites.
Llama 2: Open Foundation and Fine-Tuned Chat Models
Touvron, H.; Martin, L.; Stone, K.; Albert, P.; Almahairi, A.; Babaei, Y.; Bashlykov, N.; Batra, S.; Bhargava, P.; Bhosale, S.; Bikel, D.; Blecher, L.; Ferrer, C. C.; Chen, M.; Cucurull, G.; Esiobu, D.; Fernandes, J.; Fu, J.; Fu, W.; Fuller, B.; Gao, C.; Goswami, V.; Goyal, N.; Hartshorn, A.; Hosseini, S.; Hou, R.; Inan, H.; Kardas, M.; Kerkez, V.; Khabsa, M.; Kloumann, I.; Korenev, A.; Koura, P. S.; Lachaux, M.-A.; Lavril, T.; Lee, J.; Liskovich, D.; Lu, Y.; Mao, Y.; Martinet, X.; Mihaylov, T.; Mishra, P.; Molybog, I.; Nie, Y.; Poulton, A.; Reizenstein, J.; Rungta, R.; Saladi, K.; Schelten, A.; Silva, R.; Smith, E. M.; Subramanian, R.; Tan, X. E.; Tang, B.; Taylor, R.; Williams, A.; Kuan, J. X.; Xu, P.; Yan, Z.; Zarov, I.; Zhang, Y.; Fan, A.; Kambadur, M.; Narang, S.; Rodriguez, A.; Stojnic, R.; Edunov, S.; and Scialom, T. 2023 · 2023
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Henderson, P.; Krass, M.; Zheng, L.; Guha, N.; Manning, C. D.; Jurafsky, D.; and Ho, D. 2022 · 2022
Cited alongside, same era.
Handling and Presenting Harmful Text in NLP Research
Kirk, H.; Birhane, A.; Vidgen, B.; and Derczynski, L. 2022 · 2022
Cited alongside, same era.
ChatGPT: Optimizing Language Models for Dialogue
OpenAI. 2022 · 2022
Cited alongside, same era.
BBQ: A hand-built bias benchmark for question answering
Parrish, A.; Chen, A.; Nangia, N.; Padmakumar, V.; Phang, J.; Thompson, J.; Htut, P. M.; and Bowman, S. 2022 · 2022
Cited alongside, same era.
“I’m sorry to hear that”: Finding New Biases in Language Models with a Holistic Descriptor Dataset
Smith, E. M.; Hall, M.; Kambadur, M.; Presani, E.; and Williams, A. 2022 · 2022
Cited alongside, same era.
Social bias, discrimination and inequity in healthcare: mechanisms, implications and recommendations
Webster, C. S.; Taylor, S.; Thomas, C.; and Weller, J. M. 2022 · 2022
Cited alongside, same era.
Identifying Implicitly Abusive Remarks about Identity Groups using a Linguistically Informed Approach
Wiegand, M.; Eder, E.; and Ruppenhofer, J. 2022 · 2022
Cited alongside, same era.
Later among the works it cites.
Neural Architecture Search for Effective Teacher-Student Knowledge Transfer in Language Models
Trivedi, A.; Udagawa, T.; Merler, M.; Panda, R.; El-Kurdi, Y.; and Bhattacharjee, B. 2023 · 2023
Later among the works it cites.
Detectors for Safe and Reliable LLMs: Implementations, Uses, and Limitations
Achintalwar, S.; Garcia, A. A.; Anaby-Tavor, A.; Baldini, I.; Berger, S. E.; Bhattacharjee, B.; Bouneffouf, D.; Chaudhury, S.; Chen, P.-Y.; Chiazor, L.; Daly, E. M.; de Paula, R. A.; Dognin, P.; Farchi, E.; Ghosh, S.; Hind, M.; Horesh, R.; Kour, G.; Lee, J. Y.; Miehling, E.; Murugesan, K.; Nagireddy, M.; Padhi, I.; Piorkowski, D.; Rawat, A.; Raz, O.; Sattigeri, P.; Strobelt, H.; Swaminathan, S.; Tillmann, C.; Trivedi, A.; Varshney, K. R.; Wei, D.; Witherspooon, S.; and Zalmanovici, M. 2024 · 2024
Closest in time.
Gligoric, K.; Cheng, M.; Zheng, L.; Durmus, E.; and Jurafsky, D. 2024 · 2024
Closest in time.
A Multi-Aspect Framework for Counter Narrative Evaluation using Large Language Models
Jones, J.; Mo, L.; Fosler-Lussier, E.; and Sun, H. 2024 · 2024
Closest in time.
Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models
Li, H.; Dong, Q.; Tang, Z.; Wang, C.; Zhang, X.; Huang, H.; Huang, S.; Huang, X.; Huang, Z.; Zhang, D.; Gu, Y.; Cheng, X.; Wang, X.; Chen, S.-Q.; Dong, L.; Lu, W.; Sui, Z.; Wang, B.; Lam, W.; and Wei, F. 2024 · 2024
Closest in time.
Counterspeakers’ Perspectives: Unveiling Barriers and AI Needs in the Fight against Online Hate
Mun, J.; Buerger, C.; Liang, J. T.; Garland, J.; and Sap, M. 2024 · 2024
Closest in time.
SocialStigmaQA: A Benchmark to Uncover Stigma Amplification in Generative Language Models
Nagireddy, M.; Chiazor, L.; Singh, M.; and Baldini, I. 2024 · 2024
Closest in time.
GPT-4 Technical Report
OpenAI; Achiam, J.; Adler, S.; Agarwal, S.; Ahmad, L.; Akkaya, I.; Aleman, F. L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; Avila, R.; Babuschkin, I.; Balaji, S.; Balcom, V.; Baltescu, P.; Bao, H.; Bavarian, M.; Belgum, J.; Bello, I.; Berdine, J.; Bernadett-Shapiro, G.; Berner, C.; Bogdonoff, L.; Boiko, O.; Boyd, M.; Brakman, A.-L.; Brockman, G.; Brooks, T.; Brundage, M.; Button, K.; Cai, T.; Campbell, R.; Cann, A.; Carey, B.; Carlson, C.; Carmichael, R.; Chan, B.; Chang, C.; Chantzis, F.; Chen, D.; Chen, S.; Chen, R.; Chen, J.; Chen, M.; Chess, B.; Cho, C.; Chu, C.; Chung, H. W.; Cummings, D.; Currier, J.; Dai, Y.; Decareaux, C.; Degry, T.; Deutsch, N.; Deville, D.; Dhar, A.; Dohan, D.; Dowling, S.; Dunning, S.; Ecoffet, A.; Eleti, A.; Eloundou, T.; Farhi, D.; Fedus, L.; Felix, N.; Fishman, S. P.; Forte, J.; Fulford, I.; Gao, L.; Georges, E.; Gibson, C.; Goel, V.; Gogineni, T.; Goh, G.; Gontijo-Lopes, R.; Gordon, J.; Grafstein, M.; Gray, S.; Greene, R.; Gross, J.; Gu, S. S.; Guo, Y.; Hallacy, C.; Han, J.; Harris, J.; He, Y.; Heaton, M.; Heidecke, J.; Hesse, C.; Hickey, A.; Hickey, W.; Hoeschele, P.; Houghton, B.; Hsu, K.; Hu, S.; Hu, X.; Huizinga, J.; Jain, S.; Jain, S.; Jang, J.; Jiang, A.; Jiang, R.; Jin, H.; Jin, D.; Jomoto, S.; Jonn, B.; Jun, H.; Kaftan, T.; Łukasz Kaiser; Kamali, A.; Kanitscheider, I.; Keskar, N. S.; Khan, T.; Kilpatrick, L.; Kim, J. W.; Kim, C.; Kim, Y.; Kirchner, J. H.; Kiros, J.; Knight, M.; Kokotajlo, D.; Łukasz Kondraciuk; Kondrich, A.; Konstantinidis, A.; Kosic, K.; Krueger, G.; Kuo, V.; Lampe, M.; Lan, I.; Lee, T.; Leike, J.; Leung, J.; Levy, D.; Li, C. M.; Lim, R.; Lin, M.; Lin, S.; Litwin, M.; Lopez, T.; Lowe, R.; Lue, P.; Makanju, A.; Malfacini, K.; Manning, S.; Markov, T.; Markovski, Y.; Martin, B.; Mayer, K.; Mayne, A.; McGrew, B.; McKinney, S. M.; McLeavey, C.; McMillan, P.; McNeil, J.; Medina, D.; Mehta, A.; Menick, J.; Metz, L.; Mishchenko, A.; Mishkin, P.; Monaco, V.; Morikawa, E.; Mossing, D.; Mu, T.; Murati, M.; Murk, O.; Mély, D.; Nair, A.; Nakano, R.; Nayak, R.; Neelakantan, A.; Ngo, R.; Noh, H.; Ouyang, L.; O’Keefe, C.; Pachocki, J.; Paino, A.; Palermo, J.; Pantuliano, A.; Parascandolo, G.; Parish, J.; Parparita, E.; Passos, A.; Pavlov, M.; Peng, A.; Perelman, A.; de Avila Belbute Peres, F.; Petrov, M.; de Oliveira Pinto, H. P.; Michael; Pokorny; Pokrass, M.; Pong, V. H.; Powell, T.; Power, A.; Power, B.; Proehl, E.; Puri, R.; Radford, A.; Rae, J.; Ramesh, A.; Raymond, C.; Real, F.; Rimbach, K.; Ross, C.; Rotsted, B.; Roussez, H.; Ryder, N.; Saltarelli, M.; Sanders, T.; Santurkar, S.; Sastry, G.; Schmidt, H.; Schnurr, D.; Schulman, J.; Selsam, D.; Sheppard, K.; Sherbakov, T.; Shieh, J.; Shoker, S.; Shyam, P.; Sidor, S.; Sigler, E.; Simens, M.; Sitkin, J.; Slama, K.; Sohl, I.; Sokolowsky, B.; Song, Y.; Staudacher, N.; Such, F. P.; Summers, N.; Sutskever, I.; Tang, J.; Tezak, N.; Thompson, M. B.; Tillet, P.; Tootoonchian, A.; Tseng, E.; Tuggle, P.; Turley, N.; Tworek, J.; Uribe, J. F. C.; Vallone, A.; Vijayvergiya, A.; Voss, C.; Wainwright, C.; Wang, J. J.; Wang, A.; Wang, B.; Ward, J.; Wei, J.; Weinmann, C.; Welihinda, A.; Welinder, P.; Weng, J.; Weng, L.; Wiethoff, M.; Willner, D.; Winter, C.; Wolrich, S.; Wong, H.; Workman, L.; Wu, S.; Wu, J.; Wu, M.; Xiao, K.; Xu, T.; Yoo, S.; Yu, K.; Yuan, Q.; Zaremba, W.; Zellers, R.; Zhang, C.; Zhang, M.; Zhao, S.; Zheng, T.; Zhuang, J.; Zhuk, W.; and Zoph, B. 2024 · 2024
Closest in time.
LAB: Large-Scale Alignment for ChatBots
Sudalairaj, S.; Bhandwaldar, A.; Pareja, A.; Xu, K.; Cox, D. D.; and Srivastava, A. 2024 · 2024
Closest in time.