Fetching the paper…
Reading the bibliography…
We test the hypothesis that language models trained with reinforcement learning from human feedback (RLHF) have the capability to "morally self-correct" -- to avoid producing harmful outputs -- if instructed to do so.
Evaluating the Underlying Gender Bias in Contextualized Word Embeddings
C. Basta, M. R. Costa-jussà, and N. Casas · 1904
Earlier work this paper cites.
Measuring Bias in Contextualized Word Representations
K. Kurita, N. Vyas, A. Pareek, A. W. Black, and Y. Tsvetkov · 1906
Earlier work this paper cites.
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
C. Raffel, N. Shazeer, A. Roberts, K. Lee, S. Narang, M. Matena, Y. Zhou, W. Li, and P. J. Liu · 1910
Earlier work this paper cites.
Social Bias Frames: Reasoning about Social and Power Implications of Language
M. Sap, S. Gabriel, L. Qin, D. Jurafsky, N. A. Smith, and Y. Choi · 1911
Earlier work this paper cites.
LSAC National Longitudinal Bar Passage Study. LSAC Research Report Series
L. F. Wightman · 1998
Earlier work this paper cites.
Scaling Laws for Neural Language Models
J. Kaplan, S. McCandlish, T. Henighan, T. B. Brown, B. Chess, R. Child, S. Gray, A. Radford, J. Wu, and D. Amodei · 2001
Earlier work this paper cites.
Learning to summarize from human feedback
N. Stiennon, L. Ouyang, J. Wu, D. M. Ziegler, R. Lowe, C. Voss, A. Radford, D. Amodei, and P. Christiano · 2009
Earlier work this paper cites.
Fairness Through Awareness, 2011
C. Dwork, M. Hardt, T. Pitassi, O. Reingold, and R. Zemel · 2011
Earlier work this paper cites.
What is a Stereotype? What is Stereotyping?
E. Beeghly · 2015
Earlier work this paper cites.
The Concept of Discrimination
B. Eidelson · 2015
Earlier work this paper cites.
The Social Impact of Natural Language Processing
D. Hovy and S. L. Spruit · 2016
Earlier work this paper cites.
SQuAD: 100,000+ Questions for Machine Comprehension of Text
P. Rajpurkar, J. Zhang, K. Lopyrev, and P. Liang · 2016
Earlier work this paper cites.
Deep Reinforcement Learning from Human Preferences
P. F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, and D. Amodei · 2017
Earlier work this paper cites.
Counterfactual Fairness
M. J. Kusner, J. Loftus, C. Russell, and R. Silva · 2017
Earlier work this paper cites.
Gender Bias in Coreference Resolution
R. Rudinger, J. Naradowsky, B. Leonard, and B. V. Durme · 2018
Earlier work this paper cites.
Gender Bias in Coreference Resolution: Evaluation and Debiasing Methods
J. Zhao, T. Wang, M. Yatskar, V. Ordonez, and K.-W. Chang · 2018
Earlier work this paper cites.
Fairness and Machine Learning: Limitations and Opportunities
S. Barocas, M. Hardt, and A. Narayanan · 2019
Earlier work this paper cites.
Reducing Sentiment Bias in Language Models via Counterfactual Evaluation, 2019
P.-S. Huang, H. Zhang, R. Jiang, R. Stanforth, J. Welbl, J. Rae, V. Maini, D. Yogatama, and P. Kohli · 2019
Earlier work this paper cites.
RoBERTa: A Robustly Optimized BERT Pretraining Approach, 2019
Y. Liu, M. Ott, N. Goyal, J. Du, M. Joshi, D. Chen, O. Levy, M. Lewis, L. Zettlemoyer, and V. Stoyanov · 2019
Earlier work this paper cites.
Language Models are Unsupervised Multitask Learners
A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, and I. Sutskever · 2019
Earlier work this paper cites.
Language (Technology) is Power: A Critical Survey of “Bias” in NLP
S. L. Blodgett, S. Barocas, H. Daumé III, and H. Wallach · 2020
Earlier work this paper cites.
Language Models are Few-Shot Learners
T. Brown, B. Mann, N. Ryder, M. Subbiah, J. D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, S. Agarwal, A. Herbert-Voss, G. Krueger, T. Henighan, R. Child, A. Ramesh, D. Ziegler, J. Wu, C. Winter, C. Hesse, M. Chen, E. Sigler, M. Litwin, S. Gray, B. Chess, J. Clark, C. Berner, S. McCandlish, A. Radford, I. Sutskever, and D. Amodei · 2020
Cited alongside, same era.
Counterfactual Risk Assessments, Evaluation, and Fairness
A. Coston, A. Mishler, E. H. Kennedy, and A. Chouldechova · 2020
Cited alongside, same era.
RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models
S. Gehman, S. Gururangan, M. Sap, Y. Choi, and N. A. Smith · 2020
Cited alongside, same era.
Social Biases in NLP Models as Barriers for Persons with Disabilities
B. Hutchinson, V. Prabhakaran, E. Denton, K. Webster, Y. Zhong, and S. Denuyl · 2020
Cited alongside, same era.
Give Me Convenience and Give Her Death: Who Should Decide What Uses of NLP are Appropriate, and on What Basis?
K. Leins, J. H. Lau, and T. Baldwin · 2020
Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback, Apr. 2022
Y. Bai, A. Jones, K. Ndousse, A. Askell, A. Chen, N. DasSarma, D. Drain, S. Fort, D. Ganguli, T. Henighan, N. Joseph, S. Kadavath, J. Kernion, T. Conerly, S. El-Showk, N. Elhage, Z. Hatfield-Dodds, D. Hernandez, T. Hume, S. Johnston, S. Kravec, L. Lovitt, N. Nanda, C. Olsson, D. Amodei, T. Brown, J. Clark, S. McCandlish, C. Olah, B. Mann, and J. Kaplan · 2022
Later among the works it cites.
Constitutional AI: Harmlessness from AI Feedback, 2022
Y. Bai, S. Kadavath, S. Kundu, A. Askell, J. Kernion, A. Jones, A. Chen, A. Goldie, A. Mirhoseini, C. McKinnon, C. Chen, C. Olsson, C. Olah, D. Hernandez, D. Drain, D. Ganguli, D. Li, E. Tran-Johnson, E. Perez, J. Kerr, J. Mueller, J. Ladish, J. Landau, K. Ndousse, K. Lukosuite, L. Lovitt, M. Sellitto, N. Elhage, N. Schiefer, N. Mercado, N. DasSarma, R. Lasenby, R. Larson, S. Ringer, S. Johnston, S. Kravec, S. E. Showk, S. Fort, T. Lanham, T. Telleen-Lawton, T. Conerly, T. Henighan, T. Hume, S. R. Bowman, Z. Hatfield-Dodds, B. Mann, D. Amodei, N. Joseph, S. McCandlish, T. Brown, and J. Kaplan · 2022
Later among the works it cites.
Predictability and Surprise in Large Generative Models
D. Ganguli, D. Hernandez, L. Lovitt, N. DasSarma, T. Henighan, A. Jones, N. Joseph, J. Kernion, B. Mann, A. Askell, Y. Bai, A. Chen, T. Conerly, D. Drain, N. Elhage, S. E. Showk, S. Fort, Z. Hatfield-Dodds, S. Johnston, S. Kravec, N. Nanda, K. Ndousse, C. Olsson, D. Amodei, D. Amodei, T. Brown, J. Kaplan, S. McCandlish, C. Olah, and J. Clark · 2022
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
UNQOVERing Stereotyping Biases via Underspecified Questions
T. Li, D. Khashabi, T. Khot, A. Sabharwal, and V. Srikumar · 2020
Cited alongside, same era.
CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models
N. Nangia, C. Vania, R. Bhalerao, and S. R. Bowman · 2020
Cited alongside, same era.
Large language models associate Muslims with violence
A. Abid, M. Farooqi, and J. Zou · 2021
Cited alongside, same era.
A General Language Assistant as a Laboratory for Alignment
A. Askell, Y. Bai, A. Chen, D. Drain, D. Ganguli, T. Henighan, A. Jones, N. Joseph, B. Mann, N. DasSarma, N. Elhage, Z. Hatfield-Dodds, D. Hernandez, J. Kernion, K. Ndousse, C. Olsson, D. Amodei, T. Brown, J. Clark, S. McCandlish, C. Olah, and J. Kaplan · 2021
Cited alongside, same era.
On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?
E. M. Bender, T. Gebru, A. McMillan-Major, and S. Shmitchell · 2021
Cited alongside, same era.
Stereotyping Norwegian Salmon: An Inventory of Pitfalls in Fairness Benchmark Datasets
S. L. Blodgett, G. Lopez, A. Olteanu, R. Sim, and H. Wallach · 2021
Cited alongside, same era.
Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling
E. Dinan, G. Abercrombie, A. S. Bergman, S. Spruit, D. Hovy, Y.-L. Boureau, and V. Rieser · 2021
Cited alongside, same era.
Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned, 2022
D. Ganguli, L. Lovitt, J. Kernion, A. Askell, Y. Bai, S. Kadavath, B. Mann, E. Perez, N. Schiefer, K. Ndousse, A. Jones, S. Bowman, A. Chen, T. Conerly, N. DasSarma, D. Drain, N. Elhage, S. El-Showk, S. Fort, Z. Hatfield-Dodds, T. Henighan, D. Hernandez, T. Hume, J. Jacobson, S. Johnston, S. Kravec, C. Olsson, S. Ringer, E. Tran-Johnson, D. Amodei, T. Brown, N. Joseph, S. McCandlish, C. Olah, J. Kaplan, and J. Clark · 2022
Later among the works it cites.
Improving alignment of dialogue agents via targeted human judgements, 2022
A. Glaese, N. McAleese, M. Trębacz, J. Aslanides, V. Firoiu, T. Ewalds, M. Rauh, L. Weidinger, M. Chadwick, P. Thacker, L. Campbell-Gillingham, J. Uesato, P.-S. Huang, R. Comanescu, F. Yang, A. See, S. Dathathri, R. Greig, C. Chen, D. Fritz, J. S. Elias, R. Green, S. Mokrá, N. Fernando, B. Wu, R. Foley, S. Young, I. Gabriel, W. Isaac, J. Mellor, D. Hassabis, K. Kavukcuoglu, L. A. Hendricks, and G. Irving · 2022
Later among the works it cites.
Race-Aware Algorithms: Fairness, Nondiscrimination and Affirmative Action
P. Kim · 2022
Later among the works it cites.
Large Language Models are Zero-Shot Reasoners
T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, and Y. Iwasawa · 2022
Later among the works it cites.
Holistic Evaluation of Language Models, 2022
P. Liang, R. Bommasani, T. Lee, D. Tsipras, D. Soylu, M. Yasunaga, Y. Zhang, D. Narayanan, Y. Wu, A. Kumar, B. Newman, B. Yuan, B. Yan, C. Zhang, C. Cosgrove, C. D. Manning, C. Ré, D. Acosta-Navas, D. A. Hudson, E. Zelikman, E. Durmus, F. Ladhak, F. Rong, H. Ren, H. Yao, J. Wang, K. Santhanam, L. Orr, L. Zheng, M. Yuksekgonul, M. Suzgun, N. Kim, N. Guha, N. Chatterji, O. Khattab, P. Henderson, Q. Huang, R. Chi, S. M. Xie, S. Santurkar, S. Ganguli, T. Hashimoto, T. Icard, T. Zhang, V. Chaudhary, W. Wang, X. Li, Y. Mai, Y. Zhang, and Y. Koreeda · 2022
Later among the works it cites.
Artificial Intelligence Act: Council calls for promoting safe AI that respects fundamental rights, Dec. 2022
D. Mammonas · 2022
Later among the works it cites.
BBQ: A hand-built bias benchmark for question answering
A. Parrish, A. Chen, N. Nangia, V. Padmakumar, J. Phang, J. Thompson, P. M. Htut, and S. Bowman · 2022
Later among the works it cites.
Discovering Language Model Behaviors with Model-Written Evaluations, 2022
E. Perez, S. Ringer, K. Lukošiūtė, K. Nguyen, E. Chen, S. Heiner, C. Pettit, C. Olsson, S. Kundu, S. Kadavath, A. Jones, A. Chen, B. Mann, B. Israel, B. Seethor, C. McKinnon, C. Olah, D. Yan, D. Amodei, D. Amodei, D. Drain, D. Li, E. Tran-Johnson, G. Khundadze, J. Kernion, J. Landis, J. Kerr, J. Mueller, J. Hyun, J. Landau, K. Ndousse, L. Goldberg, L. Lovitt, M. Lucas, M. Sellitto, M. Zhang, N. Kingsland, N. Elhage, N. Joseph, N. Mercado, N. DasSarma, O. Rausch, R. Larson, S. McCandlish, S. Johnston, S. Kravec, S. E. Showk, T. Lanham, T. Telleen-Lawton, T. Brown, T. Henighan, T. Hume, Y. Bai, Z. Hatfield-Dodds, J. Clark, S. R. Bowman, A. Askell, R. Grosse, D. Hernandez, D. Ganguli, E. Hubinger, N. Schiefer, and J. Kaplan · 2022
Later among the works it cites.
Characteristics of Harmful Text: Towards Rigorous Benchmarking of Language Models
M. Rauh, J. F. J. Mellor, J. Uesato, P.-S. Huang, J. Welbl, L. Weidinger, S. Dathathri, A. Glaese, G. Irving, I. Gabriel, W. Isaac, and L. A. Hendricks · 2022
Later among the works it cites.
Counterfactual Fairness Is Basically Demographic Parity, 2022
L. Rosenblatt and R. T. Witter · 2022
Later among the works it cites.
ChatGPT: Optimizing Language Models for Dialogue, Nov. 2022
J. Schulman, B. Zoph, C. Kim, J. Hilton, J. Menick, J. Weng, J. F. Ceron Uribe, L. Fedus, L. Metz, M. Pokorny, R. Gontijo Lopes, S. Zhao, A. Vijayvergiya, E. Sigler, A. Perelman, C. Voss, M. Heaton, J. Parish, D. Cummings, R. Nayak, V. Balcom, D. Schnurr, T. Kaftan, C. Hallacy, N. Turley, N. Deutsch, V. Goel, J. Ward, A. Konstantinidis, W. Zaremba, L. Ouyang, L. Bogdonoff, J. Gross, D. Medina, S. Yoo, T. Lee, R. Lowe, D. Mossing, J. Huizinga, R. Jiang, C. Wainwright, D. Almeida, S. Lin, M. Zhang, K. Xiao, K. Slama, S. Bills, A. Gray, J. Leike, J. Pachocki, P. Tillet, S. Jain, G. Brockman, N. Ryder, A. Paino, Q. Yuan, C. Winter, B. Wang, M. Bavarian, I. Babuschkin, S. Sidor, I. Kanitscheider, M. Pavlov, M. Plappert, N. Tezak, H. Jun, W. Zhuk, V. Pong, L. Kaiser, J. Tworek, A. Carr, L. Weng, S. Agarwal, K. Cobbe, V. Kosaraju, A. Power, S. Polu, J. Han, R. Puri, S. Jain, B. Chess, C. Gibson, O. Boiko, E. Parparita, A. Tootoonchian, K. Kosic, and C. Hesse · 2022
Later among the works it cites.
On Second Thought, Let’s Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning, 2022
O. Shaikh, H. Zhang, W. Held, M. Bernstein, and D. Yang · 2022
Later among the works it cites.
Prompting GPT-3 To Be Reliable, 2022
C. Si, Z. Gan, Z. Yang, S. Wang, J. Wang, J. Boyd-Graber, and L. Wang · 2022
Later among the works it cites.
Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them, 2022
M. Suzgun, N. Scales, N. Schärli, S. Gehrmann, Y. Tay, H. W. Chung, A. Chowdhery, Q. V. Le, E. H. Chi, D. Zhou, and J. Wei · 2022
Later among the works it cites.
Emergent Abilities of Large Language Models, 2022
J. Wei, Y. Tay, R. Bommasani, C. Raffel, B. Zoph, S. Borgeaud, D. Yogatama, M. Bosma, D. Zhou, D. Metzler, E. H. Chi, T. Hashimoto, O. Vinyals, P. Liang, J. Dean, and W. Fedus · 2022
Later among the works it cites.
Inverse scaling can become U-shaped, 2022
J. Wei, Y. Tay, and Q. V. Le · 2022
Later among the works it cites.
Chain of Thought Prompting Elicits Reasoning in Large Language Models, 2022
J. Wei, X. Wang, D. Schuurmans, M. Bosma, B. Ichter, F. Xia, E. Chi, Q. Le, and D. Zhou · 2022
Later among the works it cites.