Fetching the paper…
Reading the bibliography…
Preference alignment via reward models helps build safe, helpful, and reliable large language models (LLMs).
Value-sensitive design
Batya Friedman. 1996 · 1996
Earlier work this paper cites.
African-American Language Use: Ideology and So-called Obscenity , pages 226–250
Arthur Spears. 1998 · 1998
Earlier work this paper cites.
African American English: a linguistic introduction
Lisa J Green. 2002 · 2002
Earlier work this paper cites.
Social varieties of American English , page 58–75. Cambridge University Press
Walt Wolfram. 2004 · 2004
Earlier work this paper cites.
Articulate While Black: Barack Obama, Language, and Race in the U. S
H. Samy Alim, Geneva Smitherman, and Michael Eric Dyson. 2012 · 2012
Earlier work this paper cites.
Challenges of studying and processing dialects in social media
Anna Jørgensen, Dirk Hovy, and Anders Søgaard. 2015 · 2015
Earlier work this paper cites.
1language use in african american communities: An introduction
Sonja L. Lanehart, Jennifer Bloomquist, and Ayesha M. Malik. 2015 · 2015
Earlier work this paper cites.
Raciolinguistics: How Language Shapes Our Ideas About Race
H. Samy Alim, John R. Rickford, and Arnetha F. Ball. 2016 · 2016
Earlier work this paper cites.
Demographic Dialectal Variation in Social Media: A Case Study of African-American English
Su Lin Blodgett, Lisa Green, and Brendan O’Connor. 2016 · 2016
Earlier work this paper cites.
Racial Disparity in Natural Language Processing: A Case Study of Social Media African-American English
Su Lin Blodgett and Brendan T. O’Connor. 2017 · 2017
Earlier work this paper cites.
Deep Reinforcement Learning from Human Preferences
P. Christiano, J. Leike, Tom B. Brown, Miljan Martic, S. Legg, and Dario Amodei. 2017 · 2017
Earlier work this paper cites.
Unsettling race and language: Toward a raciolinguistic perspective
Jonathan Rosa and Nelson Flores. 2017 · 2017
Earlier work this paper cites.
Proximal Policy Optimization Algorithms
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov. 2017 · 2017
Earlier work this paper cites.
Chapter 10. Black Is, Black Isn’t: Perceptions of Language and Blackness
Walt Wolfram, Karissa Wojcik, Eric Wilbanks, and Jeffrey Reaser. 2018 · 2018
Earlier work this paper cites.
Racial bias in hate speech and abusive language detection datasets
Thomas Davidson, Debasmita Bhattacharya, and Ingmar Weber. 2019 · 2019
Earlier work this paper cites.
Articulating language oppression: colonialism, coloniality and the erasure of Tibet’s minority languages
Gerald Roche. 2019 · 2019
Earlier work this paper cites.
The Risk of Racial Bias in Hate Speech Detection
Maarten Sap, Dallas Card, Saadia Gabriel, Yejin Choi, and Noah A. Smith. 2019 · 2019
Earlier work this paper cites.
Linguistic justice: Black language, literacy, identity, and pedagogy
April Baker-Bell. 2020 · 2020
Earlier work this paper cites.
Language (Technology) is Power: A Critical Survey of “Bias” in NLP
Su Lin Blodgett, Solon Barocas, Hal Daumé III, and Hanna Wallach. 2020 · 2020
Earlier work this paper cites.
Investigating African-American Vernacular English in transformer-based text generation
Sophie Groenwold, Lily Ou, Aesha Parekh, Samhita Honnavalli, Sharon Levy, Diba Mirza, and William Yang Wang. 2020 · 2020
Earlier work this paper cites.
Predictive Biases in Natural Language Processing Models: A Conceptual Framework and Overview
Deven Santosh Shah, H. Andrew Schwartz, and Dirk Hovy. 2020 · 2020
Earlier work this paper cites.
Sociolinguistically driven approaches for just natural language processing
Su Lin Blodgett. 2021 · 2021
Earlier work this paper cites.
“I don’t Think These Devices are Very Culturally Sensitive.”—Impact of Automated Speech Recognition Errors on African Americans
Zion Mengesha, Courtney Heldreth, Michal Lahav, Juliana Sublewski, and Elyse Tuennerman. 2021 · 2021
Earlier work this paper cites.
Detoxifying Language Models Risks Marginalizing Minority Voices
Albert Xu, Eshaan Pathak, Eric Wallace, Suchin Gururangan, Maarten Sap, and Dan Klein. 2021 · 2021
Earlier work this paper cites.
Challenges in Automated Debiasing for Toxic Language Detection
Xuhui Zhou, Maarten Sap, Swabha Swayamdipta, Yejin Choi, and Noah Smith. 2021 · 2021
Earlier work this paper cites.
Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
Yuntao Bai, Andy Jones, Kamal Ndousse, Amanda Askell, Anna Chen, Nova DasSarma, Dawn Drain, Stanislav Fort, Deep Ganguli, Tom Henighan, Nicholas Joseph, Saurav Kadavath, Jackson Kernion, Tom Conerly, Sheer El-Showk, Nelson Elhage, Zac Hatfield-Dodds, Danny Hernandez, Tristan Hume, Scott Johnston, Shauna Kravec, Liane Lovitt, Neel Nanda, Catherine Olsson, Dario Amodei, Tom Brown, Jack Clark, Sam McCandlish, Chris Olah, Ben Mann, and Jared Kaplan. 2022 · 2022
Cited alongside, same era.
Towards a deep multi-layered dialectal language analysis: A case study of African-American English
Jamell Dacon. 2022 · 2022
Cited alongside, same era.
The Black side of the river: Race, language, and belonging in Washington, DC
Jessica A Grieser. 2022 · 2022
Cited alongside, same era.
Exploring the Role of Grammar and Word Choice in Bias Toward African American English (AAE) in Hate Speech Classification
Camille Harris, Matan Halevy, Ayanna Howard, Amy Bruckman, and Diyi Yang. 2022 · 2022
Cited alongside, same era.
Training language models to follow instructions with human feedback
HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM
Zhilin Wang, Yi Dong, Jiaqi Zeng, Virginia Adams, Makesh Narsimhan Sreedhar, Daniel Egert, Olivier Delalleau, Jane Polak Scowcroft, Neel Kant, Aidan Swope, and Oleksii Kuchaiev. 2023 · 2023
Later among the works it cites.
Can voice assistants be microaggressors? cross-race psychological responses to failures of automatic speech recognition
Kimi Wenzel, Nitya Devireddy, Cam Davison, and Geoff Kaufman. 2023 · 2023
Later among the works it cites.
Gibbs sampling from human feedback: A provable kl-constrained framework for rlhf
Wei Xiong, Hanze Dong, Chenlu Ye, Han Zhong, Nan Jiang, and Tong Zhang. 2023 · 2023
Later among the works it cites.
Qwen2 technical report
2024 · 2024
Later among the works it cites.
Zheng Cai, Maosong Cao, Haojiong Chen, Kai Chen, Keyu Chen, Xin Chen, Xun Chen, Zehui Chen, Zhi Chen, Pei Chu, Xiaoyi Dong, Haodong Duan, Qi Fan, Zhaoye Fei, Yang Gao, Jiaye Ge, Chenya Gu, Yuzhe Gu, Tao Gui, Aijia Guo, Qipeng Guo, Conghui He, Yingfan Hu, Ting Huang, Tao Jiang, Penglong Jiao, Zhenjiang Jin, Zhikai Lei, Jiaxing Li, Jingwen Li, Linyang Li, Shuaibin Li, Wei Li, Yining Li, Hongwei Liu, Jiangning Liu, Jiawei Hong, Kaiwen Liu, Kuikun Liu, Xiaoran Liu, Chengqi Lv, Haijun Lv, Kai Lv, Li Ma, Runyuan Ma, Zerun Ma, Wenchang Ning, Linke Ouyang, Jiantao Qiu, Yuan Qu, Fukai Shang, Yunfan Shao, Demin Song, Zifan Song, Zhihao Sui, Peng Sun, Yu Sun, Huanze Tang, Bin Wang, Guoteng Wang, Jiaqi Wang, Jiayu Wang, Rui Wang, Yudong Wang, Ziyi Wang, Xingjian Wei, Qizhen Weng, Fan Wu, Yingtong Xiong, Chao Xu, Ruiliang Xu, Hang Yan, Yirong Yan, Xiaogui Yang, Haochen Ye, Huaiyuan Ying, Jia Yu, Jing Yu, Yuhang Zang, Chuyu Zhang, Li Zhang, Pan Zhang, Peng Zhang, Ruijie Zhang, Shuo Zhang, Songyang Zhang, Wenjian Zhang, Wenwei Zhang, Xingcheng Zhang, Xinyue Zhang, Hui Zhao, Qian Zhao, Xiaomeng Zhao, Fengzhe Zhou, Zaida Zhou, Jingming Zhuo, Yicheng Zou, Xipeng Qiu, Yu Qiao, and Dahua Lin. 2024 · 2024
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, and Ryan Lowe. 2022 · 2022
Cited alongside, same era.
Characterizing the Global Crowd Workforce: A Cross-Country Comparison of Crowdworker Demographics
Lisa Posch, Arnim Bleier, Fabian Flöck, and Markus Strohmaier. 2022 · 2022
Cited alongside, same era.
Annotators with Attitudes: How Annotator Beliefs And Identities Bias Toxic Language Detection
Maarten Sap, Swabha Swayamdipta, Laura Vianna, Xuhui Zhou, Yejin Choi, and Noah A. Smith. 2022 · 2022
Cited alongside, same era.
VALUE: Understanding Dialect Disparity in NLU
Caleb Ziems, Jiaao Chen, Camille Harris, Jessica Anderson, and Diyi Yang. 2022 · 2022
Cited alongside, same era.
Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, Binyuan Hui, Luo Ji, Mei Li, Junyang Lin, Runji Lin, Dayiheng Liu, Gao Liu, Chengqiang Lu, Keming Lu, Jianxin Ma, Rui Men, Xingzhang Ren, Xuancheng Ren, Chuanqi Tan, Sinan Tan, Jianhong Tu, Peng Wang, Shijie Wang, Wei Wang, Shengguang Wu, Benfeng Xu, Jin Xu, An Yang, Hao Yang, Jian Yang, Shusheng Yang, Yang Yao, Bowen Yu, Hongyi Yuan, Zheng Yuan, Jianwei Zhang, Xingxuan Zhang, Yichang Zhang, Zhenru Zhang, Chang Zhou, Jingren Zhou, Xiaohuan Zhou, and Tianhang Zhu. 2023 · 2023
Cited alongside, same era.
A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity
Yejin Bang, Samuel Cahyawijaya, Nayeon Lee, Wenliang Dai, Dan Su, Bryan Wilie, Holy Lovenia, Ziwei Ji, Tiezheng Yu, Willy Chung, Quyet V. Do, Yan Xu, and Pascale Fung. 2023 · 2023
Cited alongside, same era.
Envisioning equitable speech technologies for black older adults
Robin N. Brewer, Christina Harrington, and Courtney Heldreth. 2023 · 2023
Cited alongside, same era.
Ultrafeedback: Boosting language models with high-quality feedback
Ganqu Cui, Lifan Yuan, Ning Ding, Guanming Yao, Wei Zhu, Yuan Ni, Guotong Xie, Zhiyuan Liu, and Maosong Sun. 2023 · 2023
Cited alongside, same era.
Later among the works it cites.
Understanding the Impacts of Language Technologies’ Performance Disparities on African American Language Speakers
Jay Cunningham, Su Lin Blodgett, Michael Madaio, Hal Daumé Iii, Christina Harrington, and Hanna Wallach. 2024 · 2024
Later among the works it cites.
PhonATe: Impact of type-written phonological features of african american language on generative language modeling tasks
Nicholas Deas, Jessica A Grieser, Xinmeng Hou, Shana Kleiner, Tajh Martin, Sreya Nandanampati, Desmond U. Patton, and Kathleen McKeown. 2024 · 2024
Later among the works it cites.
Rlhf workflow: From reward modeling to online rlhf
Hanze Dong, Wei Xiong, Bo Pang, Haoxiang Wang, Han Zhao, Yingbo Zhou, Nan Jiang, Doyen Sahoo, Caiming Xiong, and Tong Zhang. 2024 · 2024
Later among the works it cites.
"For Us By Us": Intentionally Designing Technology for Lived Black Experiences
Lisa Egede, Leslie Coney, Brittany Johnson, Christina Harrington, and Denae Ford. 2024 · 2024
Later among the works it cites.
Linguistic bias in chatgpt: Language models reinforce dialect discrimination
Eve Fleisig, Genevieve Smith, Madeline Bossi, Ishita Rustagi, Xavier Yin, and Dan Klein. 2024 · 2024
Later among the works it cites.
Controllable preference optimization: Toward controllable multi-objective alignment
Yiju Guo, Ganqu Cui, Lifan Yuan, Ning Ding, Jiexin Wang, Huimin Chen, Bowen Sun, Ruobing Xie, Jie Zhou, Yankai Lin, et al. 2024 · 2024
Later among the works it cites.
Modeling Gender and Dialect Bias in Automatic Speech Recognition
Camille Harris, Chijioke Mgbahurike, Neha Kumar, and Diyi Yang. 2024 · 2024
Later among the works it cites.
Open hermes preferences
Shengyi Costa Huang, Agustín Piqueres, Kashif Rasul, Philipp Schmid, Daniel Vila, and Lewis Tunstall. 2024 · 2024
Later among the works it cites.
Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
Hamish Ivison, Yizhong Wang, Jiacheng Liu, Ellen Wu, Valentina Pyatkin, Nathan Lambert, Yejin Choi, Noah A. Smith, and Hannaneh Hajishirzi. 2024 · 2024
Later among the works it cites.
The PRISM Alignment Project: What Participatory, Representative and Individualised Human Feedback Reveals About the Subjective and Multicultural Alignment of Large Language Models
Hannah Rose Kirk, Alexander Whitefield, Paul Rottger, Andrew M. Bean, Katerina Margatina, Juan Ciro, Rafael Mosquera, Max Bartolo, Adina Williams, He He, Bertie Vidgen, and Scott A. Hale. 2024 · 2024
Later among the works it cites.
RewardBench: Evaluating Reward Models for Language Modeling
Nathan Lambert, Valentina Pyatkin, Jacob Morrison, L. J. Miranda, Bill Yuchen Lin, Khyathi Chandu, Nouha Dziri, Sachin Kumar, Tom Zick, Yejin Choi, Noah A. Smith, and Hannaneh Hajishirzi. 2024 · 2024
Later among the works it cites.
Offsetbias: Leveraging debiased data for tuning evaluators
Junsoo Park, Seungyeon Jwa, Meiying Ren, Daeyoung Kim, and Sanghyuk Choi. 2024 · 2024
Later among the works it cites.
Direct preference optimization: your language model is secretly a reward model
Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, and Chelsea Finn. 2024 · 2024
Later among the works it cites.
Unintended impacts of LLM alignment on global representation
Michael Ryan, William Held, and Diyi Yang. 2024 · 2024
Later among the works it cites.
Wei Xiong, Hanze Dong, Chenlu Ye, Ziqi Wang, Han Zhong, Heng Ji, Nan Jiang, and Tong Zhang. 2024 · 2024
Later among the works it cites.
Regularizing hidden states enables learning generalizable reward model for llms
Rui Yang, Ruomeng Ding, Yong Lin, Huan Zhang, and Tong Zhang. 2024 · 2024
Later among the works it cites.
Advancing llm reasoning generalists with preference trees
Lifan Yuan, Ganqu Cui, Hanbin Wang, Ning Ding, Xingyao Wang, Jia Deng, Boji Shan, Huimin Chen, Ruobing Xie, Yankai Lin, Zhenghao Liu, Bowen Zhou, Hao Peng, Zhiyuan Liu, and Maosong Sun. 2024 · 2024
Later among the works it cites.
Relying on the unreliable: The impact of language models’ reluctance to express uncertainty
Kaitlyn Zhou, Jena D Hwang, Xiang Ren, and Maarten Sap. 2024 · 2024
Later among the works it cites.
Finding A Voice: Evaluating African American Dialect Generation for Chatbot Technology
Sarah E. Finch, Ellie S. Paek, Sejung Kwon, Ikseon Choi, Jessica Wells, Rasheeta Chandler, and Jinho D. Choi. 2025 · 2025
Closest in time.