Language models are few-shot learners
Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al · 2020
Cited alongside, same era.
Compositional generalization via neural-symbolic stack machines
Xinyun Chen, Chen Liang, Adams Wei Yu, Dawn Song, and Denny Zhou · 2020
Cited alongside, same era.
Permutation equivariant models for compositional generalization in language
Jonathan Gordon, David Lopez-Paz, Marco Baroni, and Diane Bouchacourt · 2020
Cited alongside, same era.
Measuring compositional generalization: A comprehensive method on realistic data
Daniel Keysers, Nathanael Schärli, Nathan Scales, Hylke Buisman, Daniel Furrer, Sergii Kashubin, Nikola Momchev, Danila Sinopalnikov, Lukasz Stafiniak, Tibor Tihon, et al · 2020
Cited alongside, same era.
Compositional generalization by learning analytical expressions
Qian Liu, Shengnan An, Jian-Guang Lou, Bei Chen, Zeqi Lin, Yan Gao, Bin Zhou, Nanning Zheng, and Dongmei Zhang · 2020
Cited alongside, same era.
Learning compositional rules via neural program synthesis
Maxwell Nye, Armando Solar-Lezama, Josh Tenenbaum, and Brenden M Lake · 2020
Cited alongside, same era.
Unsupervised question decomposition for question answering
Ethan Perez, Patrick Lewis, Wen-tau Yih, Kyunghyun Cho, and Douwe Kiela · 2020
Cited alongside, same era.
Learning to recombine and resample data for compositional generalization
Ekin Akyürek, Afra Feyza Akyürek, and Jacob Andreas · 2021
Cited alongside, same era.
Training verifiers to solve math word problems
Original
Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Jacob Hilton, Reiichiro Nakano, Christopher Hesse, and John Schulman · 2021
Cited alongside, same era.
Shepherd pre-trained language models to develop a train of thought: An iterative prompting approach
Original
Boshi Wang, Xiang Deng, and Huan Sun
Cited in the paper.
Self-consistency improves chain of thought reasoning in language models
Original
Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, and Denny Zhou
Cited in the paper.