Fetching the paper…

Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data · Around