Return to Issue Details Reward Modeling from Human Feedback Improves Controllability in Large Generative Models Download Download PDF