Reward and Restraint
Optimize a three-answer policy and discover why more reward can mean less truth.
From Chapter 10: From Base Model to Assistant
Try it · toy model
Reward and Restraint
Know well12 min
Optimize a three-answer policy and discover why more reward can mean less truth.
From Chapter 10: From Base Model to Assistant
Try it · toy model
Reward and Restraint