Skip to content
Road to Intelligence

Reward and Restraint

Optimize a three-answer policy and discover why more reward can mean less truth.

From Chapter 10: From Base Model to Assistant

Try it · toy model

Reward and Restraint

Know well12 min