logoalt Hacker News

Ancapistaniyesterday at 10:28 PM0 repliesview on HN

Reinforcement learning, I'd assume.

Presumably RLHF (Reinforcement Learning from Human Feedback).