logoalt Hacker News

lazyasciiartyesterday at 10:26 PM1 replyview on HN

RL'd?


Replies

Ancapistaniyesterday at 10:28 PM

Reinforcement learning, I'd assume.

Presumably RLHF (Reinforcement Learning from Human Feedback).