alt
Hacker News
Ancapistani
•
yesterday at 10:28 PM
•
0 replies
•
view on HN
Reinforcement learning, I'd assume.
Presumably RLHF (Reinforcement Learning from Human Feedback).