Обучение с подкреплением (reinforcement learning, RL) — метод, при котором агент обучается действовать во взаимодействии со средой, получая награды или штрафы за свои действия. Для обучения языковых моделей по предпочтениям человека применяют RLHF — RL с подкреплением от человеческой обратной связи. В отличие от обучения с учителем, RL не требует заранее размеченных данных.
Пример
OpenAI использует RLHF при дообучении ChatGPT: люди оценивают ответы, а модель учится выдавать более предпочтительные отклики.