RLHF (Reinforcement Learning from Human Feedback) — это подход к обучению нейросетей с подкреплением, где в качестве источника сигнала используются оценки людей. Модели учатся предсказывать ответы, которые пользователи сочли бы предпочтительными, что критично для выравнивания поведения диалоговых систем. Стоит отличать RLHF от классического обучения с подкреплением: здесь награда определяется не автоматически, а вручную или через сравнение вариантов.
Пример
В процессе обучения ChatGPT аннотаторы сравнивают два ответа на запрос, а RLHF помогает модели выбирать более уместные и безопасные формулировки.