DPO (Direct Preference Optimization) — метод обучения языковых моделей по предпочтениям без отдельной модели вознаграждения, как в RLHF. Вместо этого модель напрямую оптимизируется на парах предпочтительных и непреференциальных ответов, что повышает стабильность и предсказуемость процесса. Важно различать DPO и RLHF: DPO не требует построения reward-модели, снижая сложность пайплайна.
Пример
В дообучении LLM по отзывам пользователей разработчики используют DPO, чтобы модель училась сразу на парах: какой ответ лучше, а какой хуже.