OpenAI показала, что модели, обученные с RLHF, превосходят традиционные в задачах суммаризации.
Кратко:
●RLHF позволяет малым моделям превосходить крупные.
●Модели успешно работают на новых датасетах без дообучения.
●Качество данных и надзор критичны для RLHF.
●Архивированный репозиторий OpenAI остаётся доступным для чтения.
Эволюция подхода: RL от человеческой обратной связи
В сентябре 2020 года OpenAI представила работу, где применили RLHF для суммаризации. Модели, обученные с помощью этого подхода, генерируют более качественные краткие изложения, чем крупные модели, обученные только супервизорным способом. Используя датасет Reddit TL;DR, сначала обучалась reward-модель, предсказывающая выбор человека между двумя рефератами, а затем проводился RL-файнетьюнинг для максимизации этого human reward.
Ключевые достижения
●Модель с 1.3 миллиарда параметров, дообученная с RLHF, превзошла 12B модель, обученную супервизорным способом.
●Более крупная модель (6.7B) после RLHF получила предпочтение от людей даже по сравнению с оригинальными TL;DR.
●Модель успешно применялась на датасете CNN/DailyMail, где её результаты превзошли человеческие рефераты.
Техническая реализация и качество данных
Использовалась архитектура трансформеров типа GPT, включавшая:
1. Супервизорное обучение на TL;DR датасете;
2. Сбор данных: человеческие оценки пар рефератов;
3. Обучение reward-модели;
4. RL-файнетьюнинг с KL-пенальти.
Для оценки данных привлекли 80 контракторов, которые прошли тщательное обучение. Финетюнинг 6.7B модели потребовал 320 GPU-дней.
Современное развитие и релизы
В апреле 2026 года OpenAI архивировала репозиторий summarize-from-feedback на GitHub, оставив его доступным только для чтения. Ресурсы документации описывают трёхэтапную модельную архитектуру.
Дополнительные академические перспективы
В апреле 2026 года вышел обзор RLHF с точки зрения статистики, обсуждающий методы обучения reward-функций и перспективы one-stage подходов. В июле 2025 года была предложена идея PLUS, адаптирующая RLHF для персонализации моделей.
Выводы
RLHF позволяет улучшать качество суммаризации, позволяя компактным моделям превосходить крупные.
Модели успешно работают на новых датасетах без дообучения.
Высокое качество данных и процесс надзора критичны для успеха.
Публичный репозиторий с кодом и данными делает подход доступным для исследователей.
Новые направления RLHF продолжают расширять возможности метода.
Частые вопросы
Что такое RLHF?
RLHF (reinforcement learning from human feedback) — это метод обучения моделей, в котором используются человеческие оценки для улучшения качества генерируемых текстов.
Почему RLHF лучше традиционных методов?
RLHF позволяет малым моделям достигать или превосходить качество крупных моделей, обученных традиционными методами на больших наборах данных.
Какие ресурсы нужны для RLHF?
Финетюнинг крупных моделей требует значительных вычислительных ресурсов, например, 320 GPU-дней для модели 6.7B параметров.
Как RLHF применяется на практике?
RLHF успешно используется для суммаризации текстов, а также для персонализации моделей, как в случае с методом PLUS.