Новая стратегия OpenAI — deliberative alignment — улучшает безопасность ИИ через рассуждения над нормами.
Кратко:
- ●OpenAI представила deliberative alignment в 2024 году
- ●Модель о1 улучшила результаты на тестах безопасности
- ●Используется обучение через рассуждение
- ●Альтернативный подход CADA улучшает безопасность
Новая стратегия безопасности от OpenAI
20 декабря 2024 года OpenAI представила стратегию *deliberative alignment*. Основная идея — обучать модели o-series читать текст норм безопасности и рассуждать над ними перед формированием ответа. Это позволяет улучшить безопасность и адаптацию моделей.
Как работает deliberative alignment
Модели сначала получают объяснённые спецификации безопасности, а затем учатся использовать цепочку мыслей (chain-of-thought, CoT), чтобы находить и применять соответствующие правила при генерации ответа. Обучение проходит в два этапа: Supervised Fine-Tuning (SFT) на синтетически сгенерированных данных и Reinforcement Learning (RL) с наградой, основанной на тех же спецификациях.