Выравниванием (alignment) называют задачу настройки AI-систем так, чтобы их действия соответствовали целям, намерениям и ценностям людей. Этот процесс лежит в основе безопасности искусственного интеллекта: некорректное выравнивание может привести к непредсказуемым или опасным результатам. Термин отличается от простого обучения правилам — он охватывает и глубокие, и этические аспекты поведения модели.
Пример
В OpenAI GPT-4 применяли методы выравнивания, чтобы ответы модели не содержали вредных советов и соответствовали этическим нормам.