AI Safety — область исследований и практик, направленных на снижение рисков от использования искусственного интеллекта. В неё входят технические меры безопасности, выравнивание поведения моделей с целями человека (alignment), аудит, а также вопросы регулирования и управления (governance). AI Safety не ограничивается предотвращением 'вредных' ответов — задачи шире и глубже.
Пример
Anthropic разрабатывает механизмы AI Safety: тестирует модели на уязвимости, внедряет red teaming и формализует правила ответов для Claude.