Red Teaming — это систематическое тестирование AI-систем на уязвимости, включающее попытки обойти защиту, поиск вредоносных сценариев и оценку возможных рисков. Такие проверки проводят перед запуском моделей, чтобы выявить слабые места и предотвратить злоупотребления. Red Teaming не ограничивается техническим аудитом — команда имитирует реальные атаки злоумышленников.
Пример
Перед релизом Claude 2 команда Anthropic провела red teaming: пыталась добиться токсичных или опасных ответов, чтобы улучшить фильтры модели.