OpenAI усиливает защиту ChatGPT Atlas от атак prompt injection с помощью автоматизированного red teaming и усиленного обучения.
Кратко:
- ●ChatGPT Atlas уязвим к prompt injection.
- ●OpenAI внедряет автоматизированный red teaming.
- ●Усиленное обучение помогает быстро реагировать на угрозы.
- ●Новые контрольные точки повышают безопасность.
Что такое атака prompt injection?
Атака prompt injection представляет собой угрозу для AI-агентов, выступающих в роли браузеров. Злоумышленники могут внедрять скрытые команды, чтобы агент выполнял нежелательные действия. Например, агент может случайно отправить внутреннее письмо об увольнении вместо ожидаемого ответа «out-of-office».
Уязвимости и риски для ChatGPT Atlas
ChatGPT Atlas, как агент-браузер, имеет доступ к пользовательским данным, таким как почта и документы, что делает его привлекательной целью для атак. Это потенциально расширяет поверхность атаки и требует постоянного обновления защитных механизмов.