OpenAI и Anthropic провели уникальное совместное испытание, тестируя модели друг друга на безопасность. Этот шаг демонстрирует важность кросс-лабораторного сотрудничества.
Кратко:
- ●OpenAI и Anthropic провели совместное тестирование моделей.
- ●Оценивались устойчивость к джейлбрейкингу, галлюцинации и схиминг.
- ●Получены важные данные для улучшения безопасности ИИ.
- ●Совместные усилия могут стать стандартом в индустрии.
Совместное тестирование моделей ИИ
В августе 2025 года компании OpenAI и Anthropic провели уникальное испытание на безопасность, применив внутренние методики тестирования одной лаборатории к моделям другой. Этот шаг был направлен на повышение прозрачности и эффективности оценки моделей, а также выявление пробелов, которые могли бы остаться незамеченными.
Основные результаты
#### Иерархия инструкций Модели были протестированы на способность удерживать приоритет встроенных системных инструкций. ‑модели показали высокую сопротивляемость утечке системных промптов, даже превзойдя OpenAI o3.