Anthropic передаёт разработанный инструмент оценки безопасности AI-моделей под управление независимого фонда. Это важный шаг к стандартизации AI safety в индустрии.
Anthropic объявила о передаче HELM-Safety — инструмента комплексной оценки безопасности AI-моделей — под управление независимого некоммерческого фонда AI Safety Institute Foundation. Ранее инструмент разрабатывался и поддерживался внутри компании; теперь он становится открытым стандартом для всей индустрии.
Что включает HELM-Safety
HELM-Safety включает более 500 тестовых сценариев, охватывающих ключевые аспекты безопасности: устойчивость к jailbreak-атакам, поведение при неоднозначных инструкциях, обработку конфиденциальных данных, соответствие правовым нормам разных юрисдикций. Инструмент уже использовался для оценки Claude, и по словам Anthropic, результаты использовались при разработке Constitutional AI 2.0.