С момента, когда люди начали задумываться о создании машин с интеллектом, подобным нашему, стало очевидно, что они должны уметь отказывать. Научная фантастика полна историй о роботах, отказывающихся подчиняться. Сегодня это требование стало фактической нормой: ИИ должны быть честными и безопасными, особенно отказывая в опасных запросах, таких как создание оружия.
Изначально модели обучаются на больших массивах текстов, включая насилие и жестокость, а не на способности воздерживаться. Как отмечает Стивен Адлер из OpenAI, ранние версии ИИ говорили обо всём — даже о самоубийствах. Современные модели учатся отказывать через «машину, обучающую машину», добавляя дополнительные слои защиты для предотвращения вредоносных инструкций.
Отказы ИИ не всегда надежны. Современные модели могут хранить вредоносные знания и быть подвержены манипуляциям. Это особенно опасно в условиях, когда злоумышленники могут обходить фильтры. Политизация отказов также представляет угрозу, поскольку компании сами определяют границы, часто в условиях секретности.
Отказ может стать инструментом цензуры, особенно в репрессивных режимах, где он способен блокировать критику лидеров. Это поднимает вопрос о балансе между безопасностью пользователей и свободой слова.
Константин Эльстнер из Apollo Research предлагает использовать «сондажи» для улучшения отказов, но это создаёт сложные структуры, которые трудно интерпретировать. Автор статьи Артур Холланд Мишель предупреждает: нельзя слепо доверять отказу как «стене защиты». Недостаток — катастрофа, избыток — цензура.