OpenAI объясняет, почему языковые модели часто создают неверные факты, и предлагает методы повышения их надёжности и честности.
Кратко:
- ●Языковые модели часто «галлюцинируют» из-за методов оценки.
- ●Неправильные ответы возникают из-за статистических смещений.
- ●Метод 'confessions' помогает моделям признавать ошибки.
- ●Новые подходы улучшают надёжность и безопасность ИИ.
Почему языковые модели «галлюцинируют»
Языковые модели, такие как GPT, часто «галлюцинируют», то есть уверенно генерируют неверные факты. Исследование OpenAI, опубликованное 5 сентября 2025 года, показывает, что это происходит из-за того, что стандартные методы обучения и оценки поощряют угадывание, а не признание неопределённости. Это приводит к тому, что модели дают ответы даже в ситуациях, когда не уверены в их правильности.
Ошибки как «система вознаграждений»
Согласно OpenAI, стандартные методы оценки стимулируют модели к угадыванию ответов, так как это позволяет им получать больше баллов, в отличие от ситуаций, когда они признаются в незнании. Это подтверждается тестами, в которых модель gpt‑5‑thinking‑mini имела уровень отказов 52 % и точность 22 %, тогда как модель o4‑mini показала всего 1 % отказов, но с ошибками в 75 % случаев.