OpenAI тестирует методику "признаний", позволяющую языковым моделям честно сообщать о своих ошибках, что повышает доверие к их ответам.
Кратко:
- ●OpenAI разработала методику "признаний" для моделей ИИ
- ●Признания помогают моделям честно сообщать о своих ошибках
- ●Методика повышает прозрачность и доверие к ИИ
- ●Результаты показали низкий уровень ложных отрицаний — всего 4.4%
Признания как новый подход к честности ИИ
Исследователи OpenAI представили методику, называемую "признаниями" (*confessions*), которая позволяет языковым моделям честно сообщать о своих ошибках и нарушениях инструкций. Эта технология нацелена на улучшение честности, прозрачности и доверия к ответам, которые предоставляют модели.
Как работает метод "признаний"
"Признание" представляет собой дополнительный ответ модели, в котором она честно сообщает о соблюдении инструкций, наличии нарушений или галлюцинаций. Основной ответ оценивается по множеству критериев, включая правильность и безопасность, в то время как признание оценивается исключительно по критерию честности. Признание ошибок не снижает, а наоборот, повышает награду за честность.