Интерпретируемость (Interpretability) — это свойство AI-модели, позволяющее человеку понять, как и почему она пришла к определённому выводу или ответу. Исследования, например Mechanistic Interpretability от Anthropic, нацелены на раскрытие внутренних связей и приёмов модели. Интерпретируемость отличается от прозрачности: прозрачная система не обязательно объяснима.
Пример
Инженер анализирует промежуточные активации нейронов в GPT-4, чтобы выяснить, почему модель ошиблась в логической задаче.