Мультимодальность (multimodal) означает способность искусственного интеллекта обрабатывать несколько типов данных одновременно: текст, изображения, звук, видео. Мультимодальные модели, такие как GPT-4o, Claude 3 и Gemini, могут анализировать и комбинировать информацию из разных источников. Мультимодальность расширяет область применения AI по сравнению с чисто текстовыми моделями.
Пример
Пользователь загружает фотографию и задаёт текстовый вопрос о ней в Gemini — модель анализирует изображение и отвечает исходя из визуального контекста.