GoogleИскусственный интеллектТехнологииМультимодальные моделиВизуально-языковые модели
PaliGemma: новая мультимодальная модель Google
Мария Соколова4 июля 2026 г.5 мин чтения
PaliGemma — открытая визуально-языковая модель от Google, представленная на конференции Google I/O в мае 2024 года. Она поддерживает множество задач, включая автоматическое создание подписей и визуально-текстовые вопросы.
Кратко:
●PaliGemma представлена в мае 2024
●Поддерживает множество задач: от captioning до OCR
●Выпущены улучшенные версии PaliGemma 2 и 2 mix
●Доступна на платформах Hugging Face и Google Cloud
PaliGemma: Взгляд на новую модель от Google
В мае 2024 года на конференции Google I/O была представлена PaliGemma — новая мультимодальная визуально-языковая модель от Google. Это семейство моделей сочетает в себе визуальный энкодер SigLIP-So400m и языковой декодер Gemma-2B, создавая уникальную платформу для решения разносторонних задач.
Конфигурации и особенности
PaliGemma включает три типа моделей: PT (pretrained), Mix и FT. Это позволяет пользователям выбрать наиболее подходящую конфигурацию в зависимости от специфики задач. Модель поддерживает три разрешения изображений и различные форматы чисел, что делает её гибкой для применения в разнообразных условиях.
Функциональные возможности
Модель способна выполнять такие задачи, как создание подписей, визуально-текстовые вопросы, обнаружение объектов и понимание документов. Например, FT-версии достигают 85.64% точности на VQAv2 и 144.6 CIDEr на COCO Captions. OpenAI и LANL исследуют безопасность frontier AI и OpenAI GPT-4.5: масштабный шаг в развитии ИИ также делятся своим вкладом в развитие искусственного интеллекта.
Развитие модели
В декабре 2024 года Google анонсировал улучшенную версию PaliGemma 2. Это семейство моделей расширяет возможности, добавляя более мощное оборудование и улучшенные алгоритмы. В феврале 2025 года была представлена версия PaliGemma 2 mix, способная переключаться между задачами без необходимости загрузки различных моделей.
Доступность и применение
Модели PaliGemma и её улучшенные версии доступны на платформах Hugging Face и Google Cloud Vertex AI. Это позволяет использовать их в различных приложениях, от медицинского анализа до мобильных систем.
Частые вопросы
Что такое PaliGemma?
PaliGemma — это мультимодальная визуально-языковая модель от Google, поддерживающая задачи от создания подписей до OCR.
Каким образом можно использовать PaliGemma?
Модель доступна на платформах Hugging Face и Google Cloud, что позволяет интегрировать её в приложения через популярные фреймворки.
Какие задачи поддерживает PaliGemma?
Она поддерживает создание подписей, визуально-текстовые вопросы, обнаружение объектов и понимание документов.
В чём особенность PaliGemma 2 mix?
Эта версия модели позволяет гибко переключаться между различными задачами, поддерживая multi-task функциональность.