OpenAI представила GPT-4o, модель, обрабатывающую аудио, видео и текст в реальном времени.
Кратко:
- ●GPT-4o обрабатывает аудио, видео и текст.
- ●Реакция на аудио за 232 мс.
- ●Модель дешевле на 50% и поддерживает более высокие лимиты.
- ●Обучение end-to-end для всех модальностей.
Анонс новой модели GPT-4o
13 мая 2024 года OpenAI представила свою новую флагманскую модель GPT-4 Omni, или GPT-4o. Эта модель способна обрабатывать аудио, изображение, видео и текст в режиме реального времени, что делает её уникальной на рынке.
Ключевые возможности GPT-4o
GPT-4o способна реагировать на аудио с задержкой всего 232 миллисекунды, что практически равно скорости реакции человека. По производительности в текстовых задачах и кодировании она сопоставима с GPT-4 Turbo, но при этом быстрее и дешевле — примерно на 50% менее затратна в API. Модель также демонстрирует улучшенные возможности в понимании изображений и аудио по сравнению с предыдущими версиями.