OpenAI представила аудиомодели нового поколения в API
Мария Соколова1 августа 2026 г.5 мин чтения
OpenAI анонсировала аудиомодели для API, улучшив speech-to-text и text-to-speech функции, включая новые возможности кастомизации.
Кратко:
●OpenAI выпустила новые аудиомодели API.
●Улучшены функции speech-to-text и text-to-speech.
●Впервые доступна кастомизация стиля речи.
●Модели интегрируются через Agents SDK.
Новые аудиомодели от OpenAI: что изменилось?
20 марта 2025 года OpenAI анонсировала значительное обновление в своём API, представив аудиомодели нового поколения. Эти модели, включающие gpt-4o-transcribe и gpt-4o-mini-transcribe, предлагают существенно улучшенные возможности для распознавания и генерации речи.
Распознавание речи: точность и надёжность
Новые модели для распознавания речи, такие как gpt-4o-transcribe, значительно снизили коэффициент ошибок слов (Word Error Rate, WER) по сравнению с ранее используемыми Whisper-моделями. Они продолжают демонстрировать высокую точность даже в условиях акцентов, шумов и нестабильной скорости речи. Это делает их незаменимыми для создания голосовых агентов, которым важна точность в самых сложных условиях.
Генерация речи: новая степень кастомизации
В области синтеза речи OpenAI представила gpt-4o-mini-tts, модель с улучшенной управляемостью. Впервые разработчики получили возможность не только задавать текст, но и указывать, как именно его произнести. Например, можно настроить голосовой агент на стиль общения «сочувствующий оператор службы поддержки». Это открытие нового уровня персонализации для голосовых агентов может серьёзно повлиять на их использование в различных сферах, от ритейла до поддержки клиентов.
Технические инновации и возможности
Аудиомодели базируются на архитектуре GPT-4o и предобучены на специализированных аудиоданных, что усиливает их способность понимать нюансы речи. Применение передовых методов дистилляции позволяет компактным моделям сохранять качество и отзывчивость. Для повышения точности и снижения ошибок в speech-to-text используется reinforcement learning.
Доступность и интеграция
Все новые аудиомодели доступны разработчикам через API. Интеграция возможна через Agents SDK, что упрощает превращение текстового агента в голосового буквально за несколько строк кода. Для задач с низкой задержкой, таких как синтез речи в реальном времени, рекомендован Realtime API.
Перспективы и будущее
OpenAI продолжает инвестировать в улучшение интеллекта, точности и доступности аудиомоделей. В будущем компания планирует расширить возможности для разработки собственных голосов при соблюдении стандартов безопасности. Эти намерения совпадают с другими инициативами компании, такими как борьба с злоупотреблениями ИИ в июне 2025 и новые горизонты ИИ-разработок.
Частые вопросы
Что нового в API от OpenAI?
OpenAI представила новые аудиомодели, которые улучшили точность распознавания и синтеза речи и добавили возможность кастомизации стиля речи.
Как можно использовать новые модели?
Модели доступны через API и интегрируются с помощью Agents SDK, что позволяет быстро создать голосового агента.
Что такое кастомизация стиля речи?
Это возможность указать, в каком стиле должна быть произнесена речь, например, «как сочувствующий оператор поддержки».