Как YouTube создаёт генеративные AI-эффекты в реальном времени
Редакция14 июня 2026 г.5 мин чтения
YouTube успешно применяет генеративный AI для создания эффектов в реальном времени на мобильных устройствах благодаря инновационным методам.
Кратко:
●Используется метод distillation для генерации эффектов
●Технология MediaPipe обеспечивает исполнение эффектов на устройствах
●Эффекты включают 'Never blink', 'Risen zombie' и 'Toon 2'
●Планируется интеграция новых моделей и улучшение производительности
Как YouTube создаёт AI-эффекты в реальном времени
В 2025 году YouTube представил инновационную технологию, позволяющую создавать генеративные AI-эффекты в реальном времени непосредственно на мобильных устройствах. Эта возможность стала доступной благодаря сложной, но эффективной системе, включающей метод distillation и использование фреймворка MediaPipe.
Метод distillation в основе генерации эффектов
Ключевым элементом технологии является метод distillation. Он заключается в использовании мощных генеративных моделей для создания высококачественных преобразований, которые затем оптимизируются для мобильных устройств. Процесс начинается с применения тяжёлых моделей, таких как StyleGAN2 и DeepMind’s Imagen, которые выступают в роли «учителя». Они создают тысячи пар изображений «до–после», служащих основой для обучения облегчённой модели на базе UNet с MobileNet-бекбоном.
Сохранение лицевых черт
Особое внимание уделяется сохранению индивидуальности лица. Для этого применяется Pivotal Tuning Inversion (PTI), который включает создание латентного встраивания и тонкую настройку генератора под конкретное лицо. Это позволяет избежать эффекта «замещения личности» при применении эффектов.
Технология MediaPipe для on-device исполнения
Фреймворк MediaPipe играет важную роль в исполнении эффектов на устройствах. Сначала технология Face Mesh определяет лицо и выравнивает кадр, после чего данные передаются на студент-модель. После обработки результат интегрируется обратно в кадр в реальном времени, что позволяет достигать задержки всего 6 мс на Pixel 8 Pro и 10,6 мс на iPhone 13 GPU.
Перспективы и развитие
YouTube планирует продолжать развитие технологий генеративного AI, внедряя новые модели, такие как Veo 3. Это позволит создавать ещё более сложные и интерактивные эффекты, а также снизить задержки на бюджетных устройствах. В то же время компания усиливает меры по предотвращению распространения низкокачественного контента, создаваемого AI, и внедряет автоматическую маркировку таких видео.
Частые вопросы
Как YouTube оптимизирует AI-эффекты для мобильных устройств?
Оптимизация достигается за счёт метода distillation, который позволяет использовать облегчённые модели для мобильных устройств, сохраняя при этом высокое качество эффектов.
Какие технологии используются для сохранения лицевых черт?
Для этого применяется Pivotal Tuning Inversion (PTI), обеспечивающий тонкую настройку генератора под индивидуальное лицо.
Каковы задержки при использовании AI-эффектов на мобильных устройствах?
Задержки составляют около 6 мс на Pixel 8 Pro и 10,6 мс на iPhone 13 GPU, что обеспечивает плавность при 30 fps.
Какие планы у YouTube на будущее в области AI-эффектов?
YouTube планирует интеграцию новых моделей и улучшение производительности, а также усиление мер по контролю качества AI-контента.