Ускорение Stable Diffusion XL с JAX на Cloud TPU v5e
Анна Волкова11 августа 2026 г.5 мин чтения
Hugging Face и Google Cloud раскрыли возможности для ускорения инференса Stable Diffusion XL с JAX на Cloud TPU v5e, что делает его более доступным и экономичным.
Кратко:
●Hugging Face внедрила поддержку SDXL на Cloud TPU v5e.
●TPU v5e обеспечивает до 2,4× лучшую производительность на доллар.
●Новые возможности MaxDiffusion для работы с LDM-моделями.
●Применение в Kubernetes-среде с GKE.
Новая эпоха для Stable Diffusion XL
Hugging Face, известная своей платформой для работы с NLP и генеративными моделями, представила поддержку Stable Diffusion XL (SDXL) на Cloud TPU v5e. Это событие знаменует собой важный шаг в обеспечении высокой производительности и экономичности при инференсе этой модели.
Производительность и настройки
На демонстрации, проведенной Hugging Face, четыре изображения размером 1024×1024 рендерятся за ≈4 секунды на TPU v5e-4, что включает все процессы от форматирования до обработки на фронтенде. Фактическое время генерации составляет около 2,3 секунд на изображение. Это достижение стало возможным благодаря увеличенному масштабу UNet в SDXL, который в три раза больше, чем у предыдущих поколений.
Сравнительные бенчмарки показывают, что TPU v5e обеспечивает до ~2,4× лучшую производительность на доллар по сравнению с TPU v4, что делает его привлекательным выбором для разработчиков и исследователей.
Аппаратные характеристики TPU v5e
TPU v5e предлагает впечатляющие аппаратные спецификации: 197 TFLOPs для bf16, 394 TOPS для int8 и 788 TOPS для int4, что поддерживается высокой пропускной способностью HBM 820 GB/s. Эти показатели делают его идеальным для ускорения инференса моделей, таких как Llama 2 и GPT-3.
Интеграция с GKE и MaxDiffusion
Google Cloud недавно выпустила руководство по использованию MaxDiffusion — библиотеки на Python + JAX для инференса LDM-моделей, включая SDXL, в Kubernetes-среде с использованием TPU v5e. Это позволяет как одно-, так и многомашинный инференс с шардингом для снижения задержек.
MaxDiffusion служит референсной реализацией для LDM-моделей на XLA-устройствах, таких как TPU и GPU, и является отправной точкой для исследований и production-процессов.
Значение и перспективы
Поддержка SDXL на Cloud TPU v5e делает генеративные модели более доступными и экономически выгодными для применения в продакшне. Это открывает новые перспективы для исследователей и разработчиков, стремящихся внедрять передовые технологии в свои проекты.
Частые вопросы
Что такое Cloud TPU v5e?
Cloud TPU v5e — это аппаратная платформа от Google, предлагающая высокую производительность и экономичность для инференса AI-моделей.
Каковы преимущества использования JAX с Stable Diffusion XL?
JAX обеспечивает более эффективное выполнение и оптимизацию моделей, что позволяет значительно ускорить процесс инференса.
Какие возможности предоставляет MaxDiffusion?
MaxDiffusion позволяет выполнять инференс LDM-моделей в Kubernetes-среде с использованием TPU, поддерживая как одно-, так и многомашинные конфигурации.