Block-sparse GPU kernels могут многократно ускорять нейросети за счёт разрежённых весов. Их применяют в анализе текстов и генерации контента.
Кратко:
- ●Используют разрежённые весы для ускорения
- ●Превосходят cuBLAS и cuSPARSE по скорости
- ●Улучшают результаты в анализе текстов и генерации
- ●Эволюционировали до современных методов
История и релиз OpenAI
6 декабря 2017 года OpenAI представила инновацию — block-sparse GPU kernels. Это высоко оптимизированные ядра, предназначенные для нейросетей с блок-спарсностью, предложенные Скоттом Греем, Алексом Радфордом и Дидериком Кингманом. Они поддерживали блоки размером 8×8, 16×16 и 32×32, что позволяло пропускать вычисления над нулями и существенно ускорять работу сетей.