Квантизация — это метод уменьшения размера нейросетевых моделей за счёт снижения точности хранения весов, например, с формата float32 до int4. Такая техника позволяет сократить требования к памяти и ускорить инференс моделей, при этом качество обычно почти не страдает. Важно различать квантизацию и простое сжатие: квантизация изменяет именно разрядность весов, а не удаляет параметры.
Пример
Модель Llama-2 можно запустить на ноутбуке после квантизации до int8 с помощью инструмента llama.cpp.