QLoRA (Quantized LoRA) — это метод дообучения больших языковых моделей, который сочетает квантование модели до 4 бит и обучение только небольших LoRA-адаптеров. Такой подход позволяет дообучать модели с десятками миллиардов параметров на одной видеокарте, сохраняя эффективность по памяти. QLoRA не изменяет исходные веса базовой модели, а дорабатывает поведение через внешние адаптеры.
Пример
Инженер использует QLoRA для тонкой настройки модели Llama-2 с 70 миллиардами параметров на одной NVIDIA RTX 4090, чтобы обучить её специфическим юридическим данным.