Авторы метода показали: QLoRA дообучает модель с 65 млрд параметров на одном GPU с 48 ГБ памяти, при этом качество сопоставимо с полным 16-битным файнтюнингом. Без QLoRA такую модель пришлось бы дообучать на нескольких GPU с суммарным объёмом памяти в разы больше.
LoRA и QLoRA: как выбрать GPU для файнтюнинга LLM без миллионного бюджета

Обучить большую языковую модель с нуля могут единицы компаний: нужны кластеры GPU и месяцы вычислений. Дообучить готовую модель под свою задачу реально и на скромных ресурсах — если выбрать правильный метод.
Полный файнтюнинг обновляет все параметры модели. В памяти при этом хранятся не только сами веса, но и градиенты, и состояния оптимизатора для каждого параметра — объём VRAM растёт кратно размеру модели. Для моделей на десятки миллиардов параметров полный файнтюнинг недоступен без дорогого мультикарточного сервера.
Альтернатива — PEFT (Parameter-Efficient Fine-Tuning): семейство подходов, которые замораживают веса базовой модели и обучают лишь небольшую дополнительную часть параметров. Два самых распространённых PEFT-метода для LLM — LoRA и QLoRA.
LoRA (Low-Rank Adaptation) добавляет к весам модели пару компактных матриц A и B, которые обучаются вместо всей исходной матрицы весов. Базовые веса остаются замороженными: обновляются только эти адаптеры.
Схема резко сокращает число обучаемых параметров и объём GPU-памяти по сравнению с полным файнтюнингом. После обучения адаптеры можно хранить и переносить отдельно от базовой модели: удобно, когда на одну базу нужно несколько версий под разные задачи.
QLoRA идёт дальше: метод совмещает 4-битное квантование базовой модели с обучением LoRA-адаптеров поверх квантованных весов. Формат квантования — NF4 (NormalFloat 4-bit), разработанный специально для весов нейросетей.
Для управления пиками потребления памяти QLoRA задействует два дополнительных приёма:
- Двойное квантование (double quantization) дополнительно сжимает константы квантования.
- Paged optimizers на базе унифицированной памяти NVIDIA не дают обучению падать из-за кратковременных всплесков потребления при обработке длинных последовательностей.
Объём VRAM для LoRA или QLoRA зависит от размера модели, длины контекста, размера батча и разрядности квантования. Чем длиннее контекст и больше батч, тем выше пиковое потребление сверх базовых весов.
Самый заметный рычаг — разрядность. Загрузка модели в 4-битном формате сокращает объём памяти под веса в разы по сравнению с 16-битной загрузкой. Именно за счёт этого QLoRA открывает дорогу к обучению больших моделей на GPU с ограниченной памятью. Ориентир: модель на 65 млрд параметров умещается на одном GPU с 48 ГБ VRAM при использовании QLoRA. Для полного файнтюнинга или LoRA без квантования такого объёма на одной карте обычно не хватает.
При выборе конфигурации стоит начинать с вопроса «влезает ли модель в 4-битном виде в доступный GPU», а уже потом подбирать длину контекста и размер батча под остаток памяти.
24 ГБ VRAM (потребительские GPU)
Рабочий вариант для QLoRA на небольших и средних моделях, где 4-битное квантование делает задачу посильной для одной карты.
40–48 ГБ VRAM (профессиональные и датацентровые GPU)
Диапазон, в котором доступны и LoRA, и QLoRA для моделей среднего размера. Именно на GPU с 48 ГБ авторы QLoRA дообучали модель на 65 млрд параметров.
80 ГБ VRAM (топовые датацентровые GPU)
Запас памяти для LoRA на крупных моделях и увеличенного батча, когда важна скорость обучения, а не только факт, что модель помещается в память.
Для практического запуска LoRA и QLoRA не нужно писать реализацию с нуля — есть готовая экосистема:
- Hugging Face PEFT — библиотека с реализациями параметрически-эффективных методов дообучения, включая LoRA и QLoRA, интегрированная с моделями из Transformers.
- bitsandbytes — открытая библиотека для 8-битного и 4-битного квантования весов нейросетей, на которой построена реализация QLoRA.
Насколько связка сохраняет качество, показывает модель Guanaco, дообученная методом QLoRA: на бенчмарке Vicuna она достигает результата, близкого к ChatGPT. Экономия памяти не означает автоматической потери качества.
Выбор между LoRA и QLoRA — выбор между двумя ограничениями. LoRA на несжатой модели обучается быстрее: нет накладных расходов на квантование и деквантование при прямом и обратном проходе. QLoRA обучается медленнее, но резко снижает требования к VRAM — часто решающий фактор, когда доступного GPU с большим объёмом памяти попросту нет.
Практический вывод для ограниченного бюджета: QLoRA на GPU с меньшим объёмом памяти часто выгоднее, чем LoRA на более дорогой карте с большим VRAM. Экономия на аренде или покупке карты обычно перевешивает потери в скорости обучения — особенно если модель укладывается в доступную память только благодаря квантованию.
Отдельный способ снизить порог входа — аренда GPU-инстансов в облаке. Она снимает необходимость покупки оборудования и даёт возможность платить только за фактическое время обучения, а не за простаивающую карту между экспериментами.
Оставьте заявку, чтобы получить консультацию
Наши специалисты свяжутся с вами в ближайшее время и ответят на все вопросы.
Узнавайте о выходе новых статей в блоге первыми!
Будем держать в курсе новостей и облачных трендов


Почитать по теме

Как писать промпты для нейросетей: структура, техники и примеры

Как работает инференс LLM: от токенизации до генерации ответа

