VK Cloud

LoRA и QLoRA: как выбрать GPU для файнтюнинга LLM без миллионного бюджета

7 сентября 2026 г.
Александр Иванов
Автор статьи
_blog_head_11.png

Обучить большую языковую модель с нуля могут единицы компаний: нужны кластеры GPU и месяцы вычислений. Дообучить готовую модель под свою задачу реально и на скромных ресурсах — если выбрать правильный метод.

Полный файнтюнинг обновляет все параметры модели. В памяти при этом хранятся не только сами веса, но и градиенты, и состояния оптимизатора для каждого параметра — объём VRAM растёт кратно размеру модели. Для моделей на десятки миллиардов параметров полный файнтюнинг недоступен без дорогого мультикарточного сервера.

Альтернатива — PEFT (Parameter-Efficient Fine-Tuning): семейство подходов, которые замораживают веса базовой модели и обучают лишь небольшую дополнительную часть параметров. Два самых распространённых PEFT-метода для LLM — LoRA и QLoRA.

LoRA (Low-Rank Adaptation) добавляет к весам модели пару компактных матриц A и B, которые обучаются вместо всей исходной матрицы весов. Базовые веса остаются замороженными: обновляются только эти адаптеры.

Схема резко сокращает число обучаемых параметров и объём GPU-памяти по сравнению с полным файнтюнингом. После обучения адаптеры можно хранить и переносить отдельно от базовой модели: удобно, когда на одну базу нужно несколько версий под разные задачи.

QLoRA идёт дальше: метод совмещает 4-битное квантование базовой модели с обучением LoRA-адаптеров поверх квантованных весов. Формат квантования — NF4 (NormalFloat 4-bit), разработанный специально для весов нейросетей.

Для управления пиками потребления памяти QLoRA задействует два дополнительных приёма:

  • Двойное квантование (double quantization) дополнительно сжимает константы квантования.
  • Paged optimizers на базе унифицированной памяти NVIDIA не дают обучению падать из-за кратковременных всплесков потребления при обработке длинных последовательностей.
Важно знать

Авторы метода показали: QLoRA дообучает модель с 65 млрд параметров на одном GPU с 48 ГБ памяти, при этом качество сопоставимо с полным 16-битным файнтюнингом. Без QLoRA такую модель пришлось бы дообучать на нескольких GPU с суммарным объёмом памяти в разы больше.

Объём VRAM для LoRA или QLoRA зависит от размера модели, длины контекста, размера батча и разрядности квантования. Чем длиннее контекст и больше батч, тем выше пиковое потребление сверх базовых весов.

Самый заметный рычаг — разрядность. Загрузка модели в 4-битном формате сокращает объём памяти под веса в разы по сравнению с 16-битной загрузкой. Именно за счёт этого QLoRA открывает дорогу к обучению больших моделей на GPU с ограниченной памятью. Ориентир: модель на 65 млрд параметров умещается на одном GPU с 48 ГБ VRAM при использовании QLoRA. Для полного файнтюнинга или LoRA без квантования такого объёма на одной карте обычно не хватает.

При выборе конфигурации стоит начинать с вопроса «влезает ли модель в 4-битном виде в доступный GPU», а уже потом подбирать длину контекста и размер батча под остаток памяти.

24 ГБ VRAM (потребительские GPU)

Рабочий вариант для QLoRA на небольших и средних моделях, где 4-битное квантование делает задачу посильной для одной карты.

40–48 ГБ VRAM (профессиональные и датацентровые GPU)

Диапазон, в котором доступны и LoRA, и QLoRA для моделей среднего размера. Именно на GPU с 48 ГБ авторы QLoRA дообучали модель на 65 млрд параметров.

80 ГБ VRAM (топовые датацентровые GPU)

Запас памяти для LoRA на крупных моделях и увеличенного батча, когда важна скорость обучения, а не только факт, что модель помещается в память.

Для практического запуска LoRA и QLoRA не нужно писать реализацию с нуля — есть готовая экосистема:

  • Hugging Face PEFT — библиотека с реализациями параметрически-эффективных методов дообучения, включая LoRA и QLoRA, интегрированная с моделями из Transformers.
  • bitsandbytes — открытая библиотека для 8-битного и 4-битного квантования весов нейросетей, на которой построена реализация QLoRA.

Насколько связка сохраняет качество, показывает модель Guanaco, дообученная методом QLoRA: на бенчмарке Vicuna она достигает результата, близкого к ChatGPT. Экономия памяти не означает автоматической потери качества.

Авторы метода QLoRA

исследователи, разработавшие QLoRA

Выбор между LoRA и QLoRA — выбор между двумя ограничениями. LoRA на несжатой модели обучается быстрее: нет накладных расходов на квантование и деквантование при прямом и обратном проходе. QLoRA обучается медленнее, но резко снижает требования к VRAM — часто решающий фактор, когда доступного GPU с большим объёмом памяти попросту нет.

Практический вывод для ограниченного бюджета: QLoRA на GPU с меньшим объёмом памяти часто выгоднее, чем LoRA на более дорогой карте с большим VRAM. Экономия на аренде или покупке карты обычно перевешивает потери в скорости обучения — особенно если модель укладывается в доступную память только благодаря квантованию.

Отдельный способ снизить порог входа — аренда GPU-инстансов в облаке. Она снимает необходимость покупки оборудования и даёт возможность платить только за фактическое время обучения, а не за простаивающую карту между экспериментами.

Оставьте заявку, чтобы получить консультацию

Наши специалисты свяжутся с вами в ближайшее время и ответят на все вопросы.

            Узнавайте о выходе новых статей в блоге первыми!

            Будем держать в курсе новостей и облачных трендов

            section-subscribe_2x.png
              section-subscribe_2x.png
              Теги: машинное обучение, файнтюнинг LLM, LoRA, QLoRA, GPU
              Ссылка скопирована
              Поделиться

              Почитать по теме

              _blog_head_9.png
              7 сентября

              Как писать промпты для нейросетей: структура, техники и примеры

              _blog_head_15.png
              7 сентября

              Как работает инференс LLM: от токенизации до генерации ответа

              _blog_head_8.png
              4 сентября

              Bucket, Object и Key: как устроена модель хранения в S3-совместимых объектных хранилищах

              40+ готовых сервисов