Как развернуть DeepSeek в облаке на GPU
Когда дистиллированной модели не хватает или нужна продакшен-нагрузка с параллельными запросами, DeepSeek разворачивают на сервере с GPU.
Какую конфигурацию выбрать
Distill-модели умещаются на одной видеокарте: L4, A30, L40S или A100 в зависимости от размера. V4-Flash требует многопроцессорной конфигурации, и формат весов под конкретные GPU стоит проверить заранее (см. раздел про системные требования).
В VK Cloud доступны конфигурации с GPU A100 40GB (до 4 шт.), A100 80GB и A100 80GB SXM4 (до 4 шт.), L4, L40S (до 4 шт.), A30, vGPU. В обучающих материалах упоминаются H200 и V100 — перед заказом уточните в поддержке, какие конфигурации доступны на момент развёртывания. Актуальный список смотрите в шаблонах конфигураций с GPU.
Шаги развёртывания на ВМ с GPU
- Создайте ВМ с GPU в консоли VK Cloud, выбрав подходящий шаблон конфигурации.
- Проверьте драйвер. Команда nvidia-smi должна показать модель GPU и объём памяти.
- Скачайте веса с Hugging Face командой huggingface-cli download, указав репозиторий deepseek-ai. Для distill-модели на 8–14B это минуты, для V4-Flash — часы даже на быстром канале.
- Запустите vLLM в Docker с OpenAI-совместимым API. Ключевые параметры:
- --tensor-parallel-size — число GPU, между которыми делится модель;
- --max-model-len — ограничение длины контекста (и, как следствие, размера KV-кэша);
- --gpu-memory-utilization — доля видеопамяти, которую vLLM может занять.
- Проверьте сервис запросом curl к эндпоинту /v1/chat/completions.
- Закройте порт API правилами группы безопасности: доступ только из своей сети или через балансировщик с авторизацией. Открытый в интернет порт инференса — частая причина утечки данных и вычислительных ресурсов.
Kubernetes
Для продакшен-нагрузки с автоматическим масштабированием DeepSeek разворачивают на GPU-узлах в Managed Kubernetes: под с контейнером vLLM запрашивает ресурс nvidia.com/gpu, кластер масштабирует число подов под нагрузку. Подробнее — в статье GPU в кластере Kubernetes.
Альтернатива vLLM — SGLang, фреймворк с поддержкой развёртывания моделей DeepSeek на нескольких GPU.