VK Cloud

DeepSeek: что это такое и как развернуть у себя, локально или в облаке на GPU

2 октября 2026 г.
Александр Иванов
Автор статьи
_blog_head_12.png

DeepSeek — китайская компания, которая с 2025 года публикует веса больших языковых моделей в открытом доступе. Разработчики разворачивают эти модели у себя по трём причинам: данные не уходят внешнему API-провайдеру, нет лимитов на количество запросов, модель можно дообучить под свою задачу. Из статьи вы узнаете, что такое DeepSeek (или, как его часто называют, «дипсик»), чем различаются версии, сколько видеопамяти нужно под конкретную модель, как запустить DeepSeek локально через Ollama и как развернуть его на GPU в облаке через vLLM.

Важно знать

Главное

  • DeepSeek выпускает открытые модели под лицензией MIT: веса можно скачать и использовать в коммерческих проектах без отчислений разработчику.
  • Флагманские модели семейства DeepSeek V4 рассчитаны на серверы с несколькими GPU. На обычном компьютере запускают дистиллированные или квантизованные версии.
  • Для ПК и ноутбука подходит Ollama, для сервера с GPU и продакшен-нагрузки — vLLM или SGLang с OpenAI-совместимым API.
  • Своя инсталляция в облаке снимает вопрос передачи данных внешнему провайдеру и даёт доступ к GPU без покупки железа.

Что такое DeepSeek

DeepSeek — китайская компания-разработчик семейства открытых больших языковых моделей. Она публикует полные веса моделей, а не только доступ через API, и разрешает использовать их в коммерческих продуктах по лицензии MIT.

DeepSeek-R1 вышла в январе 2025 года как открытая рассуждающая модель: она показывает цепочку рассуждений перед финальным ответом. Затем компания выпустила линейку V3.x, а в 2026 году представила архитектурно новое семейство V4. Превью V4 появилось 24 апреля 2026 года, версия V4-Flash-0731 с открытыми весами — 31 июля 2026 года, V4-Pro-0813 стала доступна 12–13 августа 2026 года. 10 сентября 2026 года компания выпустила V4.1-Flash с поддержкой мультимодальности, пока доступную через API.

Для разработчика DeepSeek отличается тремя вещами:

  • Открытые веса. Модели можно скачать и запустить на своём железе.
  • Архитектура Mixture-of-Experts (MoE). На каждом шаге вычислений работает только часть модели, что снижает стоимость инференса при большом общем числе параметров.
  • Режимы с рассуждением и без. Между ними можно переключаться в зависимости от задачи: явное пошаговое рассуждение или быстрый прямой ответ.

Какие модели DeepSeek можно развернуть у себя

Под именем DeepSeek скрывается не одна модель, а линейка версий с разным размером и требованиями к железу.

МодельПараметры (всего / активных)Размер весовГде запускать
DeepSeek-V4-Pro1,6T / 49Bоколо 960 ГБУзел из 8 топовых GPU; для большинства команд доступна только через API
DeepSeek-V4-Flash284B / 13Bот ~130 до ~290 ГБ в зависимости от форматаСервер с несколькими GPU
DeepSeek-R1-Distill (на базе Qwen, Llama)1,5B, 7B, 8B, 14B, 32B, 70Bот ~1 до ~40 ГБ в 4-bitПК, ноутбук, одна GPU

V4-Pro и V4-Flash различаются на порядок: у Pro — 1,6 трлн параметров всего и 49 млрд активных на каждом шаге, у Flash — 284 млрд всего и 13 млрд активных. Обе модели поддерживают контекст до 1 млн токенов и вывод до 384 тыс. токенов. Полные веса V4-Pro занимают около 960 ГБ.

Цифра «13 млрд активных параметров» у V4-Flash порождает самую частую ошибку. Архитектура Mixture-of-Experts устроена так: на каждом шаге вычислений работает только часть «экспертов», выбранных внутренним роутером. У V4-Flash активны 13B параметров из 284B. Но в видеопамяти должны лежать веса всех экспертов, потому что роутер может выбрать любого из них на следующем шаге. Вывод «13B активных, значит, хватит видеокарты на 24 ГБ» неверен: нужна память под все 284B.

Важно знать

Важно знать. Дистиллированные модели DeepSeek-R1-Distill — это другие, более слабые модели на базе Qwen и Llama, обученные повторять ответы DeepSeek-R1. Модель deepseek-r1:7b в Ollama не равна DeepSeek из веб-чата по качеству: это компактная копия, а не урезанная версия оригинала.

схема MoE

схема MoE

Системные требования: сколько видеопамяти нужно для DeepSeek

Выбор модели напрямую зависит от железа.

ЖелезоЧто запуститсяИнструмент
Ноутбук или ПК, 8–16 ГБ памяти, без мощной GPUDistill 1,5B–8B в 4-bit, медленноOllama, LM Studio
GPU 24 ГБ (L4, A30, RTX 4090)Distill 14B–32B в 4-bitOllama, vLLM
GPU 48–80 ГБ (L40S, A100 80GB)Distill 32B в FP16 или 70B в 4-bitvLLM
Несколько GPU 80 ГБ и большеV4-Flash в квантизованных форматахvLLM, SGLang, llama.cpp
Узел из 8 GPU H200 или B200V4-Flash в полном формате, V4-ProvLLM, SGLang

Расход видеопамяти складывается из трёх частей:

  1. Веса модели — фиксированный объём, зависящий от числа параметров и формата хранения.
  2. KV-кэш — растёт вместе с длиной контекста. Диалог на 1 млн токенов требует памяти, которая в разы превышает объём самих весов.
  3. Служебный запас — буферы для промежуточных вычислений.

Отдельная тонкость — формат весов. Нативный формат DeepSeek-V4-Flash — FP4+FP8, он рассчитан на GPU архитектуры Blackwell (B200). На Hopper (H100, H200) применяют FP8-сборку: она занимает около 284 ГБ. На Ampere (A100) поддержка FP8 ограничена, поэтому используют квантизованные сборки GGUF или аналогичные форматы. Какой именно формат V4-Flash реально запускается на A100 80GB и L40S в VK Cloud, стоит уточнить перед развёртыванием.

Как запустить DeepSeek локально на компьютере

Для запуска дистиллированной модели на своём ПК проще всего использовать Ollama.

  1. Установите Ollama для Linux, macOS или Windows с официального сайта ollama.com.
  2. Выберите модель по объёму видеопамяти — ориентируйтесь на таблицу выше.
  3. Запустите модель командой ollama run deepseek-r1:8b. Актуальный тег стоит сверить в библиотеке Ollama на дату запуска.
  4. Обратитесь по API. Ollama поднимает локальный OpenAI-совместимый эндпоинт, к которому можно обращаться обычным запросом curl.
  5. Проверьте, что модель работает на GPU. Команда nvidia-smi покажет занятую видеопамять, ollama ps — список запущенных моделей.

Если терминал не привычен, попробуйте LM Studio: тот же принцип локального запуска, но с графическим интерфейсом.

Как развернуть DeepSeek в облаке на GPU

Когда дистиллированной модели не хватает или нужна продакшен-нагрузка с параллельными запросами, DeepSeek разворачивают на сервере с GPU.

Какую конфигурацию выбрать

Distill-модели умещаются на одной видеокарте: L4, A30, L40S или A100 в зависимости от размера. V4-Flash требует многопроцессорной конфигурации, и формат весов под конкретные GPU стоит проверить заранее (см. раздел про системные требования).

В VK Cloud доступны конфигурации с GPU A100 40GB (до 4 шт.), A100 80GB и A100 80GB SXM4 (до 4 шт.), L4, L40S (до 4 шт.), A30, vGPU. В обучающих материалах упоминаются H200 и V100 — перед заказом уточните в поддержке, какие конфигурации доступны на момент развёртывания. Актуальный список смотрите в шаблонах конфигураций с GPU.

Шаги развёртывания на ВМ с GPU

  1. Создайте ВМ с GPU в консоли VK Cloud, выбрав подходящий шаблон конфигурации.
  2. Проверьте драйвер. Команда nvidia-smi должна показать модель GPU и объём памяти.
  3. Скачайте веса с Hugging Face командой huggingface-cli download, указав репозиторий deepseek-ai. Для distill-модели на 8–14B это минуты, для V4-Flash — часы даже на быстром канале.
  4. Запустите vLLM в Docker с OpenAI-совместимым API. Ключевые параметры:
    • --tensor-parallel-size — число GPU, между которыми делится модель;
    • --max-model-len — ограничение длины контекста (и, как следствие, размера KV-кэша);
    • --gpu-memory-utilization — доля видеопамяти, которую vLLM может занять.
  5. Проверьте сервис запросом curl к эндпоинту /v1/chat/completions.
  6. Закройте порт API правилами группы безопасности: доступ только из своей сети или через балансировщик с авторизацией. Открытый в интернет порт инференса — частая причина утечки данных и вычислительных ресурсов.

Kubernetes

Для продакшен-нагрузки с автоматическим масштабированием DeepSeek разворачивают на GPU-узлах в Managed Kubernetes: под с контейнером vLLM запрашивает ресурс nvidia.com/gpu, кластер масштабирует число подов под нагрузку. Подробнее — в статье GPU в кластере Kubernetes.

Альтернатива vLLM — SGLang, фреймворк с поддержкой развёртывания моделей DeepSeek на нескольких GPU.

Локальный запуск на ПК

Выбирайте, если нужен быстрый тест на своём железе и данные не должны покидать компьютер разработчика.

Облако на GPU

Выбирайте, если нужна продакшен-нагрузка, масштабирование и контроль над тем, куда уходят данные.

API DeepSeek

Выбирайте, если важнее всего скорость старта и доступ к самым сильным версиям модели без забот об инфраструктуре.

КритерийЛокально на ПКСвоя инсталляция в облаке на GPUAPI DeepSeek
Где хранятся данныеНа устройстве пользователяВ контуре компании (облако провайдера)На серверах DeepSeek
Стартовые затратыМинимальные: нужен только ПК с GPUАренда ВМ или GPU-узлов KubernetesМинимальные: регистрация и оплата запросов
Стоимость при постоянной нагрузкеНе растёт, но железо простаивает без задачОплата за занятые GPU-часыРастёт линейно с числом запросов
Доступные моделиDistill-модели; редко V4-Flash в сильной квантизацииВесь модельный ряд при достаточном числе GPUВесь модельный ряд, включая V4-Pro
МасштабированиеОграничено одним устройствомГоризонтальное через Kubernetes или дополнительные ВМУправляется провайдером
Кто обновляет модельРазработчик вручнуюРазработчик вручнуюПровайдер меняет версию за API-эндпоинтом
Сложность запускаНизкая (Ollama, LM Studio)Средняя-высокая (Docker, vLLM, сеть)Минимальная

Про API DeepSeek стоит сказать честно: это самый простой способ получить доступ к флагманским моделям, включая V4-Pro, без возни с инфраструктурой. Но каждый запрос уходит на серверы провайдера — учитывайте это до того, как через API пройдут чувствительные данные.

Безопасность и данные

При работе через API или веб-чат DeepSeek запросы уходят на серверы компании в Китае. Если через модель проходят персональные данные, речь идёт о трансграничной передаче. Прежде чем отправлять такие данные во внешний сервис, сверьтесь с требованиями законодательства о персональных данных и получите консультацию юриста. Этот материал не является юридической консультацией.

При своей инсталляции данные остаются в контуре компании, но ответственность за периметр переходит к вам. API развёрнутой модели нужно закрыть от прямого доступа из интернета так же, как любой внутренний сервис.

Техническая деталь: флаг --trust-remote-code, который иногда требуют библиотеки для загрузки модели, исполняет код из репозитория модели на вашей машине. Веса стоит брать только из официального репозитория deepseek-ai на Hugging Face или из проверенных зеркал.

Модели DeepSeek обучены с ограничениями на отдельные темы, и ответы могут отражать эти ограничения — учитывайте при выборе модели под задачу.

Ограничения

GPU стоят денег даже без нагрузки, если конфигурация занята постоянно. Модели DeepSeek обновляются каждые 1–2 месяца: версия, развёрнутая сегодня, устареет быстрее, чем успеет окупиться. Дистиллированные модели заметно уступают флагманским по качеству ответов, особенно на задачах с рассуждением. Длинный контекст, привлекательный в карточке модели, на практике резко увеличивает расход видеопамяти за счёт роста KV-кэша.

Частые вопросы

DeepSeek бесплатный?

Веса моделей открыты по лицензии MIT и бесплатны для скачивания и коммерческого использования. Платить приходится за железо (своё или арендованное) либо за обращения к API DeepSeek.

Можно ли запустить DeepSeek на ноутбуке без видеокарты?

Да. Через Ollama можно запустить дистиллированную модель на 1,5B–8B параметров в 4-bit квантизации на процессоре, но генерация будет заметно медленнее, чем на GPU.

Сколько видеопамяти нужно для DeepSeek V4?

V4-Flash в зависимости от формата весов требует от ~130 до ~290 ГБ, V4-Pro — около 960 ГБ. Оба варианта предполагают сервер с несколькими GPU.

Чем DeepSeek R1 отличается от V4?

R1 вышла в январе 2025 года как модель с пошаговым рассуждением. Семейство V4, представленное в 2026 году, — новое поколение архитектуры Mixture-of-Experts с версиями Pro и Flash, рассчитанными на разный масштаб инфраструктуры.

Чем Ollama отличается от vLLM?

Ollama удобна для локального запуска на одном компьютере: минимум настройки, графический аналог — LM Studio. vLLM рассчитан на серверный инференс с высокой пропускной способностью и параллельными запросами через OpenAI-совместимый API.

Можно ли использовать DeepSeek в коммерческом проекте?

Да. Лицензия MIT разрешает встраивать веса в коммерческий продукт без отчислений разработчику.

Безопасно ли отправлять данные в DeepSeek через API или веб-чат?

Запросы уходят на серверы компании в Китае. Для чувствительных и персональных данных надёжнее развернуть модель в своём контуре или в облаке.

Короче говоря

Если нужен быстрый тест на своём ПК — ставьте Ollama и дистиллированную модель DeepSeek-R1-Distill подходящего размера.

Если нужна продакшен-нагрузка и контроль над данными — разворачивайте DeepSeek на GPU в облаке VK Cloud через vLLM, начиная с одной видеокарты и масштабируясь по мере роста нагрузки.

Если важнее скорость старта без забот об инфраструктуре — используйте API DeepSeek, помня, что запросы уходят внешнему провайдеру.

Тем, кто строит на базе DeepSeek сценарии с инструментами и внешними вызовами, стоит посмотреть на ИИ-агентов в облаке.

Оставьте заявку, чтобы получить консультацию

Наши специалисты свяжутся с вами в ближайшее время и ответят на все вопросы.

            Узнавайте о выходе новых статей в блоге первыми!

            Будем держать в курсе новостей и облачных трендов

            section-subscribe_2x.png
              section-subscribe_2x.png
              Теги: Большие языковые модели, DeepSeek, Ollama, vLLM, VK Cloud
              Ссылка скопирована
              Поделиться

              Почитать по теме

              _blog_head_10.png
              29 сентября

              Presigned URL в S3: как выдавать временный доступ к объекту без передачи ключей

              _blog_head_21.png
              17 сентября

              Что такое токенизация и почему языковые модели считают текст не так, как человек

              _blog_head_11.png
              8 сентября

              LoRA и QLoRA: как выбрать GPU для файнтюнинга LLM без миллионного бюджета

              40+ готовых сервисов