DeepSeek V4 Flash вышел: локальный запуск и цена API

DeepSeek V4 Flash
DeepSeek V4 Flash локально
DeepSeek V4 Flash API
DeepSeek V4 Flash цена
локальный запуск LLM

Обновлено 31 июля 2026 года.

DeepSeek выпустила официальную версию DeepSeek V4 Flash 0731: её API уже работает в режиме public beta, а веса опубликованы под лицензией MIT. Главный практический плюс релиза — выбор способа эксплуатации. Модель можно развернуть на собственной инфраструктуре и не отправлять запросы внешнему провайдеру. Если своего мощного сервера нет, официальный API стоит очень дёшево: $0,14 за 1 млн входных токенов без кэша и $0,28 за 1 млн выходных токенов.

Но слово «локально» требует оговорки. Это большая MoE-модель, а не LLM для обычного ноутбука с 16–32 ГБ памяти. Официальный production-пример использует четыре ускорителя NVIDIA GB300. Экспериментальные кванты позволяют запускать V4 Flash на машинах примерно со 128 ГБ общей памяти, но ценой скорости, длины контекста и возможной потери качества.

Коротко: DeepSeek V4 Flash — открытая агентная модель с контекстом 1 млн токенов, дешёвым API и реальной возможностью self-hosting. Для быстрого пилота выгоднее API; для приватного контура и стабильной большой нагрузки — локальный сервер или GPU-кластер.

Содержание

Что именно выпустила DeepSeek

31 июля DeepSeek обновила журнал релизов и объявила официальный DeepSeek‑V4‑Flash API в public beta. В запросе используется прежнее имя deepseek-v4-flash, но за ним теперь стоит версия DeepSeek‑V4‑Flash‑0731.

Это не новая архитектура относительно апрельской preview-версии. По словам разработчика, размер и устройство модели остались прежними, а основной прирост получен на этапе дополнительного обучения. Обновление касается Flash API и новых весов; V4 Pro и модели в приложении и веб-интерфейсе не изменились.

Одновременно DeepSeek опубликовала веса V4 Flash 0731 под лицензией MIT. Поэтому релиз интересен не только пользователям облачного сервиса: модель разрешено скачивать, запускать и адаптировать в пределах простой разрешительной лицензии.

Характеристики DeepSeek V4 Flash

Характеристика DeepSeek V4 Flash 0731
Тип текстовая MoE-модель для рассуждений и агентов
Контекст до 1 млн токенов
Максимальный ответ до 384 000 токенов
Режимы reasoning effort low, high, max
API OpenAI Chat Completions, Responses API, Anthropic-совместимый интерфейс
Инструменты tool calls, JSON output, FIM
Лицензия весов MIT
Версия API DeepSeek-V4-Flash-0731, public beta

В исходном семействе V4 Flash заявлены 284 млрд общих и 13 млрд активных параметров. MoE, или смесь экспертов, активирует для каждого токена только часть сети. Это уменьшает вычисления, но не отменяет необходимость хранить большой объём весов в памяти.

Контекст в 1 млн токенов полезен для анализа репозиториев, массивов документации и длинных агентных сессий. На практике максимальный контекст резко увеличивает требования к памяти. Для пилота лучше начинать с 32–64 тысяч токенов и повышать лимит только после измерения качества и затрат.

Почему локальный запуск важен

Открытые веса меняют не только цену. Локальный DeepSeek V4 Flash можно держать внутри корпоративного контура, зафиксировать конкретную версию модели и поставить перед ней собственный API-шлюз.

Self-hosting полезен, когда нужно:

  • не отправлять исходный код, документы и обращения клиентов во внешний API;
  • работать в изолированной сети;
  • контролировать обновления и воспроизводимость ответов;
  • подключить внутреннее логирование, фильтры и разграничение доступа;
  • выдерживать большую постоянную нагрузку без оплаты каждого токена;
  • дообучать или адаптировать модель под свои процессы.

При этом локальная модель не делает систему автоматически безопасной. Серверу всё равно нужны авторизация, изоляция инструментов, защита секретов, журнал действий и подтверждение опасных операций. Особенно это важно для кодовых агентов, которым дают терминал, репозитории и доступ к production.

Как развернуть DeepSeek V4 Flash локально

У релиза есть два практических пути.

Официальный production-путь: vLLM

В карточке модели DeepSeek приводит конфигурацию vLLM с expert parallelism и модулем спекулятивного декодирования DSpark. Сервер запускается командой vllm serve deepseek-ai/DeepSeek-V4-Flash-0731; в официальном рецепте к ней добавлены параметры --trust-remote-code, FP8 для KV-кэша, четыре data-parallel процесса, expert parallelism и DSpark на семь speculative tokens.

После запуска приложение обращается к локальному OpenAI-совместимому endpoint. Для корпоративной установки перед ним стоит добавить аутентификацию, TLS, лимиты запросов и сбор метрик.

Официальный пример рассчитан на один узел с 4×NVIDIA GB300. Это ориентир для быстрого полного инференса, а не минимальное требование для любого запуска.

Домашний и лабораторный путь: GGUF

Для llama.cpp, Ollama и LM Studio сообщество выпускает квантованные GGUF-сборки. Они сжимают веса до двух-трёх бит и позволяют использовать CPU, GPU или общую память Apple Silicon. Например, экспериментальная реализация antirez нацелена на Mac с 128 ГБ RAM.

Здесь важно различать возможность и готовность к production. Кванты и поддержка новой архитектуры быстро меняются, некоторые сборки требуют отдельного fork llama.cpp, а результаты могут отличаться от официального API. Перед внедрением нужно проверить русский язык, tool calls, код, длинный контекст и устойчивость многошаговых задач именно на выбранном кванте.

Какое железо потребуется

Сценарий Реалистичная конфигурация Компромисс
Официальный быстрый инференс GPU-сервер, в примере DeepSeek — 4×GB300 высокая стоимость оборудования
Локальный сервер с квантом около 128 ГБ и более совокупной RAM/VRAM ниже скорость и возможна потеря качества
Обычный ПК 16–64 ГБ полная V4 Flash практически не подходит лучше взять меньшую модель или API
Пилот без инфраструктуры официальный DeepSeek API данные обрабатывает внешний сервис

Активные 13 млрд параметров не означают, что модели достаточно памяти как для обычной 13B LLM. Активируется малая часть экспертов, но хранить требуется гораздо больше весов. Поэтому честный смысл фразы «можно запустить локально» — свой мощный сервер, рабочая станция со 128+ ГБ общей памяти или кластер, а не любой ноутбук.

Сколько стоит DeepSeek V4 Flash API

По официальной таблице цен DeepSeek на 31 июля 2026 года тарифы указаны за 1 млн токенов:

Операция Цена
Вход, попадание в кэш $0,0028
Вход, без попадания в кэш $0,14
Выход $0,28

Это действительно очень дёшево. Запрос с 100 000 новых входных токенов и ответом на 10 000 токенов обойдётся примерно в $0,0168: $0,014 за вход и $0,0028 за выход. При полном попадании входа в кэш тот же расчёт снизится примерно до $0,00308.

Расчёт показывает цену токенов, а не полную стоимость бизнес-задачи. Повторные запуски, длинное reasoning-содержимое, хранение данных и проверка человеком тоже имеют цену. Для управления расходами полезно фиксировать максимальную длину ответа, переиспользовать одинаковый префикс для кэширования и разделять простые и сложные задачи по reasoning_effort.

DeepSeek предупреждает о будущем peak/off-peak режиме. В часы пик — 09:00–12:00 и 14:00–18:00 по Пекину — все позиции будут стоить вдвое дороже. На момент публикации дата включения этого правила ещё не объявлена, поэтому тариф перед массовым запуском следует перепроверить.

Подробнее о выборе провайдера и скрытых расходах читайте в нашем сравнении дешёвых API LLM.

Локально или по API

Критерий Локальный запуск Официальный API
Старт нужны веса, железо и настройка нужен ключ и несколько строк кода
Приватность данные остаются в своём контуре данные уходят провайдеру
Цена пилота высокая очень низкая
Цена большой стабильной нагрузки может быть выгоднее после расчёта TCO растёт вместе с токенами
Обновления контролирует команда контролирует DeepSeek
Масштабирование ответственность команды берёт на себя провайдер

Практичная стратегия — начать с API, собрать 100–500 реальных задач и измерить качество, объём токенов и задержку. После этого можно посчитать TCO собственного сервера: аренду или амортизацию GPU, электричество, работу инженеров, резервирование и мониторинг. Локальный запуск оправдан не лозунгом «без платы за токены», а приватностью, контролем или доказанной экономией на стабильном объёме.

Что изменилось в качестве

DeepSeek заявляет заметный рост агентных возможностей после дополнительного обучения. В опубликованных разработчиком результатах V4 Flash 0731 набрала 82,7 на Terminal Bench 2.1 против 61,8 у preview-версии и 72,1 у V4 Pro Preview. На Toolathlon-Verified результат вырос с 49,7 до 70,3.

Это данные самого поставщика. Для части кодовых задач использовались максимальный reasoning effort и ещё не опубликованный DeepSeek Harness, а два набора DSBench являются внутренними. Поэтому цифры показывают направление улучшения, но не доказывают преимущество на ваших репозиториях.

Перед миграцией проверьте модель на фиксированном наборе задач:

  1. исправление бага в реальном репозитории;
  2. вызов нескольких инструментов с правильными аргументами;
  3. работа с русскими документами;
  4. восстановление после ошибки инструмента;
  5. соблюдение лимитов прав и формата JSON;
  6. стоимость успешно завершённой задачи, включая повторы.

FAQ

Можно ли запустить DeepSeek V4 Flash локально?

Да. Официальные веса DeepSeek V4 Flash 0731 опубликованы под MIT, а DeepSeek даёт инструкции для vLLM. Но полный вариант требует мощного GPU-сервера; экспериментальные кванты обычно ориентируются примерно на 128 ГБ общей памяти и могут уступать API по скорости или качеству.

Сколько памяти нужно для DeepSeek V4 Flash?

Официальный production-пример использует четыре GB300. Для экспериментального домашнего запуска 2-bit GGUF встречается ориентир около 128 ГБ RAM или unified memory. Точный объём зависит от кванта, контекста и распределения между RAM и VRAM.

Сколько стоит DeepSeek V4 Flash API?

На 31 июля 2026 года — $0,14 за 1 млн новых входных токенов, $0,0028 за 1 млн кэшированных входных токенов и $0,28 за 1 млн выходных токенов. DeepSeek планирует двойной тариф в часы пик, но дату его включения ещё не объявила.

DeepSeek V4 Flash — open source?

Точнее говорить «модель с открытыми весами». Репозиторий и веса V4 Flash 0731 доступны под MIT, но открытые веса не означают публикацию полного обучающего датасета и всей производственной инфраструктуры.

Подходит ли DeepSeek V4 Flash для кодовых агентов?

Модель специально улучшали для агентных сценариев, она поддерживает tool calls и Responses API. Результаты DeepSeek на кодовых benchmarks выросли, однако перед production её нужно проверить на собственных репозиториях, правах и инструментах.

Итог

DeepSeek V4 Flash 0731 интересен редким сочетанием: открытые веса для локального развёртывания и API по цене долей доллара за миллион токенов. Это позволяет начать пилот без покупки GPU, а затем перенести модель в свой контур, если приватность, контроль версии или объём нагрузки оправдают инфраструктуру.

Самый разумный следующий шаг — взять 100 реальных задач и протестировать их через API. Если качество подходит, посчитать месячный токен-бюджет и сравнить его с полной стоимостью локального сервера. При текущей цене API self-hosting чаще выбирают ради контроля данных, а не ради мгновенной экономии.

← Все статьи

Комментарии (0)

Пока нет комментариев. Будьте первым!

Оставить комментарий
Регистрация не требуется