Обновлено 13 августа 2026 года.
DeepSeek V4 Pro — старшая открытая MoE-модель семейства DeepSeek V4: 1,6 трлн параметров всего, 49 млрд активных на токен и контекст до 1 млн токенов. Она ориентирована на reasoning, программирование и длинные агентные задачи. Но есть важная оговорка: в API доступен V4-Pro Preview, а в журнале изменений от 31 июля DeepSeek отдельно сообщил, что официальный релиз Pro «последует скоро». Поэтому текущую версию нельзя считать неизменяемым production-снимком.
Коротко: DeepSeek V4 Pro интересен не только контекстом 1 млн токенов, но и тем, что объединяет thinking/non-thinking, tool calling, OpenAI- и Anthropic-совместимые API и открытые веса. Для массовых простых задач выгоднее V4 Flash; Pro стоит проверять на сложном коде, длинных цепочках инструментов и задачах, где качество важнее задержки.
Статья предназначена для разработчиков, технических руководителей и владельцев AI-продуктов. Мы разбираем подтверждённые характеристики и практику подключения, но не проводим собственный независимый benchmark и не считаем заявления разработчика доказанными на ваших данных.
Содержание
- Что именно выпустила DeepSeek
- Характеристики DeepSeek V4 Pro
- Как устроена новая архитектура
- Что известно о качестве
- Сколько стоит DeepSeek V4 Pro
- Как подключить API
- DeepSeek V4 Pro или Flash
- Можно ли запустить модель локально
- Как проверить модель перед внедрением
- FAQ
- Как AI рассвет помогает внедрять DeepSeek безопасно
- Итог
Что именно выпустила DeepSeek
24 апреля 2026 года DeepSeek открыла preview семейства V4: V4-Pro и V4-Flash. Оба варианта получили открытые веса, контекст 1 млн токенов, thinking и non-thinking режимы, а также доступ через OpenAI Chat Completions и Anthropic API.
Однако статус моделей различается. 31 июля компания обновила только V4-Flash, назвала его публичной beta и зафиксировала, что V4-Pro API и модели в приложении/вебе не изменились. В той же записи сказано, что официальный V4-Pro выйдет позже. Практический вывод: ID deepseek-v4-pro существует и работает, но его поведение пока следует воспринимать как preview и защищать регрессионными тестами.
Это не спор о названии. Если поставщик обновит плавающий ID без новой интеграции с вашей стороны, агент может иначе выбирать инструменты, форматировать JSON или расходовать reasoning-токены. Для production нужны сохранённые тестовые запросы, допустимые ответы и возможность быстро переключиться на предыдущий маршрут.
Характеристики DeepSeek V4 Pro
| Характеристика | Подтверждённое значение |
|---|---|
| Архитектура | Mixture-of-Experts, 1,6 трлн параметров всего / 49 млрд активных |
| Контекст | до 1 000 000 токенов |
| Максимальный вывод в API | до 384 000 токенов |
| Вход | текст; image input в официальной таблице API не заявлен |
| Режимы | thinking по умолчанию и non-thinking |
| Инструменты | tool calls, JSON output, prefix completion и FIM для non-thinking |
| API | OpenAI Chat Completions и Anthropic-совместимый интерфейс |
| Открытые веса | опубликованы на Hugging Face |
| Статус на 13 августа | V4-Pro Preview; официальный Pro анонсирован, но не зафиксирован как вышедший |
Контекст 1 млн — это предел входа, а не гарантия одинаковой точности на всём окне. В разборе технического отчёта Hugging Face отмечает, что в тесте MRCR с восемью «иглами» V4-Pro-Max сохранял результат выше 0,82 до 256 тыс. токенов, но на 1 млн показатель снижался до 0,59. Это всё ещё сильный результат, однако он показывает: большой лимит не отменяет поиск, RAG и отбор релевантных файлов.
Как устроена новая архитектура
DeepSeek V4 сочетает два механизма внимания. Compressed Sparse Attention (CSA) сначала сжимает последовательность в четыре раза, а затем выбирает наиболее релевантные блоки. Heavily Compressed Attention (HCA) сжимает поток в 128 раз и применяет плотное внимание уже к короткому представлению.
В 61-слойной V4-Pro эти механизмы чередуются. По данным технического отчёта, такая схема снижает вычисления на один генерируемый токен до 27% от DeepSeek V3.2, а размер KV-кэша — до 10% при длинном контексте. Это показатели разработчика архитектуры, не независимый замер AI рассвет.
Для пользователя эффект проявляется в трёх местах:
- длинная история агента реже упирается в память KV-кэша;
- в контекст можно поместить крупный репозиторий или набор документов;
- собственный запуск всё равно требует серверного кластера: открытые веса не превращают 1,6-триллионную модель в решение для ноутбука.
Что известно о качестве
DeepSeek позиционирует V4-Pro прежде всего как агентную модель. В независимом пересказе технического отчёта Hugging Face приведены следующие результаты V4-Pro-Max:
| Тест | Результат V4-Pro-Max | Как читать |
|---|---|---|
| Terminal Bench 2.0 | 67,9 | ниже GPT-5.4-xHigh 75,1 и Gemini 3.1 Pro 68,5 в таблице отчёта |
| SWE Verified | 80,6 | рядом с Opus 4.6 Max 80,8 и Gemini 3.1 Pro 80,6 |
| MCPAtlas Public | 73,6 | рядом с Opus 4.6 Max 73,8 |
| Toolathlon | 51,8 | выше нескольких указанных в отчёте конкурентов |
Эти цифры полезны для отбора кандидата, но недостаточны для закупки. Конфигурация harness, reasoning effort, разрешённые инструменты и число попыток могут изменить итог сильнее, чем разница в несколько десятых. AP также приводит мнение аналитика Morningstar: независимые оценки нужны до окончательных выводов о конкурентоспособности V4.
Сколько стоит DeepSeek V4 Pro
По официальной таблице цен на 13 августа 2026 года тариф за 1 млн токенов такой:
| Тип токенов | V4 Pro | V4 Flash |
|---|---|---|
| Вход, cache hit | $0,003625 | $0,0028 |
| Вход, cache miss | $0,435 | $0,14 |
| Выход | $0,87 | $0,28 |
Пример: запрос с 100 000 некэшированных входных токенов и 20 000 выходных токенов стоит 0,1 × $0,435 + 0,02 × $0,87 = $0,0609. Это расчёт по публичному тарифу, без учёта повторов, инструментов, сетевых расходов и человеческой проверки. Цена может измениться, поэтому production-смета должна читать актуальный прайс, а не копировать число из статьи навсегда.
Самая дорогая ошибка — считать только один удачный вызов. Для агента учитывайте повторную передачу истории, неудачные tool calls, длинное reasoning, ретраи и стоимость проверки результата. Полезная метрика — стоимость принятой задачи: общие расходы делятся на число результатов, прошедших ваши критерии.
Как подключить API
Для OpenAI-совместимого клиента достаточно оставить базовый URL DeepSeek и указать новый model ID:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Найди причину ошибки и предложи тест."}],
stream=False,
)
print(response.choices[0].message.content)
Ключ нельзя хранить в репозитории. Для многоходового thinking DeepSeek требует возвращать reasoning_content в истории сообщения отдельно от обычного content. Если библиотека удаляет это поле, поведение агента может деградировать или запрос завершится ошибкой.
Минимальный production-контур включает таймаут, ограничение параллелизма, лимит токенов, журнал tool calls, фильтрацию секретов и подтверждение необратимых действий. Официальный лимит конкурентных соединений для V4 Pro — 500 на аккаунт, но фактическую пропускную способность нужно измерить на своих длинах контекста.
DeepSeek V4 Pro или Flash
| Сценарий | Выбор | Причина |
|---|---|---|
| Классификация, извлечение, короткий FAQ | V4 Flash | ниже цена и выше лимит параллелизма |
| Простой агент с короткими инструментами | сначала V4 Flash | DeepSeek заявляет близость к Pro на простых agent tasks |
| Сложная отладка и изменение нескольких модулей | тестировать V4 Pro | старшая модель ориентирована на reasoning и coding |
| Длинная цепочка инструментов и крупный контекст | тестировать обе | лимит одинаков, но качество и стоимость нужно измерять |
| Собственный сервер с ограниченным бюджетом GPU | не начинать с полного Pro | масштаб весов требует большой инфраструктуры |
Лучший маршрут — каскад: Flash получает простые задачи, Pro подключается после классификатора или при неудаче. Такой дизайн нужно сравнивать с единой моделью по доле принятых задач, задержке p50/p95 и полной стоимости.
Можно ли запустить модель локально
Да, веса опубликованы, но слово «локально» здесь означает кластер, а не рабочую станцию. Полный instruct-checkpoint использует смешанный FP4/FP8 формат и насчитывает 1,6 трлн общих параметров. Рецепт vLLM для V4-Pro указывает распределённый запуск на нескольких NVIDIA GB200/GB300 или эквивалентной инфраструктуре.
Для компании остаются три реалистичных пути: официальный API, специализированный облачный провайдер или собственный GPU-кластер с командой, которая умеет обслуживать distributed inference. Сравнивать их нужно по требованиям к данным, доступности, стоимости владения и способности обновлять модель без простоя.
Как проверить модель перед внедрением
Соберите 50–100 обезличенных реальных задач и заранее определите критерий успеха. Это рекомендуемый размер пилота, а не универсальная статистическая гарантия.
- Разделите набор на короткие ответы, код, длинные документы и tool use.
- Запустите V4 Flash и V4 Pro в одинаковом harness и с одинаковыми правами.
- Зафиксируйте model ID, дату, параметры, число попыток и доступные инструменты.
- Измерьте принятие результата человеком, задержку p50/p95, токены и ретраи.
- Проверьте prompt injection в документах, утечки секретов и опасные tool calls.
- Повторите ключевые тесты после каждого обновления preview.
Не передавайте реальные персональные данные только ради демонстрации. Сначала определите регион обработки, срок хранения, журналирование и правила удаления. Для платежей, удаления данных и production-деплоя оставьте человеческое подтверждение.
FAQ
DeepSeek V4 Pro уже вышел?
Preview вышел 24 апреля 2026 года и доступен по API и в открытых весах. На 31 июля DeepSeek отдельно сообщил, что официальный релиз V4-Pro последует позже; поэтому на 13 августа корректнее говорить о доступном V4-Pro Preview.
Какой контекст у DeepSeek V4 Pro?
Официальный лимит — 1 млн токенов, максимальный вывод — до 384 тыс. токенов. Это технический потолок, а не гарантия одинаковой точности во всех позициях длинного контекста.
Сколько стоит API DeepSeek V4 Pro?
На 13 августа 2026 года 1 млн входных токенов стоит $0,003625 при попадании в кэш и $0,435 без кэша; 1 млн выходных — $0,87. DeepSeek может менять цены.
Есть ли у DeepSeek V4 Pro tool calling?
Да. Официальная API-таблица подтверждает tool calls и JSON output. Безопасность разрешений, проверка аргументов и подтверждение опасных действий остаются обязанностью вашего приложения.
Чем V4 Pro отличается от V4 Flash?
Pro значительно крупнее: 1,6 трлн общих и 49 млрд активных параметров против 284/13 млрд у Flash. Flash дешевле и рассчитан на быстрые массовые задачи; Pro — на сложное reasoning и агентное программирование.
Как AI рассвет помогает внедрять DeepSeek безопасно
AI рассвет может связать выбор модели с конкретным процессом: подготовить тестовый набор и критерии приёмки, спроектировать RAG и контур данных, интегрировать агента с корпоративными системами и настроить проверку опасных действий. Если данные нельзя отправлять во внешний API, команда может оценить on-premise вариант и требования к инфраструктуре.
Реалистичный первый шаг — выбрать один процесс, зафиксировать текущую базовую линию, источники данных, ограничения и критерий приёмки. Обсудить задачу.
Итог
DeepSeek V4 Pro — амбициозная открытая модель для длинных и агентных задач: 1,6 трлн параметров, 49 млрд активных, контекст 1 млн и совместимость с двумя популярными API-форматами. Её текущие цены заметно ниже многих закрытых frontier API, а открытые веса дают контроль над размещением.
Но на 13 августа речь всё ещё идёт о preview, а красивые benchmark-цифры в основном происходят из технического отчёта разработчика. Рациональный выбор — не миграция «по таблице», а одинаковый пилот V4 Pro и Flash на реальных задачах, с измерением принятия, задержки, токенов, ретраев и рисков.